AI に画像を渡して文字を読ませる — OCR は「打ち直し」から卒業できるか
紙の書類やホワイトボードを写真に撮ったあと、その文字をパソコンで打ち直す。 地味だけれど、けっこう面倒な作業ですよね。
この「打ち直し」を肩代わりしてくれるのが OCR(オーシーアール)です。 ひとことでいえば、画像に写った文字を、編集できるテキストに変える技術。
しかも今は、専用ソフトを用意しなくても、AI に画像を渡すだけで使えるようになりました。 この記事では、OCR の基本の流れと、実際に試して分かった「得意なこと・苦手なこと」を、正直なところまで含めて見ていきます。
そもそも OCR とは
OCR は Optical Character Recognition の略で、日本語では「光学文字認識」と呼びます。 むずかしそうな名前ですが、やっていることはシンプルです。
写真やスクショ、スキャンした PDF のように「文字が画像として写っているもの」から文字を読み取り、コピーや検索ができるテキストに起こしてくれます。
たとえば、こんな場面で効きます。
- 会議で撮ったホワイトボードの写真を、そのまま議事録に貼りたい
- 紙のレシートや請求書の数字を、表計算に打ち込みたい
- スクショの中の URL やエラーメッセージを、コピーして検索したい
どれも「見えているのに、選択もコピーもできない」もどかしさ。 そこを埋めるのが OCR です。
昔は専用ソフト、今は AI に画像を渡すだけ
ひと昔前の OCR は、専用ソフトを入れて使うものでした。 読み取る範囲を指定したり、傾きを直したり、うまく認識しない文字を手直ししたり。 「きれいにスキャンした印刷物」を前提にした道具、という印象が強かったです。
いまは、そこがぐっと楽になりました。 スマホの写真アプリは、撮った画像の文字をそのまま長押しでコピーできます。 そして Claude や Gemini のような AI に画像を渡せば、「この画像の文字を書き起こして」と頼むだけで、テキストにしてくれます。
AI に渡すやり方のいいところは、多少雑でも通ることです。 少し傾いた写真、影が入った紙、複数の項目が入り混じったレイアウトでも、そこそこ読んでくれます。 設定をいじる手間がないぶん、初心者にはこちらのほうが入りやすいはずです。
実際にやってみる
AI に読ませる手順は、拍子抜けするほど単純です。
- 読み取りたいものを写真に撮る(またはスクショを用意する)
- Claude や Gemini のチャットに、その画像を貼り付ける
- 「画像の文字をそのまま書き起こして」とお願いする
必要なら、頼み方をひと工夫すると精度が上がります。
- 表なら「表の形(Markdown の表)でまとめて」
- 数字が大事なら「金額や日付は原文どおりに、推測で補わないで」
- 英語混じりなら「英数字はそのまま、日本語は日本語で」
このあたりは、AI への頼み方そのもの。 うまくいくプロンプトの作り方 の考え方が、そのまま活きます。
実際にやってみて
正直な体験も書いておきます。
私が試して「うーん」となったのは、スクショに写った手書きの文字を読ませたときでした。 印刷された文字はスラスラ拾ってくれるのに、人それぞれのクセ字までは読み取ってくれず、あまり活躍してくれなかったのです。 「手書きはやっぱり難しいな」というのが、そのときの実感でした。
しかも、昔ながらの OCR アプリで同じことをすると、その弱さはもっと顕著に出ます。 きれいな印刷物なら頼りになるのに、手書きが混じったとたんにガクッと精度が落ちる。 そう考えると、AI に渡すやり方は「手書きにそこそこ粘る」ぶん、まだマシなほうでした。
なので、期待値はこう持っておくと気が楽です。 印刷・デジタルの文字は任せてよい。手書き、とくにクセの強い字は、読めたらラッキーくらいに構える。
得意なこと・苦手なこと
試してみて感じた「向き・不向き」を、表にまとめておきます。
| 種類 | 読み取りやすさ | ひとこと |
|---|---|---|
| 印刷された文字(本・書類・スクショ) | ◎ | いちばん得意。ほぼそのまま起こせる |
| デジタル表示(画面・スライド) | ◎ | 文字がくっきりしているので強い |
| きれいな手書き(楷書ぎみ) | ○ | 読めることが多いが、確認は必要 |
| クセの強い手書き・走り書き | △ | いちばん苦手。誤読が増える |
| 縦書き・特殊なレイアウト | △ | 順番が入れ替わることがある |
大事なのは、読み取った結果を鵜呑みにしないことです。 とくに金額や日付、固有名詞は、AI が「それっぽく」直してしまうことがあります。 これは ハルシネーション(AI のそれっぽい嘘) と同じ落とし穴なので、大事な数字は元の画像と見比べる習慣をつけると安心です。
苦手をカバーするコツ
苦手だからと諦める前に、ちょっとした工夫で結果が変わることもあります。
- 明るく、まっすぐ撮る:影や傾きが少ないほど精度が上がります
- 解像度を上げる:小さく写った文字は、寄って撮り直すだけで読めることが多いです
- 手書きは清書を挟む:どうしても必要なら、いったん自分で書き起こし、その清書を AI に整えてもらうほうが早い場面もあります
- 裏取りをさせる:「読み取った内容に不自然な点はないか、もう一度確認して」と一言添えると、明らかな誤読に気づきやすくなります
完璧を目指すより、「8 割は AI に任せて、残り 2 割を自分で直す」くらいの分担がちょうどいいです。
RAG と組み合わせると、もう一歩先へ
OCR は、それ単体でも便利ですが、他の仕組みと組み合わせると効いてきます。
たとえば、紙の資料を OCR でテキストにしておけば、その中身を AI に検索させて答えさせる RAG の材料になります。 「棚に眠っていた紙のマニュアル」を、AI に質問できる知識に変えられる、というわけです。
実際、私が出た AI ハッカソンでも、OCR は RAG と並んで「使えて当たり前」の前提の道具として語られていました。 特別な最新技術というより、生活や仕事の下ごしらえに近い存在になりつつあります。
ひとつだけ注意を。 読み取らせる書類に、個人情報や社外秘が写り込んでいないかは、渡す前に確かめてください。 このあたりの線引きは AI に入れてはいけない情報 にまとめてあります。
まとめ
OCR は、画像に写った文字を、編集できるテキストに変える技術です。 そして今は、専用ソフトがなくても、AI に画像を渡すだけで使えます。
- 印刷・デジタルの文字は、ほぼそのまま起こせて強い
- クセの強い手書きは今も苦手。旧来の OCR ソフトだと、その差はもっと大きい
- 大事な数字や固有名詞は、元の画像と見比べて裏取りする
まずは、机の上にある紙を1枚、スマホで撮って AI に渡してみてください。 「打ち直し」から少し解放されるだけでも、日々の作業はぐっと軽くなります。