AI に画像を渡して文字を読ませる — OCR は「打ち直し」から卒業できるか

紙の書類やホワイトボードを写真に撮ったあと、その文字をパソコンで打ち直す。 地味だけれど、けっこう面倒な作業ですよね。

この「打ち直し」を肩代わりしてくれるのが OCR(オーシーアール)です。 ひとことでいえば、画像に写った文字を、編集できるテキストに変える技術

しかも今は、専用ソフトを用意しなくても、AI に画像を渡すだけで使えるようになりました。 この記事では、OCR の基本の流れと、実際に試して分かった「得意なこと・苦手なこと」を、正直なところまで含めて見ていきます。

OCR は画像から文字を取り出す技術。昔は専用ソフトで設定調整が必要だったが、今は AI に画像を渡すだけで使える。ただし手書きの癖字はどちらも苦手という対比図

そもそも OCR とは

OCR は Optical Character Recognition の略で、日本語では「光学文字認識」と呼びます。 むずかしそうな名前ですが、やっていることはシンプルです。

写真やスクショ、スキャンした PDF のように「文字が画像として写っているもの」から文字を読み取り、コピーや検索ができるテキストに起こしてくれます。

たとえば、こんな場面で効きます。

  • 会議で撮ったホワイトボードの写真を、そのまま議事録に貼りたい
  • 紙のレシートや請求書の数字を、表計算に打ち込みたい
  • スクショの中の URL やエラーメッセージを、コピーして検索したい

どれも「見えているのに、選択もコピーもできない」もどかしさ。 そこを埋めるのが OCR です。

昔は専用ソフト、今は AI に画像を渡すだけ

ひと昔前の OCR は、専用ソフトを入れて使うものでした。 読み取る範囲を指定したり、傾きを直したり、うまく認識しない文字を手直ししたり。 「きれいにスキャンした印刷物」を前提にした道具、という印象が強かったです。

いまは、そこがぐっと楽になりました。 スマホの写真アプリは、撮った画像の文字をそのまま長押しでコピーできます。 そして Claude や Gemini のような AI に画像を渡せば、「この画像の文字を書き起こして」と頼むだけで、テキストにしてくれます。

AI に渡すやり方のいいところは、多少雑でも通ることです。 少し傾いた写真、影が入った紙、複数の項目が入り混じったレイアウトでも、そこそこ読んでくれます。 設定をいじる手間がないぶん、初心者にはこちらのほうが入りやすいはずです。

実際にやってみる

AI に読ませる手順は、拍子抜けするほど単純です。

  1. 読み取りたいものを写真に撮る(またはスクショを用意する)
  2. Claude や Gemini のチャットに、その画像を貼り付ける
  3. 「画像の文字をそのまま書き起こして」とお願いする

必要なら、頼み方をひと工夫すると精度が上がります。

  • 表なら「表の形(Markdown の表)でまとめて」
  • 数字が大事なら「金額や日付は原文どおりに、推測で補わないで」
  • 英語混じりなら「英数字はそのまま、日本語は日本語で」

このあたりは、AI への頼み方そのもの。 うまくいくプロンプトの作り方 の考え方が、そのまま活きます。

実際にやってみて

正直な体験も書いておきます。

私が試して「うーん」となったのは、スクショに写った手書きの文字を読ませたときでした。 印刷された文字はスラスラ拾ってくれるのに、人それぞれのクセ字までは読み取ってくれず、あまり活躍してくれなかったのです。 「手書きはやっぱり難しいな」というのが、そのときの実感でした。

しかも、昔ながらの OCR アプリで同じことをすると、その弱さはもっと顕著に出ます。 きれいな印刷物なら頼りになるのに、手書きが混じったとたんにガクッと精度が落ちる。 そう考えると、AI に渡すやり方は「手書きにそこそこ粘る」ぶん、まだマシなほうでした。

なので、期待値はこう持っておくと気が楽です。 印刷・デジタルの文字は任せてよい。手書き、とくにクセの強い字は、読めたらラッキーくらいに構える。

得意なこと・苦手なこと

試してみて感じた「向き・不向き」を、表にまとめておきます。

種類読み取りやすさひとこと
印刷された文字(本・書類・スクショ)いちばん得意。ほぼそのまま起こせる
デジタル表示(画面・スライド)文字がくっきりしているので強い
きれいな手書き(楷書ぎみ)読めることが多いが、確認は必要
クセの強い手書き・走り書きいちばん苦手。誤読が増える
縦書き・特殊なレイアウト順番が入れ替わることがある

大事なのは、読み取った結果を鵜呑みにしないことです。 とくに金額や日付、固有名詞は、AI が「それっぽく」直してしまうことがあります。 これは ハルシネーション(AI のそれっぽい嘘) と同じ落とし穴なので、大事な数字は元の画像と見比べる習慣をつけると安心です。

苦手をカバーするコツ

苦手だからと諦める前に、ちょっとした工夫で結果が変わることもあります。

  • 明るく、まっすぐ撮る:影や傾きが少ないほど精度が上がります
  • 解像度を上げる:小さく写った文字は、寄って撮り直すだけで読めることが多いです
  • 手書きは清書を挟む:どうしても必要なら、いったん自分で書き起こし、その清書を AI に整えてもらうほうが早い場面もあります
  • 裏取りをさせる:「読み取った内容に不自然な点はないか、もう一度確認して」と一言添えると、明らかな誤読に気づきやすくなります

完璧を目指すより、「8 割は AI に任せて、残り 2 割を自分で直す」くらいの分担がちょうどいいです。

RAG と組み合わせると、もう一歩先へ

OCR は、それ単体でも便利ですが、他の仕組みと組み合わせると効いてきます。

たとえば、紙の資料を OCR でテキストにしておけば、その中身を AI に検索させて答えさせる RAG の材料になります。 「棚に眠っていた紙のマニュアル」を、AI に質問できる知識に変えられる、というわけです。

実際、私が出た AI ハッカソンでも、OCR は RAG と並んで「使えて当たり前」の前提の道具として語られていました。 特別な最新技術というより、生活や仕事の下ごしらえに近い存在になりつつあります。

ひとつだけ注意を。 読み取らせる書類に、個人情報や社外秘が写り込んでいないかは、渡す前に確かめてください。 このあたりの線引きは AI に入れてはいけない情報 にまとめてあります。

まとめ

OCR は、画像に写った文字を、編集できるテキストに変える技術です。 そして今は、専用ソフトがなくても、AI に画像を渡すだけで使えます。

  • 印刷・デジタルの文字は、ほぼそのまま起こせて強い
  • クセの強い手書きは今も苦手。旧来の OCR ソフトだと、その差はもっと大きい
  • 大事な数字や固有名詞は、元の画像と見比べて裏取りする

まずは、机の上にある紙を1枚、スマホで撮って AI に渡してみてください。 「打ち直し」から少し解放されるだけでも、日々の作業はぐっと軽くなります。