これまで、PDF の文字を手作業で抜き出すしかなく、結果は文字化けだらけ。しかも LLM にも理解できないという苦行の日々——
ついに終わりを迎えます!

Y Combinator が支援する注目プロジェクト Firecrawl のチームが、最近すごいツールを発表しました。
共同創業者兼 CTO の Nicolas Camara 氏は、最新開発の OCR It を使えば、コピーできない PDF ファイルからわずか 20 ミリ秒ですべての文字を抽出し、AI が理解できる、見やすい Markdown 形式に変換できると発表しました。

20 ミリ秒とは、どのくらいの速さなのでしょうか?
「確定」をクリックした直後、まばたきする暇もないうちに、処理済みの Markdown ファイルがきれいな状態で手元に届く——それほどの速さです。
しかもインターネット接続は不要で、内蔵の Tesseract を使って 100% オフラインで実行できます。
このたびオープンソースとして公開された OCR ツールは、リリース後まもなく、GitHub で大きな注目を集めました。
Nicolas Camara 氏は、処理品質が Docling と同等であるにもかかわらず、OCR It の処理速度は Docling より約 300 倍速いと誇らしげに語っています。

実際に試したユーザーたちも、X 上で次々とコメントを寄せています。
速い。本当に速い!



OCR It の使い方
まず、OCR It はChrome と Firefox に対応した無料のブラウザー拡張機能です。
一度範囲を選択すれば、その後はショートカットキーを押すたびに(または自動モードを有効にするだけで)、本全体やドキュメント全体を、完全かつ編集可能なプレーンテキストに変換できます。そのまま AI に渡して要約させたり、質問したりするのに便利です。
処理中、OCR It は同じページを連続して 2 回認識した場合、ページ送りができなくなった場合、OCR に失敗した場合、または 300 ページの上限に達した場合に自動停止します。これにより、最終ページを無限に繰り返し取得してしまうのを防げます。

具体的な操作手順は、手動モードと自動モードでそれぞれ次のとおりです。
注:Windows および Linux を使用している場合は、Option キーを Alt キーに置き換えてください。
1. 手動モード
範囲選択と認識
まず Option+Shift+R を押して、認識したい文字の範囲を選択します。選択範囲に問題がないことを確認したら、Enter を押して保存してください。
文字範囲の選択が完了したら、Option+Shift+S を 1 回押します。OCR It が現在のページの認識を開始し、認識が完了すると自動的に次のページへ移動します。
あとは、ドキュメント全体の認識が終わるまで、この操作を繰り返すだけです。
さらに時間を短縮したい場合は、ページをめくりながら各ページで Option+Shift+S を 1 回ずつ押すこともできます。システムがすぐにスクリーンショットを撮影し、認識タスクをバックグラウンドで自動的にキューへ追加してくれます。

確認
すべてのページの認識が完了したら、拡張機能のパネルでテキストを確認・修正できます。また、特定のページだけを再認識することも可能です。最後に 「Copy all」 または 「Download .txt」 を選択して全文をエクスポートすれば、作業は完了です。

2. 自動モード
自動モードはさらに簡単です。Option+Shift+A を押すか、「Start auto-run」 をクリックするだけで、OCR It が「スクリーンショット撮影—OCR—ページ送り」を自動的に繰り返し、ドキュメントの最後まで処理します。
**途中で処理を終了したい場合は、Esc キーを押してください。**確認の手順は、基本的に手動モードと同じです。
また、OCR It のリポジトリ画面によると、API Key もインターネット接続も不要です。インストール時にウェブサイトの権限を要求することもありません。自動実行やクロスオリジン iframe の操作が必要な場合に限り、現在のサイトに対する権限を必要に応じて申請します。
なお、ブラウザーに内蔵された PDF ビューアーは現在、自動ページ送りに対応していません。そのため、このタイプの PDF を処理する場合は、なるべく手動モードを使用してください。
複雑なタスクの処理はまだ安定しない
ただし、OCR It は速くて便利に見える一方で、「今後はすべての PDF を任せておけば安心」と言える段階には、まだほど遠いのが現状です。

ユーザーによる実際の検証を通じて、次のような共通認識が得られています。
OCR It は現時点でも、レイアウトがシンプルで文字が鮮明な PDF ドキュメントなら比較的スムーズに処理できます。しかし、見出し、脚注、表、数式、本文の段落が混在する複雑なページの処理は、まだ十分に得意ではありません。そのため、改善の余地はまだ大きく残されています。

参考リンク:
[1] https://x.com/nickscamara_/status/2083295265793212827
