コンテンツにスキップ
メインサイト ニュース コンソール

20msでPDFをMarkdownに変換、オープンソースOCRツールが約300倍高速化

· 量子位
国内AI

これまで、PDF の文字を手作業で抜き出すしかなく、結果は文字化けだらけ。しかも LLM にも理解できないという苦行の日々——

ついに終わりを迎えます!

画像

Y Combinator が支援する注目プロジェクト Firecrawl のチームが、最近すごいツールを発表しました。

共同創業者兼 CTO の Nicolas Camara 氏は、最新開発の OCR It を使えば、コピーできない PDF ファイルからわずか 20 ミリ秒ですべての文字を抽出し、AI が理解できる、見やすい Markdown 形式に変換できると発表しました。

画像

20 ミリ秒とは、どのくらいの速さなのでしょうか?

「確定」をクリックした直後、まばたきする暇もないうちに、処理済みの Markdown ファイルがきれいな状態で手元に届く——それほどの速さです。

しかもインターネット接続は不要で、内蔵の Tesseract を使って 100% オフラインで実行できます。

このたびオープンソースとして公開された OCR ツールは、リリース後まもなく、GitHub で大きな注目を集めました。

Nicolas Camara 氏は、処理品質が Docling と同等であるにもかかわらず、OCR It の処理速度は Docling より約 300 倍速いと誇らしげに語っています。

画像

実際に試したユーザーたちも、X 上で次々とコメントを寄せています。

速い。本当に速い!👍

画像

画像

画像

OCR It の使い方

まず、OCR It はChrome と Firefox に対応した無料のブラウザー拡張機能です。

一度範囲を選択すれば、その後はショートカットキーを押すたびに(または自動モードを有効にするだけで)、本全体やドキュメント全体を、完全かつ編集可能なプレーンテキストに変換できます。そのまま AI に渡して要約させたり、質問したりするのに便利です。

処理中、OCR It は同じページを連続して 2 回認識した場合、ページ送りができなくなった場合、OCR に失敗した場合、または 300 ページの上限に達した場合に自動停止します。これにより、最終ページを無限に繰り返し取得してしまうのを防げます。

画像

具体的な操作手順は、手動モードと自動モードでそれぞれ次のとおりです。

注:Windows および Linux を使用している場合は、Option キーを Alt キーに置き換えてください。

1. 手動モード

範囲選択と認識

まず Option+Shift+R を押して、認識したい文字の範囲を選択します。選択範囲に問題がないことを確認したら、Enter を押して保存してください。

文字範囲の選択が完了したら、Option+Shift+S を 1 回押します。OCR It が現在のページの認識を開始し、認識が完了すると自動的に次のページへ移動します。

あとは、ドキュメント全体の認識が終わるまで、この操作を繰り返すだけです。

さらに時間を短縮したい場合は、ページをめくりながら各ページで Option+Shift+S を 1 回ずつ押すこともできます。システムがすぐにスクリーンショットを撮影し、認識タスクをバックグラウンドで自動的にキューへ追加してくれます。

画像

確認

すべてのページの認識が完了したら、拡張機能のパネルでテキストを確認・修正できます。また、特定のページだけを再認識することも可能です。最後に 「Copy all」 または 「Download .txt」 を選択して全文をエクスポートすれば、作業は完了です。

2. 自動モード

自動モードはさらに簡単です。Option+Shift+A を押すか、「Start auto-run」 をクリックするだけで、OCR It が「スクリーンショット撮影—OCR—ページ送り」を自動的に繰り返し、ドキュメントの最後まで処理します。

**途中で処理を終了したい場合は、Esc キーを押してください。**確認の手順は、基本的に手動モードと同じです。

また、OCR It のリポジトリ画面によると、API Key もインターネット接続も不要です。インストール時にウェブサイトの権限を要求することもありません。自動実行やクロスオリジン iframe の操作が必要な場合に限り、現在のサイトに対する権限を必要に応じて申請します。

なお、ブラウザーに内蔵された PDF ビューアーは現在、自動ページ送りに対応していません。そのため、このタイプの PDF を処理する場合は、なるべく手動モードを使用してください。

複雑なタスクの処理はまだ安定しない

ただし、OCR It は速くて便利に見える一方で、「今後はすべての PDF を任せておけば安心」と言える段階には、まだほど遠いのが現状です。

画像

ユーザーによる実際の検証を通じて、次のような共通認識が得られています。

OCR It は現時点でも、レイアウトがシンプルで文字が鮮明な PDF ドキュメントなら比較的スムーズに処理できます。しかし、見出し、脚注、表、数式、本文の段落が混在する複雑なページの処理は、まだ十分に得意ではありません。そのため、改善の余地はまだ大きく残されています。

画像

参考リンク:

[1] https://x.com/nickscamara_/status/2083295265793212827

[2] https://github.com/thiagotigaz/ocr-it

[3] https://www.firecrawl.dev/about

#国内AI#Omniapi.co

4All API チームによる投稿

原文リンク:https://www.qbitai.com/2026/08/481075.html

主流 AI モデル API をお探しですか?4All API は OpenAI / Anthropic / Google Gemini / Qwen / DeepSeek など数十種類のモデルを単一の API キーで呼び出せます。公式準拠の価格、エンタープライズ品質の通信路、5 分で接続完了。

4All API コンソールに登録 →