インデックスと OCR
更新日 2026年8月5日
Theca に書籍をアップロードするのは最初のステップです。検索したり要約を生成したりする前に、書籍はインデックス処理を経る必要があります。この記事では、その処理中に何が起きるか、アプリが表示するステータスの読み方を説明します。
処理が必要な理由
Theca の検索は生のファイルに対して動作しません。システムはテキストを抽出してフラグメントに分割し、正確な言葉を覚えていなくても関連する文章を見つけられるような表現を構築します。この処理なしでは、書籍の閲覧とダウンロードしかできません。
アプリが表示するステータス
各書籍には、カードと詳細パネルにステータスインジケーターが表示されます:
- 保留中 — 書籍はまだ処理キューに入っていません。
- キュー中 — 書籍は順番を待っています。
- 処理中 — インデックス作成が進行中です。インジケーターには進捗数が表示される場合があります(例:「処理中 4/10」)。
- 処理済み — 書籍は検索と要約に対応した状態です。
- エラー — 再試行 — 何か失敗しました。詳細パネルの 再試行 ボタンで再度お試しください。
書籍を手動でキューに追加するには、詳細パネルを開いて 処理 をクリックします。保留中の書籍をすべて一度にキューに追加するには、ツールバーの すべて処理 ボタンを使用します。
スキャンされた PDF:特殊なケース
PDF はテキストレイヤーのない画像だけで構成されている場合があります。これはスキャンと呼ばれます。Theca はこれを自動的に検出し、スキャン、テキストなし というステータスを表示します。
その状態の書籍は閲覧とダウンロードはできますが、抽出するテキストがないためそのままではインデックス作成できません。検索を有効にするには、光学文字認識(OCR)を使用する必要があります:
- 書籍の詳細パネルを開きます。
- テキストを抽出(OCR) をクリックします。
OCR は各ページを画像として解析してテキストを抽出します。この処理は通常のインデックス作成よりも大幅に時間がかかります。特に長い書籍の場合はなおさらです。実行中はステータスが 抽出中… に変わります。
OCR にはクールダウン期間があります。起動直後にキャンセルした場合、再開するまで数分待つ必要があります。
機能バッジ
書籍が処理されると、認識されたコンテンツの種類を示す追加バッジが表示される場合があります:
- OCR — テキストが光学認識で抽出されました(書籍がスキャンでした)。
- 数式 — 書籍に認識された数学または化学の表記が含まれています。
これらのバッジにより、書籍を検索・要約するときに何が期待できるかがわかります。
書籍にエラーが表示された場合の対処法
ステータスに エラー — 再試行 と表示された場合は、詳細パネルを開いて 再試行 をクリックしてください。数回試みてもエラーが続く場合は、ファイルをダウンロードしてデバイスで開き、破損していないか確認してください。
よくある質問
通常のインデックス作成にはどのくらいかかりますか? 書籍のサイズとシステムの負荷によって異なります。標準的な長さの書籍であれば、通常は数分で完了します。
OCR はどうですか? OCR は各ページを画像として解析するため、通常のインデックス作成より大幅に時間がかかります。長い書籍は数分かかる場合があります。
処理中に書籍を読むことはできますか? はい。インデックスのステータスに関係なく、リーダーでいつでも開くことができます。
書籍が「キュー中」または「処理中」のまま長時間変わりません。正常ですか? システムの活動が多い時間帯は時間がかかる場合があります。長時間経過してもステータスが進まない場合は、詳細パネルから 再試行 をクリックしてみてください。
次のステップ
- ライブラリを検索する — 書籍が処理された後の検索の仕組み。
- 要約 — インデックス済みの書籍から引用付きの要約を生成する方法。
- ライブラリ — ライブラリの基本に戻る。