メインコンテンツにスキップ
自媒科技企業向けAI・開発から導入まで
日本語JA
プロジェクト相談
記事一覧に戻る

PDF翻訳に使えるAIツールは?表・スキャン画像・長文書の扱い方

通常のテキスト PDF は丸ごと翻訳できます。スキャンした文書は最初に OCR 処理する必要があります。テーブルの行と列をチェックする必要があります。長い文書は用語を統一し、章ごとに処理する必要があります。ファイルの種類に応じてツールを選択する必要があります。

この記事は AI によって生成および整理されました。翻訳機能、ファイル制限、サポートされる言語は変更される可能性があります。現在の公式手順を参照してください。重要な文書は専門家によって検討される必要があります。

色の異なる 2 つのドキュメントが短い矢印で接続されており、中央に表の四角形があり、PDF の翻訳時にテキストとレイアウトが同時に処理されることを示しています。

まず PDF がテキストであるか画像であるかを判断します

まず答えについて話しましょう。通常のテキスト PDF、Google 翻訳、DeepL を直接試すことができます。いくつかのページを選択して Acrobat ワークフローで処理を続行したい場合は、Acrobat の PDF 翻訳を確認できます。スキャンした文書の場合は、まずテキストが認識できるかどうかを確認する必要があります。表や長い文書の場合、翻訳がスムーズかどうかを確認するだけでなく、形式、用語、ページの欠落なども確認できます。

ツールを選択する前に、マウスでテキストをドラッグします。テキストを選択できることと、ページ全体が単なる画像であることは、2 つのまったく異なる PDF です。

いわゆる「PDF 翻訳の失敗」の多くは、翻訳モデルが言語を理解できないことが原因ではなく、ツールがテキストをまったく正しく読み取れなかったり、翻訳が長すぎて元の表やページが収まらなかったりすることが原因です。

通常のテキスト PDF: 最初に文書全体を翻訳します

テキストがコピーでき、ページが連続した段落で占められている場合、最も簡単な方法は、文書全体を文書翻訳ツールに渡すことです。 Google 翻訳は現在、PDF、DOCX、PPTX、XLSX のアップロードと、翻訳されたドキュメントのダウンロードをサポートしています。公的な制限として、ファイルは 10 MB を超えてはならず、PDF は 300 ページを超えてはならず、文書翻訳は小さな画面や携帯電話をサポートしていないことが挙げられます。

DeepL は、Web アプリケーションとデスクトップ アプリケーションの両方で使用できる PDF ファイルの翻訳も提供します。プランが異なれば、ファイル時間とダウンロード形式も異なります。一部の有料プランでは、翻訳された PDF を DOCX としてダウンロードして、継続的に修正することができます。 DeepL 関係者は、PDF の結果が満足できない場合は、オリジナルの DOCX または PPTX をアップロードしてみることも推奨しています。

したがって、通常のテキストが数ページしかない場合は、まず翻訳全体を直接ダウンロードできるツールを試すだけで十分です。最初に各ページをチャット ウィンドウにコピーしないでください。タイトルの階層、ページ番号、段落の関係が失われます。

画像 PDF をスキャン: 最初にテキストを認識してから翻訳します

スキャンした PDF は文字が含まれているように見えますが、実際には一連の画像である可能性があります。 Google 翻訳は、画像やスキャンしたページのテキストが出力ファイルに含まれるが、テキストは翻訳されないと明確に述べています。 Adobe はまた、スキャンされた PDF、暗号化された PDF、大きすぎる PDF、または複雑な構造を持つ PDF は翻訳をスキップする可能性があると説明しています。

DeepLはスキャンした文書を処理できるが、当局はスキャンの品質が翻訳の品質に影響を与えると注意を喚起している。歪み、ぼやけ、低コントラスト、手書きの注釈はすべて、テキスト認識でエラーを引き起こし、翻訳にエラーを引き起こす可能性があります。

  1. まずズームインして、テキストの端がはっきりしているかどうか、ページが傾いていたり影がかかっていないかどうかを確認します。
  2. まず OCR を実行して、画像を検索およびコピーできるテキストに変換します。
  3. 名前、番号、単位、タイトルをランダムにチェックして、識別に間違った行がないことを確認します。
  4. もう一度翻訳して元のスキャンを保存し、ページごとに翻訳と比較します。

OCR が「0」を「O」として認識した場合、翻訳ソフトウェアはオリジナルが間違って書かれたものであることを認識できません。スキャンしたドキュメントで最初にテストするのは、言語スタイルではなく認識です。

表 PDF: 翻訳が正しいだけでは十分ではなく、行と列も間違っている必要があります

表の難しさは、各単語を別の言語に翻訳することではなく、行と列の関係を維持することです。多くの場合、翻訳は元のテキストより長くなり、セルが折り返され、列幅が変更され、ヘッダーが次のページにはみ出してしまう場合があります。財務テーブル、パラメータ テーブル、およびスケジュールでは、次の行に続く数値をまだ許容できません。

このタイプのファイルは、オリジナルの Excel、Word、または写植ファイルを優先します。 DeepL関係者は、PDFの品質が満足できない場合には、元の文書をアップロードすることも推奨しています。 PDF のみがある場合は、まず全体のレイアウトを維持して翻訳全体を翻訳し、次に表のヘッダー、行と列、数値、単位、脚注、およびページにまたがるコンテンツを表ごとに確認できます。

  • ランダムに 3 行を選択し、原文と訳文が同じ行にあるかどうかを横方向に確認します。
  • 数量、パーセント記号、日付、モデル番号を検索して、数量が増減していないことを確認します。
  • ページをまたがるヘッダー、結合されたセル、および脚注が欠落していないかどうかを確認します。
  • 正式に配信する前に一度エクスポートして、フォントの置換、切り捨て、空白ページを確認します。

長い文書: 最初に用語を統一し、次に章ごとに処理します

長い文書は「アップロードできるか」だけでは判断できません。 300 ページ以内では、用語の不一致、章の欠落、図の説明の誤りがある場合もあります。 「専門的な翻訳」を何度も依頼するよりも、翻訳すべきではない製品名、組織名、専門用語、略語を 1 ページの用語集にまとめたほうが便利です。

ツールがファイル サイズまたはページ制限を超える場合は、10 ページごとに機械的にカットするのではなく、章ごとに分割します。章の見出し、表、脚注はそのままにしておく必要があります。各セクションで同じ用語集を使用し、最後に目次、番号付け、相互参照を統合します。

ChatGPT などの汎用ツールは、翻訳後の特定の段落の説明、用語の確認、変更の比較には適していますが、デフォルトでは複雑な PDF 全体の書式設定の復元には適していません。また、OpenAI は現在、PDF 内の画像やグラフの視覚的な読み取りは、特定の企業アカウントとアップロード方法でのみ利用可能であると述べています。 「PDF アップロードをサポート」が表示されない場合は、すべてのアカウントがチャートを読み取ることが想定されます。

ファイルの種類で直接選択

  • 通常の中国語テキスト (オプション) PDF: 文書全体の翻訳には、まず Google 翻訳または DeepL を試してください。
  • ページを選択してプレビューし、Adobe 環境で変更を続ける必要があります。Acrobat と Adobe Express の間の変換プロセスを参照してください。
  • スキャンされたドキュメント: 最初に OCR を実行し、認識結果をスポットチェックしてから翻訳します。
  • 複雑な表: 元の Word または Excel が見つかった場合は、PDF を使用しないでください。見つからない場合は、テーブルごとに行と列を確認してください。
  • 長い文書: 最初に用語集を作成し、完全な章に分割し、最後に番号付けと目次を統一します。

もう一つ欠かすことができないのは、契約書や顧客情報、未公開の報告書や個人情報を含む文書をアップロードする前に、まず企業がサービスへのアップロードを許可しているかどうか、および該当するアカウントのデータ処理ルールを確認することです。翻訳の利便性は、ドキュメントを外部プラットフォームに自由に渡せることを意味するものではありません。

公式情報

この記事のドキュメント機能と制限事項は、2026 年 8 月 17 日時点で検証された次の公式情報源に基づいています。

プロジェクト相談