「米国特許公報のPDFを生成AIに和訳させたところ、途中が飛んでしまった。PDFから英文をコピーすると、改行部分で単語が切れたまま翻訳されてしまう」

このような相談を受けることがあります。

原因は、生成AIの翻訳能力だけではありません。米国特許公報のPDFには、二段組みの本文、行末で分割された単語、次のページへ続く文章、図面中の文字などが含まれています。

そのため、英文を正しい順序で読み取れなければ、翻訳を始める前の段階で文章が崩れてしまいます。

大切なのは、いきなり「全文を和訳してください」と指示するのではなく、まず英文の順序と文章を復元させ、その後に翻訳させることです。

例えば、次のように指示します。

二段組みの本文は、各ページの左欄、右欄の順に読み取ってください。改行・改頁で分割された単語と文章を復元し、行末の折返しによるハイフンだけを取り除いてください。長文の場合はページまたは節ごとに分割して和訳し、図面中の英語も翻訳してください。最後に、未翻訳のページがないか確認してください。

文字を選択できない画像形式のPDFであれば、翻訳前にOCRによる文字の読み取りも必要です。

それでもうまくいかない場合には、原文PDFと失敗した翻訳結果を生成AIに見せ、どこで文章が欠落したのか、どこで読む順序を誤ったのかを比較させます。そのうえで、同じ失敗を防ぐための新しい指示文を生成AI自身に考えさせる方法もあります。

ただし、AIが説明する失敗原因が必ず正しいとは限りません。改善された指示文を、まず数ページだけで試すのが安全です。

最後に、原文と訳文をページ単位で照合し、未翻訳部分がないかを確認することが重要です。