英訳を比較する際は、読みやすさだけでなく、原文の日付、名称、条件が保たれているかを確認します。この記事では、2024年3月の初出記事と、2025年11月4日付の追記に掲載した英訳例を、確認方法の例として取り上げます。現在のサービスの性能順位を示すものではありません。

過去の比較を読むときは、条件と時点を確認する
当時の記事では、著作権保護の歴史とベルヌ条約についての日本語を、Google翻訳、DeepL、ChatGPTで英訳して比較していました。追記では、同じ原文についてGPT-5と当時のGPT-4-Turboの訳文を比較しています。
原文には、長い文節、専門用語、和暦が含まれています。これらは、文章のつながりや日付の変換が正しいかを確認するためのポイントになります。ただし、一つの原文での結果から、文学、業務文書、すべての言語での優劣を決めることはできません。
日付は、自然な文章でも個別に照合する
過去の記事に掲載した訳文では、ベルヌ条約の日付の年が、Google翻訳では1888年、DeepLでは1887年、ChatGPTでは1886年となっていました。原文の明治19年は1886年です。条約の採択日は、WIPOの公式資料でも1886年9月9日と確認できます。
この例から確認できるのは、掲載された訳文に年の誤りがあるということです。現在同じサービスへ入力しても同じ誤りが起きる、という意味ではありません。原文と訳文を照合するときは、日付や数値を文章の読みやすさとは別に確認してください。
追記の採点は、そのときの記録として読む
2025年11月4日付の追記では、GPT-5の総合点が当時のGPT-4-Turboより5点高かったと記載していました。以下の画像は、その追記時の資料です。

過去の採点には、翻訳精度、流暢さ、一貫性、文化的妥当性、文章の正確さ、総合評価という項目を使っています。ただし、点数を参照する際は、評価者、採点手順、試行回数、利用モデルや設定の確認も必要です。点数だけで、誰が使っても同じ品質になるとは判断できません。
「最新版の上位モデルなら間違いない」という結論も、この比較だけからは導けません。新しいモデルを採用する場合は、同じ評価用の文章で再確認します。

用語と文章のつながりも原文に戻って確認する
専門用語や条約名は、正式な表記があるかを確認します。接続詞を変えたことで、因果関係や対比が変わっていないかも確認します。文を分けて読みやすくしていても、条件が別の文にかかってしまう場合があります。
自然な訳が複数あるときは、原文が伝える事実と、表現の好みを分けて評価します。総合点にまとめる場合も、公開前に修正する必要がある誤りは別に記録してください。

上の資料も当時の採点結果です。評価基準の異なる結果や新しいモデルの結果を追加するときは、条件をそろえ、比較できる範囲を明示します。
自社サイトで評価する場合は、製品説明、料金、短いUI、長文などを組み合わせてください。方法はAIモデルの比較手順、対応機能やデータの扱いはChatGPTとDeepLの選び方で説明しています。
