ニューラル機械翻訳(NMT)も、大規模言語モデル(LLM)を使う翻訳も、機械翻訳の方法です。「機械翻訳は直訳、生成AIは自然」と単純に分けることはできません。使うモデル、入力する文脈、設定、対象言語によって結果が変わります。

技術の違いと、製品の機能を分けて見る
NMTは、ニューラルネットワークを使って原文から訳文を生成する方式です。翻訳向けに学習したエンコーダ・デコーダ型は代表的な構成ですが、NMTのすべてが同じモデル構造というわけではありません。
LLMを使う翻訳では、翻訳の指示、対象の読み手、参考となる用語や文章などを入力し、訳文を生成します。プロンプトに例を入れて振る舞いを調整することと、モデルの重みを追加学習することは別です。
Transformerは両分野で使われる技術の一つですが、技術名だけでは、個々の製品の構成や性能はわかりません。基礎となる研究はAttention Is All You Needを参照できます。
特徴 | ニューラル機械翻訳 (NMT) | 生成AI (LLM) |
コアアーキテクチャ | エンコーダ・デコーダ (主) | デコーダオンリー Transformer (主) |
トレーニングデータ | パラレルコーパス (対訳ペア) | 大規模な単言語および多言語テキスト |
主な目的関数 | 翻訳誤差の最小化 | 次トークン予測 |
コンテキストウィンドウ | 通常1〜3文 (限定的) | 広大 (最大128kトークン以上) |
適応性 | ファインチューニング (再学習) が必要 | プロンプトエンジニアリング / インコンテキスト学習 |
推論の性質 | 決定論的 / 予測的 | 確率的 / 生成的 |
DeepLも、翻訳に特化したLLMを使う次世代モデルを説明しています。サービス名だけで「従来型NMT」「汎用LLM」と固定して分類しないようにします。DeepLのモデル紹介は提供元の説明であり、他社との性能比較はその評価条件も確認してください。

自然に読めることと、意味が正しいことを分けて確認する
どちらの方式でも、原文の欠落、誤訳、繰り返し、根拠のない追加が起こる場合があります。NMTなら内容を作らない、LLMなら文脈を必ず理解するといった前提にはできません。
長文では、人物や製品名が途中で変わっていないか、前の段落にある条件が保たれているかを確認します。短文では、主語や用途が読み取れない場合に、必要な文脈を添えます。文脈を多く渡すほど必ず改善するわけではないため、入力方法も評価の条件に含めます。
対象言語による差もあります。ある言語で良い結果が出ても、別の言語で同じ品質になるとは限りません。たとえば2023年のChatGPT翻訳の研究も、言語資源の違いを含む評価を扱っています。過去の研究結果を、そのまま現在の全モデルの順位として使わないようにしてください。
速度と費用は、同じ文章量で比較する
応答時間は、モデル、入力と出力の長さ、同時実行、通信、混雑、キャッシュなどに左右されます。技術の分類だけで「何倍速い」とは決められません。表示時の処理と、事前にまとめて処理する場合を分けて測ります。
文字数で課金するAPIと、トークン数で課金するAPIは単位が違います。トークンはモデルが文章を処理する単位で、文字数と同じではありません。指示、参考資料、生成した訳文、再実行の分を含め、実際の利用量で計算します。

指標 | プレミアムNMT (DeepL/Google) | フロンティアLLM (GPT-5.6 Sol/Claude Opus 5) | 高効率LLM (GPT-5-mini/Gemini 3 Flash) |
課金単位 | 100万文字あたり | 100万トークンあたり (In + Out) | 100万トークンあたり (In + Out) |
概算コスト | $20.00 - $25.00 | $12.00 - $20.00 | $0.20 - $0.50 |
レイテンシ | ミリ秒単位 | 秒単位(高) | サブ秒〜秒単位(中) |
スループット | 高(リアルタイム可) | 低(バッチ処理推奨) | 中〜高 |
特定の料金や速度を比較する場合は、計測日、モデル、設定、対象分量を添えます。人が直す時間も含めると、API料金だけでは見えない差を確認できます。
用語集や参考資料は、使われ方を確かめる
用語集は、正式な名称や訳語を指定するために使います。関連する資料や過去の訳文を検索して、翻訳時の参考情報として渡す方法もあります。参考情報を渡しただけで、正しく適用されたとは判断できません。
同じ単語でも文脈が違えば訳が変わります。対象ページや意味を記録し、使う範囲を決めます。HTMLや変数を含む場合は、文章として訳す部分と保護する部分を分けます。
翻訳・校正・再確認を組み合わせる
一度翻訳した後に、別の処理で用語、数値、意味、構造を確認する方法があります。AIによる評価や修正を入れる場合も、指摘と原文を照合します。修正が新しい誤りを生む可能性もあるため、処理回数を増やすだけで品質を保証しないようにします。
重要な契約条件や安全上の注意は、担当部門の確認を含めます。自然な文体、専門内容、公開の可否は、確認する担当者が異なる場合があります。

用途ごとに、必要な条件を決める
要件・ユースケース | 推奨テクノロジー | 理由・根拠 |
リアルタイムチャット / UI | NMT (DeepL/Google) | 超低レイテンシ、短い文字列に対する高い信頼性 |
マーケティング / ブログ | LLM (GPT-5.6 Sol/Claude Opus 5) | 優れた流暢性、トランスクリエーション能力、SEOプロンプトへの対応 |
技術マニュアル / 法務 | NMT または ハイブリッド | 厳格な用語準拠、ハルシネーションリスクの低減 |
超大量処理 / 低予算 | Flash LLM または NMT | Flash LLMが新たな価格破壊($0.20/1Mトークン)を実現 |
日本市場 / アジア展開 | LLM (GPT-5.6 Sol) | 高コンテキスト言語(敬語、役割語)に対する優れた処理能力 |
一つのモデルで必要な条件を満たせるなら、単純な構成で運用する選択もあります。使い分ける場合は、処理の選択、用語の共通管理、失敗時の扱いを決めます。詳しくは翻訳処理と校正の設計、製品の比較はChatGPTとDeepLの選び方で説明しています。