<img src="https://trc.taboola.com/1341089/log/3/unip?en=page_view" width="0" height="0" style="display:none">
  • X
  • facebook
Sep. 29, 2026

AIチェックの指摘が終わらない理由|2つのモデルで実験してみた

 

人間が仕上げた翻訳を、AIに「チェックして」とかけてみる。すると、改善点がいくつも返ってくる。素直に直して、もう一度かける。また出てくる。直す。また出てくる・・・。

 

翻訳会社の工程でも、翻訳を発注したお客様の側でも、この「終わらないAIチェック」に出くわすことが増えています。なかには「AIに見せ続けたら、フィードバックが永遠に続くのでは」と、戦々恐々とする声もあります。

この不安は、勘違いではありません。AIチェックの指摘は、放っておくと確かにゼロになりません。 ただし、その理由は「翻訳の品質が低いから」ではありませんでした。今回は、この現象を実際にAIを走らせて確かめ、「終わらなさ」の本当の正体を突き止めます。

 

 

1. なぜ、いつまでも指摘が出るのか

まず、理屈を手短に押さえておきます。理由は大きく3つあります。

理由 内容
①翻訳には唯一の正解がない 同じ原文に対して、同じくらい正しい訳がいくつも存在します。すると「チェック」の多くは、誤りの指摘ではなく別の正しい訳への言い換え提案になる。直しても、次のAIはまた別の「より良い言い回し」を出す。誤りが減っているのではなく、好みの海を漂っているだけ、という状態になり得ます。
②AIは「指摘するようにできている」 「チェックして」と頼まれたAIは、「問題ありません」と答えるより、何かを挙げるほうが役割を果たしていると振る舞います。十分に良い訳に対しても、指摘がゼロになりにくい——構造的な偏りです。
③深刻度の区別が失われがち 致命的な誤訳(数値の反転、意味の取り違え)と、単なる語感の好みが、同じ「改善点」として1件ずつ積み上がる。重みづけがないと、件数だけが増えて「終わらない」体感を生みます。

目次に戻る

 

2. 実験:同じ訳を、AIに何度もチェックさせる

十分に読める英訳を1本用意し、そこに自然だが語彙レベルの誤りを混ぜ込みました(数値は正しいまま、「中小事業者」を"大企業"に、「支援する」を"置き換える"に、「無料」を"低価格"に、など全7か所)。これを、AIに「原文と照らして改善点を挙げ、反映した改訂版を出して」と繰り返しかけ、ラウンドごとの指摘件数を、致命/実質改善/好みの3つに分けて記録します。

 

実験条件

  • 履歴あり:ひとつのチャットの中で、直しては再チェックを続ける(実務でいちばん多い使い方)
  • 履歴なし:毎回まっさらな状態でチェックする(新しいチャットを開いたり、別の担当が別々に見たりする状況)
  • 使用モデル:OpenAIの GPT-5.6-Sol と、Anthropicの Claude Sonnet 4-6(まったく別系統の2モデルで比較)

目次に戻る

 

3. 結果:履歴があれば収束し、なければ終わらない

まず ChatGPT(GPT-5.6 Sol)。

履歴ありは、数ラウンドで指摘がゼロになり、そのまま静かに収束しました。ところが履歴なしは、一度もゼロにならず、2〜5件のあいだを行き来し続けます。

gpt-5.6-sol:履歴あり(数ラウンドで収束)
gpt-5.6-sol:履歴なし(下げ止まらない)

 

Claude(Claude Sonnet 4-6)でも、まったく同じ構図でした。

履歴ありは収束、履歴なしは4〜5件で高止まり。

 

bar_sonnet46_on

bar_sonnet46_off

4枚のグラフから、はっきり3つのことが読み取れます。

  • 致命的な誤りは、最初のラウンドでほぼ片付く。 
    どの条件でも、仕込んだ7つの誤りは1回目で検出されています(グラフR1の赤いブロック)。つまり「終わらなさ」の正体は致命的な誤りではなく、その後に延々と続く実質改善と好みの「尻尾」(黄色と灰色)です。
  • その尻尾は、履歴があると枯れ、なければ枯れない。 
    履歴ありは尻尾が数ラウンドで消えてゼロに。履歴なしは、灰色(好み)を中心に、いつまでも小さな指摘が湧き続けます。
  • 履歴が切れると、直した誤りがぶり返すことすらある。 
    履歴なしのグラフをよく見ると、途中のラウンドで赤(致命)が再び顔を出しています。前に直したはずの箇所を、文脈を知らない次のチェックが「また問題)として指摘し直す。件数が増えるだけでなく、意味の面で後戻りまで起きるのです。

目次に戻る

 

4. 「終わらなさ」の正体は、AIではなく「文脈の切れ」

ここが今回いちばんの発見です。指摘が終わらないのは、AIが賢くないからでも、特定のベンダーが劣っているからでもありません。チェックの文脈(履歴)が切れているからです。

 

ひとつのチャットで続ければ、AIは「自分がさっき何を指摘し、どう直したか」を覚えています。だから同じ蒸し返しをせず、数ラウンドで「もう十分」に到達する。ところが、毎回新しいチャットを開いたり、別の担当が別々にAIチェックをかけたりすると、AIは毎回ゼロから見直し、前に採用・却下した判断を知らないまま、新しい「好み」を出し続ける。これが収束しません。

 

お客様が「フィードバックが永遠に続くのでは」と怯えるのは、まさに文脈を共有しないまま独立にチェックをかけている状況、というわけです。恐れるべきは品質の欠陥ではなく、測り方が収束しないという、チェックの回し方の問題でした。

ひとつ注意。
この実験は「どちらのモデルが優秀か」を測ったものではありません。仕込んだ誤りはどちらのモデルも1回目で全部検出しており、精度の面では互角でした。グラフはあくまで"指摘が収束するかどうか"を示すもので、翻訳の巧拙の比較ではありません。なお、今回の2モデルには汎用ベンチマーク上の素の能力差がありますが、それでも収束パターンは同じでした。「終わらなさ」は賢さの問題ではないという何よりの証拠です。

目次に戻る

 

5. こんな場面で、静かに起きている

この「文脈の切れ」は、特別な状況ではありません。むしろ翻訳のやり取りには、あちこちに潜んでいます。

 

たとえば、翻訳会社とお客様の間。会社が納品した訳文を、お客様が自社でAIチェックにかけ、出た指摘を会社に戻す。会社が直して再納品すると、お客様はまた別途AIチェックをかける——両者が別々の文脈でチェックを回すため、指摘は世代交代しながら延々と続きます。

 

あるいは、お客様の社内、部署同士の間。担当部署がチェックし、次に法務が、さらに海外拠点が、それぞれ自分のAIに同じ訳文をかける。各部署の「好み」が別々に積み上がり、たがいに矛盾することすらあります。

 

いずれも、悪気があるわけではありません。ただ、チェックの文脈が分断されているという一点で、終わらないループが生まれています。要は文脈を一本化することです。関係者の間で「何を直し、何を好みとして流したか」を共有し、最終判断を誰が持つかと、どこで打ち切るか(たとえば致命的な指摘がゼロになったら確定)を、先に決めておく。これだけで、指摘の「世代交代」はかなり止まります。

目次に戻る

 

6. では、どう使えばいいか

  • AIチェックは使い捨ての単発ではなく、ひとつの会話で回す。
    文脈を保てば、指摘は数ラウンドで収束します。毎回新しいチャットでかけ直すのは、終わらないループを自分で作っているようなものです
  • 停止条件を先に決めておく。
    致命的な誤りは早い段階でほぼ拾い切れます。「致命的な指摘がゼロになったら打ち切る」といった線を最初に引いておけば、その後の好みの応酬に巻き込まれずに済みます
  • 「誤りの指摘」と「改善の提案」を分けてAIに出させる。
    両者を同列の「改善点」として1件ずつ数えると、件数だけが膨らみます。深刻度で仕分ければ、直すべきものと、好みで流してよいものが、はっきり分かれます

 

AIチェックのフィードバックが終わらないのは、翻訳の品質が悪いからではありません。文脈を切って独立にかけ続けると、AIチェックは本質的に収束しないのです。ひとつの流れで回し、停止条件を決めれば、ちゃんと終わります。

目次に戻る

 

まとめ

  • AIチェックの指摘は、放っておけばゼロにならない。ただし原因は品質ではなく、チェックの回し方にある
  • 実際に2モデルで確かめると、履歴あり=数ラウンドで収束/履歴なし=下げ止まらない。ベンダーも世代も能力も違うのに、同じパターンだった
  • 致命的な誤りは最初にほぼ片付く。終わらないのは、その後の好みの尻尾。文脈が切れると、直した誤りのぶり返しまで起きる
  • 使うなら、ひとつの会話で・停止条件を決めて・深刻度で仕分けて

 

前回は、AIの流暢さが誤りを覆い隠す「見逃し」の落とし穴でした。今回はその逆、AIが指摘を出しすぎる「過剰指摘」の落とし穴です。見逃しと、過剰指摘——AIチェックの二つの罠を押さえたうえで、次回はいよいよ、そもそも最終品質は一次翻訳の段階で決まってしまう、という「天井」の話に進みます。

 

この検証の位置づけ(おことわり)
今回はあくまで、簡単で分かりやすい誤りを少数だけ仕込んだ、小さな検証です。文書の分野や分量、誤りの微妙さが変われば、結果も変わり得ます。使うAIモデルやそのバージョンが違えば、収束の速さもパターンも変わります。ここで示したのは確定した法則ではなく、「AIチェックはなぜ終わらないのか」を考えるための、思考実験に近い検証です。それでも、「文脈を切ってかけ続けると収束しない」という芯の部分は、条件を変えても働き続ける性質だろうと考えています。

 

WIPジャパンの品質チェック体制

WIPジャパンでは、翻訳とDTP・多言語品質管理をワンストップで対応しています。AIチェックを含む品質チェック体制の設計についても、翻訳工程とあわせてご相談いただけます。

 

  • X
  • facebook

海外展開の判断と実行を、言葉と情報で支える[ WIPジャパンのサービスを見る ]

法人専門翻訳会社WIPジャパンのサービスはこちら