ある「言語の幽霊」が出版物やネット上を広範にわたって浸透している。LinkedInのプロフィール、学位取得を目指す学術論文、さらには文学賞を狙う作品に至るまで、その背後には生成AIの存在が影を落としている可能性がある。だが、目の前の文章が人間の手によるものか、それとも大規模言語モデル(LLM)による生成物かを、本当に見分けられるのだろうか?

『エコノミスト』によれば、AIが「代筆ライター」として英語圏に急速に浸透している。散文、詩、ニュース記事、企業文書に加え、シェイクスピア風のソネットや通俗小説の文体まで模倣可能だ。ヘミングウェイの簡潔な文体も再現でき、オフィスのプリンター取扱説明書を作成することも難なくこなす。その執筆スピードは驚異的で、職業作家たちにとっては脅威でしかない。実際、ヘミングウェイですら一日にこれほどの量を書くことは稀だったが、AIは酒を飲む必要もない。

統計によると、新しく公開されるウェブコンテンツの3分の1以上がAIによって生成されているという。では、どうすればAIによる代筆を特定できるのか?

『エコノミスト』は、AIテキストを識別する方法として、訓練済みの検出アルゴリズムの使用を挙げている。Pangram社はその分野でリードしており、自社の検出精度が99.98%に達していると主張している。しかし、この手法には問題がある。ブラックボックス型のアルゴリズムであるため、誤検出の可能性があり、その判断根拠が明示されないことが多い。

一方で、研究者たちは疑わしい語彙を調査したり、AIが修正する前後の文章を比較したりするアプローチを試みている。だが、これらもAI特有の文体的特徴を完全に抽出するには至っていない。

こうした中で、『エコノミスト』は「人間と機械の文体比較」をより信頼できる方法として推奨している。同誌は大規模な実験を行い、ChatGPT、Claude、Gemini、Grokといった主要AIモデルが生成した120万語、5万5000文の文章を、『ニューヨーク・タイムズ』『ワシントン・ポスト』『CNN』、そして1950年から2022年までのベストセラー小説など、人間が書いた文章と比較・統計分析した。

その結果、AIの文章は語彙、句読点、文構造、段落構成のすべてにおいて、人間の文章と明確に異なる特徴を持つことが判明した。ただし、これはAIの文体が独自である、あるいは優れた作家であることを意味するわけではない。むしろ、『エコノミスト』はAIの文章は明瞭さや洗練さに欠け、単調になりがちだと指摘している。優れた作家になりたいなら、AIが犯すような文体的破綻は避けるべきだという。

だが、これらの破綻は恒久的なものではない。モデルのバージョンアップやプロンプトの変更により、AIは驚異的なスピードで「進化」を遂げている。

それでも『エコノミスト』は、AI文章を識別するための三大破綻をまとめた。

**破綻その1:「見せかけの博学」を好む**

かつてAIの文章には「delve(深く掘り下げる)」といったキーワードが多用されていたが、最新モデルではその傾向が減少。代わりに、多音節語、難解語、科学用語の使用が顕著になっている。たとえば「significant(顕著な)」「increasingly(ますます)」「consequences(結果)」といった語。さらに「interdependence(相互依存)」「reindustrialisation(再工業化)」といった生僻語や、「parameter(パラメーター)」「methodology(方法論)」といった専門用語も好んで用いられる。

また、動詞を名詞化する「名詞化」も特徴的だ。例えば「expand(拡張する)」を「expansion(拡張)」に変えるような使い方である。

『動物農場』『1984』の著者、ジョージ・オーウェルはかつて「見せかけの語彙(Pretentious Diction)」を批判した。彼は、簡単なことを複雑な語彙で包み隠す作家たちを「賢そうに見せようとしている」と指摘し、ラテン語やギリシャ語由来の語彙を「サクソン語由来の語彙より上品だ」と考える傾向を問題視していた。

興味深いことに、AIもこの傾向を共有している。AI生成テキストでは、ラテン語由来の語彙の使用頻度が人間の文章よりもはるかに高いのだ。

**破綻その2:破折符の乱用は減ったが、標点全体の使用が少ない**

かつて「長い破折符(—)」がAIの特徴だと考えられていたが、それはもはや通用しない。実際、『エコノミスト』の統計によれば、Claudeを除き、ChatGPTの破折符使用頻度は人間よりも低い。しかし、新たな破綻が見つかった。AIは標点全体を極端に使わない傾向があるのだ。

AIは長文を好むため、接続詞として「and」を多用し、その結果、カンマ、セミコロン、括弧の使用頻度が人間の文章に比べて著しく低い。また、専門家の発言を直接引用することが少ないため、引用符の出現頻度も低い。

**破綻その3:短文の爆発力に欠け、作文の定型表現に依存**

優れたスピーカーや作家は、「長文と短文のリズム」を巧みに使い分ける。短く力強い一文で文章にアクセントを加えるのが得意だ。しかし、AIの段落は長文で構成されがちで、平板な流れになってしまう。

AIが文章を生き生きさせようとするとき、決まりきった修辞パターンに頼りがちだ。例えば「Xではなく、Yである(not X but Y)」「ただXだけでなく、Yでもある(not only but also)」「三つの要素で構成される(rule of three)」といった構文である。

『エコノミスト』は、AI文章を識別するには、現時点では「味気なく、見せかけで、ラテン語由来の語彙が多用された文章」に注意すべきだと助言している。しかし同時に、モデルの更新ごとにAIの文章はますます人間に近づいているとも警告している。

フロリダ州立大学の言語学者トミー・ユゼク氏は、大規模言語モデル(LLM)が人間の使用やフィードバックから学習し、優れたコンテンツを吸収し、劣った部分を排除していると指摘する。

『エコノミスト』は、AIの進化の例として、かつて「AIは破折符を多用しすぎているか?」と尋ねると「良い質問ですね!」とごまかしていたが、現在では「破折符は慎重に使うべきです」と真面目に回答するようになったと紹介している。同誌は皮肉を込めて、「これは人間の進化スピードではない。幽霊(ghost)だからこそ、これほど速く進化できるのだ」と述べている。

FACT BOX ・ 要点整理

  • 出典:PR Times
  • 分類:調査
  • 関連組織:Pangram
  • 製品・サービス:AI検出ツール / 生成AIモデル