最初のチャットボットの草案が教師の受信箱に届いたのは、およそ2年前のことだ。それ以来、状況は加速する一方である。今や学生はChatGPTに対し、「大恐慌の原因」やThe Great Gatsbyにおける象徴性について5段落程度の文章を作成するよう指示でき、鉛筆を削るよりも短い時間で一貫した回答を受け取ることができる。教育者にとって、これは学問的誠実性(アカデミック・インテグリティ)の性質を変えてしまった。彼らが追い求めているのは、人間が他人の作品をコピーするという従来の盗用だけではない。彼らは「合成された散文(synthetic prose)」、つまり、人間のように聞こえるが、理解も記憶も、議論に対する当事者意識も持たないモデルによって組み立てられたテキストをも探し求めているのだ。

声が突如として変わる時

教師は毎学期、何百もの学生のエッセイを読む。時間を経るにつれ、彼らは個々のリズム(cadence)を聞き分ける耳を養っていく。習慣的なコンマの使いすぎや、よく使うフレーズ、特定の学生が結論を構成する方法などに気づくようになるのだ。しかし、これまで期待していた声とは似ても似つかない論文が届くと、より詳細な調査が必要となる。

これは、成長を罰するためのものではない。優れた教師は、生徒の成長を見ることを生きがいとしている。しかし、着実に構文を向上させてきた学生と、8ヶ月間はぎこちなく単純な文章を書いていたのに、突然洗練された法律文書のようなエッセイを提出してくる学生との間には、明確な違いがある。その散文は非の打ち所がないかもしれないが、練習の積み重ねという「考古学的な痕跡」が欠けているため、借り物のように感じられるのだ。この、裏付けのない急激な洗練こそが、しばしば最初の手がかりとなる。

プロフェッショナルな表面、空虚な中心

AIが生成した文章は、「正確さの不気味な谷」に陥る傾向がある。文法は正しい。遷移もスムーズである。しかし、テキストは題材を深く掘り下げるのではなく、その表面を漂っている。教師たちはしばしば、この性質を「プロフェッショナルだが、どこにでもあるような(professionally generic)」と表現する。

Romeo and Julietに関するエッセイを考えてみよう。人間の学生であれば、メルキューシオの脇役としての役割に固執したり、ある場面を興味深い方法で読み違えたり、あるいは家族間の争いを自身のコミュニティの紛争と比較したりするかもしれない。その主題(thesis)は乱雑なものかもしれないが、テキストと格闘する単一の精神の産物であることは疑いようがない。対照的に、AIによる草案は、しばしばあらすじを正確に要約し、3つの普遍的なテーマを列挙し、「愛には犠牲が必要である」と結論づける。それは正しい。しかし、同時に空虚でもある。独特な意見も、欠点はあるが真実味のある洞察も存在しないという、この「リスクの欠如」こそが、書き手が学生ではないことを示す最も信頼できる指標の一つである。

どこにも辿り着かない参考文献

もう一つのレッドフラッグ(警告信号)は、ハルシネーション(幻覚)による引用である。ChatGPTや同様のツールは、時として本や学術論文、さらには著者までも捏造することがある。それらの項目は、学術的な響きのタイトル、出版社名、出版年などが揃っており、もっともらしく見えるが、現実とは何の関係もない。

ベテランの教師は出典を検証する。Google Scholarにタイトルを入力したり、大学の図書館データベースを検索したり、あるいは単に検索エンジンで著者名を調べたりする。すべての引用がデッドエンド(行き止まり)に終わる時、その論文の信頼性は崩壊する。参考文献の確認は、常に本格的な研究指導の一部であったが、今や短い分析エッセイにおいてさえ、標準的な慣行となりつつある。引用文献リストは、もはや単なるフォーマットの練習ではなく、誠実さを確認するためのチェックポイントとなっているのだ。

検知ソフトウェアの限界

多くの学区は、合成テキストの急増に対応するため、AI検知ツールのライセンスを取得している。これらのプログラムは、機械生成の散文に共通する統計的パターン、すなわち低いパープレキシティ(当惑度)、予測可能な文章構造、繰り返されるリズムなどをスキャンする。これらは有用な場合もある。高い確率スコアが出れば、指導者がより注意深く調査する理由となる。

しかし、教師たちはこれらのツールが不完全であることを知っている。特に、英語を母国語としない話者や、自然と形式的で抑制されたスタイルを好む学生の文章に対しては、誤検知(false positives)が発生することがある。検知されたパーセンテージ単体では、決して不正の証拠として扱うべきではない。ほとんどの教育者は、そのソフトウェアを「決定的な証拠(smoking gun)」としてではなく、多くの手がかりの一つとして利用している。ツールは人間の判断をサポートするためのものであり、人間に取って代わるものではない。

思考なき分析

大規模言語モデルは事実の要約には長けている。しかし、彼らが提供することに苦労するのは、持続的な批判的思考や、真正な個人的な内省である。

例えば歴史の課題において、AIは革命の経済的、政治的、社会的な原因を、教科書のような正確さで列挙するかもしれません。しかし、それらの原因を互いに比較検討したり、通説に異議を唱えたり、あるいはその出来事を学生が実際に興味を持っている現代の課題と結びつけたりすることは、AIには容易ではありません。人間の書き手は、その具体性によって、人間であることを露呈させます。彼らは、見たことのあるドキュメンタリーや、親との会話、あるいは3つの異なる単元にわたって気づいたパターンなどに言及します。AIが生成したテキストには、こうした拠り所がほとんど含まれません。なぜなら、機械には引き出しとなる経験がなく、守るべき意見も持っていないからです。

5分間の対話

最も古い手法の一つが、今なお最も効果的です。それは、学生にその課題について話してもらうことです。

教師は、...の間に学生を脇に呼ぶかもしれません。