Amazon 已设定了截止日期。到 2026 年 7 月 30 日,Mechanical Turk 将停止接受新客户。现有账户将继续运行,亚马逊表示将维持平台的安全性与在线运行时间。但该公司也明确表示,不会再推出任何新功能。对于一个曾定义了互联网劳动力时代的平台来说,这无异于一份停产通知。
最初的零工经济市场
Mechanical Turk 成立于 2005 年,远早于 Uber 或 TaskRabbit 等应用将零散劳动力转变为家喻户晓的概念。亚马逊将其构建为一个“人类智能任务”的市场——即软件尚无法处理的小型工作。劳动者大多是匿名的,分布在全球各地,他们登录平台进行音频片段转录、核实店铺地址、审核内容以及为图像打标签。需要有人解决 CAPTCHA(验证码)、对搜索结果进行排序,或者判断产品评论的情绪是积极还是愤怒?MTurk 就是那个地方。
价格通常以美分计算。一批一千张的图像分类任务,每张可能只付一分钱。对于研究人员、营销人员和白手起家的初创公司来说,这是革命性的。突然之间,你可以在一个下午开展一项拥有数百名参与者的调查,或者在无需雇佣全职标注团队的情况下,为计算机视觉模型标注训练数据。该平台成为了基础设施。社会科学家在上面进行实验,科技公司测试界面,AI 团队构建数据集。
大约在 2018 年,亚马逊试图使其角色现代化。它将 Mechanical Turk 重新定位为神经网络的数据标注引擎,并将其与 Amazon SageMaker AI 更紧密地联系在一起。其核心理念是为机器学习流水线提供养料:由人类来清洗、标注和验证算法学习所需的原始材料。MTurk 不再仅仅是零散的小活,它理应成为 AI 爆发浪潮中的“人类脊梁”。
那场浪潮持续增长,但 Mechanical Turk 却没有随之成长。
当人类层开始使用 AI 时
这种矛盾悄然而至,随后爆发。2023 年的一项分析发现,33% 到 46% 的 MTurk 工作者正在使用大语言模型(LLM)来完成那些本应由人工完成的任务。研究人员支付费用是为了获取人类的判断,结果得到的却是 ChatGPT。
这不仅仅是一个关于工人偷工减料的故事。当标注员使用 LLM 来标注客户评论的情感、对医学文本进行分类,或者为聊天机器人训练集编写对话时,数据就不再是基于人类事实的真相了。它变成了机器“最佳猜测”的复印件。如果将这份“复印件”作为基准真相(ground truth)反馈给另一个模型,循环就会不断收紧。信号会退化为噪声。“人在回路”(human in the loop)变成了后台已经在运行的软件的一个橡皮图章。
对于 AI 行业来说,这是一个现实的危机。团队在 MTurk 合约上花费数千美元,认为自己购买的是多样化、原生的视角。如果其中很大一部分劳动力被自动化了,那么生成的数据集就会继承实际执行工作的 LLM 的偏见、盲点和幻觉。质量控制变得越来越难。研究人员不得不设计日益复杂的注意力检查和陷阱问题,仅仅为了证明真的有人在操作。这种防御性的姿态提高了成本,并拖慢了项目的进度。
