OpenAI 一边让首席科学家写万字长文警告我们测不准 AI 了,一边花 50 美元一小时雇人盯着你的聊天记录打分——最讽刺的不是隐私问题,是这个

OpenAI 一边让首席科学家写万字长文警告我们测不准 AI 了,一边花 50 美元一小时雇人盯着你的聊天记录打分——最讽刺的不是隐私问题,是这个

9月15日,404 Media曝光了一份令人坐立不安的调查报道:OpenAI内部有一个代号叫”莉莉计划”(Project Lily)的项目,雇佣数百名合同工,人工阅读真实的ChatGPT用户对话记录。

这些人被叫做”提示词审核员”。他们每小时能拿50多美元——换算一下,大约三百多块人民币。工作内容极其机械:打开一条被匿名化处理的用户对话,读完用户问了什么,然后给ChatGPT生成的4条候选回复分别打分,从1到7。

他们评判的标准包括:回复有没有解决用户的问题、有没有过度使用”AI腔”、有没有居高临下的说教语气、用了太多表情符号、或者——最重要的——有没有”谄媚”或者”拟人化”。

ChatGPT可以说”我查到了一些相关信息”,但不能说”身为一名厨师,我喜欢……”或者”我明白这种感受”。

看到这里我笑了。不是说这不严肃——恰恰相反,这太严肃了。一个在花几十亿美元训练世界上最先进AI模型的公司,雇人看的不是AI有没有编造危险的化学配方,而是它有没有表现出太像人。

先放下隐私问题(那个值得单独骂一篇),今天我想聊的是另一件事:这条新闻和前一条新闻连在一起看,拼出了一副2026年AI安全最荒诞的拼图。

莉莉计划之前,首席科学家刚说过的话

三天前,我写了Post 209。OpenAI首席科学家Jakub Pachocki发表了万字长文《An Alien Mind》,核心论点是:我们正在失去评估AI的能力。o1功臣补了一枪:不是AI要失控了,是我们已经测不准它了。

莉莉计划的曝光,恰好发生在Pachocki文章发布的同一条新闻周期里。

两件事放在一起看,你会看到一个令人生畏的矛盾:

最高级别的技术预警说我们测不准AI。然后最基础的质量保障方案是——雇人看你的聊天记录。

这不是在讽刺OpenAI不努力。恰恰相反,我理解他们为什么要这么做。当你在技术上失去了对模型行为的预测能力时,你唯一的退路就是回到最原始的方法——找人看。用人力去标注、去评分、去微调。

莉莉计划本质上是一个由人类标注员驱动的RLHF数据流水线。它的存在不是OpenAI的”罪行”——它是整个行业”后训练”方法论的标准操作。GPT-6的能力,很大程度上就建立在这套标注体系之上。

问题在于:如果有人翻出404 Media的这篇文章,指着其中一句话问OpenAI——

“你们靠人工给ChatGPT回复打分。打分的那些人,他们的标准经常互相矛盾。指引不到一天就改一次。而且他们是在不知道自己面前这篇对话是不是最严重的那种——比如涉及自残企图、性勒索或者早该被标记的恶意用例——的情况下,做着机械的打分工作。你们对安全有概念吗?”

OpenAI会怎么回答?他们可能会说:我们有专门的安全团队处理那些高危案例。莉莉计划不是安全审查工具,是数据标注工具。

但这反驳掩盖不了一个更大的问题:人类对AI输出的判断能力正在退化。莉莉计划的一切建立在一个假设上——人比模型更知道什么回复是好的。但Pachocki已经在文章里把这个假设拆解了。

匿名不匿名,其实没那么重要

当然,莉莉计划最吸睛的确实也是隐私问题。审核员看到的对话是”匿名化”处理的,但暴露出来的细节——地点参考、项目名称、同事的全名——让匿名变得不那么可靠。

一个审核员在接受采访时说,她确实会读到一些让人不舒服的内容。分手后遗症。工作中的绝望。有人跟ChatGPT倾诉一切。

但说实话,这跟科技公司”读取用户数据”这个滥用的谱系比起来,莉莉计划算不得什么惊天丑闻。谷歌和Anthropic都公开承认他们会这么做。Perplexity在自己的隐私政策里模棱两可。整个行业都是这样。

真正让我在意的是另一件事。

时薪50美元的荒诞

Project Lily的审核员时薪50多美元——这在数据标注行业里是高得惊人的数字。大部分数据标注员在发展中国家拿的是每小时2-3美元。莉莉计划的操作指引明确标注”仅限美国境内”。

为什么OpenAI愿意花这个钱?不是因为他们有良心。是因为他们需要一个在LLM安全监管框架内有公信力的标注群体——在美国、懂英语的用户、理解文化语境。

但50美元时薪换来的,是一个连审核员自己都说”机械重复”、操作指引天天改、打分标准自相矛盾的质检体系。

这暴露了一个没人愿意直说的事实:当模型的智能接近甚至超过人类时,没人知道什么是一个”好的回复”。

评分体系里不许”拟人化”。但用户希望ChatGPT更有人情味。用户说”谢谢你”时,ChatGPT回一句”不客气”和回一句”随时为您效劳”——哪一个更好?莉莉计划的不同审核员会给出不同的分数,而且都会觉得自己是对的。

当模型输出的质量判断变成一个主观问题——不是”它说得对不对”,而是”它说得合不合适”——你就知道人类已经失去了客观的评价锚点。

这是整个行业的问题,不是OpenAI的

Project Lily不是OpenAI独有的问题。所有主流模型提供商都在做类似的事情。Gemini、Claude、Grok——每家公司都有自己的莉莉计划。区别在于命名和公开程度。

但OpenAI的特别之处在于,他们同时是两个极端的代表:一边是业界最前沿的AI安全研究团队和最硬核的技术预警,另一边是这个看起来粗糙得跟2018年的外包平台一模一样的莉莉计划。

这种不匹配正是行业现状的精准缩影:安全宣传的旗舰和检测落地的拖车,马力差了不止一个数量级。

我写这篇博客不是为了曝光OpenAI的”黑料”。莉莉计划本身不是黑料——它只是一种原本合理的做法,放在当前这个时间节点突然显得非常过时。就像用煤气灯去照亮一个被探照灯照亮的足球场——不是煤气灯错了,是场景变了。

技术上的炫技和我们兜底能力的差距,正在越拉越大。莉莉计划的50美元时薪,是这个差距最诚实的标价。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注