Jason Wei 在 Stanford AI Club 做了一场约 30 分钟的演讲,围绕三个他认为理解 2025 年 AI 格局最基本的思维框架展开。Jason Wei 目前在 Meta Superintelligence Labs 做研究,此前在 OpenAI 参与创建了 o1 和 Deep Research,更早在 Google Brain 推动了 chain-of-thought prompting 和 instruction tuning 的研究,累计被引超过 9 万次。
一、智能正在变成大宗商品
他把 AI 的进步分成两个阶段:第一阶段是推前沿,模型还做不好某件事,你在解锁新能力;第二阶段是一旦能力达成,它就会迅速被商品化。用 MMLU 基准测试的数据看,每一年达到同等智能水平所需的花费都在下降,这个趋势在他看来还会持续,核心原因是深度学习历史上第一次"自适应计算"真正跑通了。过去不管问题多简单多难,推理用的算力是固定的;现在从 o1 开始,模型可以根据问题难度动态调整推理时的算力投入,这意味着简单任务的成本可以被压到极低。
另一个维度是获取公开信息的时间。他画了一条时间线:从前互联网时代到互联网时代、聊天机器人时代、再到 AI 智能体时代,找到一条信息所需的时间在指数级缩短。他举了一个例子——"1983 年韩国釜山有多少对夫妇结婚?"——o3 回答不了这个问题,但 OpenAI Operator 可以,因为它能打开韩国统计数据库 KOSIS,一路点击操作直到查到答案。OpenAI 内部用一个叫 BrowseComp 的基准来衡量这种"知道答案就秒验证,但找答案极耗时"的任务,人类平均每题花两小时以上,很多题根本做不出来,而 Deep Research 能解决大约一半。
他给出了判断 AI 在某个任务上进步速度的三条启发式规则。第一,AI 擅长数字化任务,核心原因是迭代速度——数字环境可以轻松扩展算力,而物理机器人的实验扩展成本高得多。第二,人类觉得容易的任务 AI 也往往容易,但有一类例外是"人类因生理限制做不到但 AI 可以做到"的任务,比如读过一千万张乳腺影像后发现某个人类注意力无法捕捉的模式来预测乳腺癌。第三,数据充足的任务 AI 表现好——数学推理在不同语言上的表现和该语言的训练数据量高度相关;而如果一个任务有单一客观指标,就可以通过强化学习生成合成数据来突破数据瓶颈,AlphaEvolve 和 AlphaZero 都是这个路线。