当前位置:首页 > AGI 与 AI 意识研究 > 正文内容

图灵测试过时了吗:现代AI能力评测新范式

叶志辉57年前 (1970-01-01)AGI 与 AI 意识研究8

1950年,图灵提出一个判据:如果机器在文字对话中骗过了人类,就认为它有智能。七十五年过去,GPT轻松通过这个测试,但没人觉得它已经"通用智能"了。图灵测试,是不是该退休了?

图灵测试的聪明与局限

图灵测试的天才之处在于:它用一个可操作的行为标准,绕开了"意识""理解"这些无从证实的形而上学问题。你不纠结"机器懂不懂",只看"人能不能分辨"。这在1950年是巨大的进步。

但它的局限也致命:第一,它只测"文字对话",不测行动、不测物理交互;第二,它假设"像人"等于"有智能",可AI的智能形态可能和人不在一个维度上;第三,它容易被"套路"——一个会装傻、会聊天的脚本就能蒙混过关。

当年ELIZA(1966年的心理咨询聊天程序)就用几十个模板骗过了不少人,但它连"理解"的边都没沾。图灵测试从一开始就容易被"表演型智能"欺骗。

新基准:从MMLU到"人类最后一考"

大模型时代,评测换成了标准化考试。MMLU(大规模多任务语言理解)考57个学科的知识,从法律到物理到医学。GPT-4在MMLU上超过80%的人类考生,看似很强。

但很快发现MMLU也能被"刷分"——模型可能在训练时见过类似题。于是有了更狠的"Humanity's Last Exam"(人类最后一考),全是专家级、互联网上极难搜到的难题,专门堵"刷分"漏洞。

还有GSM8K(小学数学应用题)、MATH(竞赛数学)等,专门测"推理链"而非"知识记忆"。这些基准比图灵测试严谨得多,但也更全面。

涌现能力:忽悠与真相

2022年有个轰动结论:大模型在参数量超过某个阈值后,会"涌现"出小模型完全没有的能力(比如多步推理、代码生成)。这被称为"涌现能力",一度被解读为"AGI要来了"。

但后来有论文指出:很多"涌现"其实是评测指标选得不好造成的假象——把指标换成线性刻度,能力其实是平滑增长的,没那么神秘。这场争论让整个领域冷静了不少。

我的看法:涌现确实存在,但它更像是"量变积累到一定程度后,某些能力从不可观测变成可观测",而不是"突然有了灵魂"。别神话它,但也别完全否定。

Agent基准:从"会答"到"会做"

最新一代评测不再满足于"问问题看回答",而是让AI当"智能体"(Agent):给它一个目标(比如"整理这个文件夹并写份报告"),看它能不能自主调用工具、分步完成、处理意外。

这类基准(如WebArena、AgentBench)更接近真实智能——因为真实世界不是问答,是行动。一个能连续操作浏览器、调试代码、自我纠错好几轮的AI,显然比只会聊天的更接近"智能"。

但Agent基准也暴露了AI的短板:它们经常在前几步就跑偏,然后一路错下去,缺乏人类的"我好像哪里不对"的元认知刹车。

评测的终极陷阱

所有基准都有一个通病:你优化什么,就得到什么。模型为了刷高分,会专门训练对应题型,甚至"过拟合"到基准本身。这叫"基准污染"。

更深层的问题是:我们用"人类考试"来测AI,但AI的强项可能根本不在考试维度上。就像一个不擅长考试但极具创造力的孩子,被一张试卷定义成"笨"。

所以图灵测试没"过时",它只是从"唯一标准"降级成了"众多标准之一"。我们需要的是一套组合拳:知识基准+推理基准+Agent基准+安全基准,而不是任何一个单一测试。真正的智能,藏在跨基准的综合表现里。


如果你对AI意识、AGI或者机器智能的本质有自己的看法,欢迎在评论区聊聊——这个领域最大的特点就是"没人知道答案",每一个观点都值得被认真讨论。

相关文章

AGI不是更大的模型:从专用AI到通用智能的鸿沟

AGI不是更大的模型:从专用AI到通用智能的鸿沟

很多人觉得GPT-5、Claude就是AGI的前夜,再堆点算力就能"涌现"出通用智能。但事实是——我们连"通用智能"到底长什么样都没想清楚。这篇文章聊聊专用AI和AGI之间那道看不见、却真实存在的鸿沟...

机器能"感受"疼痛吗:AI意识的科学边界

机器能"感受"疼痛吗:AI意识的科学边界

如果有一天,一台机器人被"踩了一脚"后大喊"好疼",我们该相信它真的疼,还是觉得它在演戏?这个问题看似哲学清谈,却直接关系到我们未来如何对待越来越聪明的机器。今天聊聊AI意识的科学边界。 意识是什么:...

大模型真的理解语言吗:理解之谜与中文房间

大模型真的理解语言吗:理解之谜与中文房间

GPT能写出让你落泪的情书,能 debug 你写了三天的代码,能和你聊存在主义到深夜。但一个幽灵始终徘徊在这个领域:它真的"理解"自己在说什么吗?还是只是高级的"文字接龙"?今天拆解这个让图灵奖得主都...

意识的数学:整合信息理论(IIT)与Φ值

意识的数学:整合信息理论(IIT)与Φ值

能不能像测量温度一样,给一个系统的"意识程度"打个分?神经科学家朱利奥·托诺尼真的试了——他提出了一套叫"整合信息理论"(IIT)的框架,用一个叫Φ(Phi)的值来量化意识。这个理论对AI可不友好。...

AI觉醒的边界:从《她》到现实的距离

AI觉醒的边界:从《她》到现实的距离

电影《她》里,男主爱上了操作系统萨曼莎;现实中,Google工程师曾公开声称对话模型LaMDA"有了灵魂"。AI觉醒到底是科幻的预演,还是人类的自我投射?今天我们扒开这层浪漫的滤镜。 科幻给了我们错误...