“智商:AI评估的有缺陷的措施”
2025-04-08
EdwardYoung
187
[
ai](/content/zh/news-tags/ai.html) [
iq tests](/content/zh/news-tags/iq-tests.html)
在最近的一次新闻发布会上,OpenAI的首席执行官Sam Altman分享了他对AI“智商”快速发展的看法。他提到,“非常粗略地说,我感觉——这不是科学精确的,只是种感觉或精神层面的回答——每年我们的AI智商都会提升一个标准差。” Altman并不是唯一使用智商作为AI进步衡量标准的人;社交媒体上的网红也常将AI模型进行智商测试并分享结果。
然而,许多专家认为,用智商来衡量AI的能力不仅不足以反映真实情况,还具有误导性。牛津大学专注于科技与监管的研究员Sandra Wachter对TechCrunch表示,“人们很容易倾向于使用我们评估人类能力的标准来描述AI的能力或进步,但这就像是将苹果与橙子进行比较。”
在新闻发布会上,Altman似乎将智商等同于智能。然而,智商测试更多是关于特定类型智能的相对衡量,而非绝对衡量。它们通常被视为逻辑和抽象推理能力的良好指标,但在实际智能——即解决实际问题、使事物运作的能力——方面表现不足。此外,它们仅能提供一个人能力的瞬间快照。
Wachter指出,“智商是用来衡量人类能力的工具——本身就备受争议——基于科学家对人类智能的理解。但你不能用同样的标准来描述AI的能力。汽车比人类跑得快,潜艇在潜水方面更出色。但这并不意味着汽车或潜艇超越了人类智能。你是将某一个性能方面等同于复杂得多的人类智能。”
智商测试的起源与优生学有关,这是一门已被否定的通过选择性育种改善人类的理论。要在这些测试中表现良好,你需要良好的工作记忆和对西方文化规范的熟悉,这可能会引入偏见。华盛顿大学研究伦理AI的博士候选人Os Keyes认为,如果一个AI模型在智商测试中表现良好,这更多反映了测试的局限性,而非模型的实力。Keyes说,“如果你有几乎无限的记忆力和耐心,这些测试很容易被破解。智商测试是衡量认知、感知和智能的非常有限的方式,这一点我们在数字计算机发明之前就已经知道。”
AI在智商测试中可能具有不公平的优势,因为模型拥有庞大的记忆和知识储备。它们通常在公共网络数据上训练,这些数据包含大量智商测试问题。伦敦国王学院专注于AI的研究员Mike Cook指出,“测试往往重复非常相似的模式——提高智商的可靠方法就是练习智商测试,这正是每个模型实际上所做的。当我学习某事物时,我无法像AI那样以完美清晰度接收100万次信息,也无法在没有噪声或信号损失的情况下处理它。”
Cook还指出,智商测试因其固有的偏见是为人类设计的,用于评估一般问题解决能力。它们不适合AI,因为AI处理问题的方式不同。他说,“乌鸦可能能用工具从盒子里取出食物,但这并不意味着它能考进哈佛。当我解决一个数学问题时,我的大脑还要应对正确阅读页面上的文字、不去想回家路上要买的东西,或者房间里是否太冷。换句话说,人类大脑在解决问题时——无论是智商测试还是其他问题——都要应对更多事情,而且它们得到的帮助远少于AI。”
AI Now Institute的首席AI科学家Heidy Khlaaf对TechCrunch表示,我们需要更好的方法来测试AI。她说,“在计算历史中,我们从不直接将计算能力与人类能力进行比较,因为计算的本质意味着系统早已能够完成超出人类能力的任务。将系统性能直接与人类能力进行比较是一个近期现象,备受争议,围绕着不断扩展和变化的AI系统评估基准的争议也随之而来。”