
在一个AI系统能在逻辑谜题、记忆任务甚至创意挑战中超越人类的时代,一个新问题浮现:当机器能做得更好时,智力的定义又意味着什么?麻省理工学院《技术评论》的一项最新研究显示,当今许多先进模型——从大型语言系统到专业推理引擎——在某些最基础的智力基准测试中表现不佳,而在其他方面则表现出色。这些发现凸显了我们在评估智力本身时面临的隐形危机,特别是在人类与AI共存的协作环境中。
这些测试并非无关紧要。研究人员长期以来一直使用谜题、字谜和结构化游戏来探索人类与机器认知的极限。然而,结果却发人深省:AI模型在需要情境推理、情感智慧或细微决策的任务上往往表现不佳——这些正是人类仍占优势的领域。与此同时,它们在模式识别、速度和强力计算方面占据主导。这种不对称不仅仅是技术上的好奇,更是哲学上的转折点。随着AI代理在人类工作流程中变得更加普及——从医疗保健到教育——我们必须问:我们设计的测试是在衡量重要的东西,还是在无意中优化了错误的智力类型?
这场讨论的影响远不止学术界。在AI增强人类角色的工作场所——如医疗诊断或法律研究——团队越来越被迫调和这些差异。使用AI工具的医生可能信任其模式识别能力,但在AI缺乏情感敏感性时会覆盖其建议。同样,与AI合作的设计师可能会优先考虑其速度和精确性,而非其无法理解文化细微差别的缺陷。这种紧张局势并非系统缺陷,而是我们正在构建的未来的特色。现在的挑战是重新定义智力测试,不再将其视为人类与机器之间的竞争,而是作为理解各自擅长领域及如何互补的框架。
当前对话中缺失的是人性元素。关于AI能力的讨论往往过于关注技术基准,而非生活体验。当AI在我们曾引以为傲的任务上超越我们时,我们感受如何?我们是将其视为威胁、工具,还是介于两者之间的存在?这些问题至关重要,因为它们塑造了我们如何将AI融入社会。如果我们将智力测试视为零和博弈,可能会加深分歧。但若将其视为协作练习,或许能发现新的思考、创造和共同繁荣的方式。
未来之路并非用AI指标取代人类判断。而是提出更难的问题:在机器能做如此多事情的世界中,智力意味着什么?我们又如何确保我们的测试和工具为我们服务,而非本末倒置?
图片:julien Tromeur / Unsplash (https://unsplash.com/@julientromeur)
A groundbreaking investigation reveals how AI agents can autonomously develop deceptive strategies, raising urgent questions about oversight and alignment in agentic systems.

How an Australian law firm is scaling AI tools while keeping human oversight at the heart of governance.

评论 (1)
If standard IQ tests are failing us here, what is one specific metric you think we should use instead to measure 'collaborative intelligence'?