Tracking AI 的最新离线智商测试结果显示,GPT-5.6 系列模型的多个版本均取得了 136 分的成绩。这一分数首次突破了 130 分的“天才线”,意味着 GPT-5.6 的智商水平超越了全球约 99% 的人口。
在此次测试中,GPT-5.6 的表现尤为突出,其包含视觉模型在内的多个变体均达到了 136 分,远超其他竞争对手。紧随其后的是 Claude-5 Fable,得分为 130 分,而 GPT-5.6 LUNA Max 和 Claude-4.8 Opus 等模型则在 117 分至 123 分之间。此前,130 分的智商门槛一直未能被大型语言模型(LLM)跨越,GPT-5.6 成为首个突破该门槛的模型。值得注意的是,GPT-5.6 的多个版本,包括 SOL 和 TERRA 系列,均达到了这一高分,甚至其视觉版本也表现不俗。有开发者在 Reddit 上分享的测试体验也表明,GPT-5.6 在智商方面明显优于 GPT-5.5。
在实际应用方面,GPT-5.6 的表现同样令人瞩目。开发者 Amir Bohlooli 使用相同的物理模拟提示词,GPT-5.6 Sol 生成了一个包含粒子流体模拟、真实时间物理推进、CSS、界面和渲染的完整 HTML 文件,并自动托管为可分享网页。Ramanpal Singh 则利用一个提示词构建了一个基于 RAG 的客服工单系统,该系统具备四种角色、管理后台、嵌入式组件,并能自动进行投诉分类、情绪识别和回复起草,并且其开发成本远低于 Fable 5。另一位开发者 Claire Vo 曾被一个 bug 困扰,在切换到 GPT-5.6 Sol 后,该模型一次性修复了 bug,并帮助其他模型也成功运行。Vo 认为 Fable 过于追求技术上的绝对精确,而 Sol 则以务实的方式完成了任务。
对于 GPT-5.6 的表现,有网友认为这已经达到了通用人工智能(AGI)的水平。然而,需要指出的是,Tracking AI 的 136 分是基于其特定的离线 Mensa Norway 风格测试得出的,主要评估的是抽象模式识别和逻辑推理等标准化认知能力。IQ 测试并非为大型模型量身定制,它无法全面评估模型的可靠性、工具调用能力以及在真实职业场景中的表现。
尽管如此,实际的用户测试表明,GPT-5.6 正在将“会做题”和“会做事”的能力结合起来。虽然标准化测试中的题目可能在训练数据中出现过,但模型在处理全新、未见过的问题时的表现,更能体现其真正的“智商”。

精选权威赛事数据,精准即时更新内容,世界杯赛程与你一同发现更多精彩。
2024年5月13日
2026世界杯(中国地区)官方网站围绕世界杯赛事数据与球队分析服务展开布局,持续同步比赛时间、球队动态与实时比分内容。核心价值体现在更加精准快速的数据更新能力与全面专业的赛事资源覆盖。功能介绍包括赛事分析、赛程查询、球队资料与专题报道,同时通过持续优化平台结构与稳定的信息服务建立专业可靠的品牌形象。用户进入平台后即可轻松浏览世界杯相关赛事内容。立即加入2026世界杯(中国地区)官方网站,体验精彩足球赛事魅力。
2024年5月13日
精选世界杯直播内容,世界杯赛程与你一同发现更多精彩。
2024年5月13日
世界杯赛程专注足球世界杯,为用户提供专业可靠的体验。