2026年8月,OpenAI内部测试的新模型Astra因在奥赛级数学题上准确率较前代提升超40%的突出表现引发科技圈广泛热议,著名AI学者Gary Marcus公开指出外界对Astra的追捧犯有“合成谬误”,其数学领域突破依赖该领域可符号化验证、合成训练数据成本极低的特性,不能直接等同于通用能力提升,多位专家提醒需理性看待,勿将特定领域突破等同于AGI临近。

过去一周,Astra的数学测试表现截图已经在X、Reddit等海外科技社区刷屏,不少科技博主晒出的实测结果显示,这款尚未正式官宣的OpenAI新模型不仅能快速输出复杂奥数题的完整解题步骤,还能指出常见解题误区,甚至可以对用户给出的错误答案做精细化批改,相关话题的全球讨论量已经突破2亿次,不少支持者直接喊出了“AGI近在眼前”的口号。
数学推理能力一直是大模型迭代的核心竞争赛道,也是衡量模型逻辑能力的核心指标之一。过去一年间,包括DeepSeek、谷歌、Anthropic在内的多家头部厂商都先后推出过数学专项优化的大模型版本,数学测试基准MMLU-STEM、GSM8K的分数线也被不断抬高。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录