2026-09-04
9757
谈球吧为您带来今日精选:
近日,OpenAI新一代Astra模型采用了"循环深度"的全新推理方法引发广泛关注。该方法大幅减少了思考Token的使用,却显著提升了模型性能,展现出强大的技术潜力。然而,这一创新也带来了新挑战:Astra的思考过程变得完全"隐形",甚至连OpenAI自身都难以清晰理解AI的推理过程。
OpenAI首席科学家Jakub Pachocki对此做出回应,表示内部前沿模型的计算图深度仅约为GPT-4的两倍,远没有外界传闻那么夸张。与此同时,有消息称GPT-6-Astra的名称已出现在OpenAI API上,预计很快就会正式发布。
与传统Transformer的线性处理方式不同,循环Transformer采用了创新的循环使用机制。信息不再单向穿过网络一次,而是在同一组Transformer层中反复循环,从而提高推理深度。这种方法就像螺旋上升的楼梯,虽然踏步数量相同,但通过增加圈数就能到达更高处。
学术界对这一技术早有探索。谷歌2025年的研究论文显示,包含k层、循环L次的Transformer在多个推理任务中的表现,可以媲美传统k×L层的普通模型。今年2月,另一篇关于潜在推理的论文进一步验证了这种架构的强大效果:一个35亿参数的模型通过核心块的多次循环运算,取得了相当于500亿参数大模型的性能。
值得注意的是,循环Transformer不仅节省了参数和显存开销,更重要的是开启了计算性能的超频模式。这一技术突破对于正处于激烈竞争中的OpenAI而言,无疑具有巨大的吸引力。
然而,这种技术进步也带来了新的挑战。Astra模型虽然仍通过语言进行问题思考,但更多思考过程已经转向无声化。传统模型中,AI的推理过程必须通过语言token输出,这为人类理解AI思维提供了一个窗口。而在循环Transformer架构下,模型的推理过程完全内化于向量空间中,人类失去了观察和理解AI思维的通道。
Meta早前的研究指出,模型使用数字和向量进行推理,可能比强迫其使用人类语言更加准确和高效。这种"无声思考"的方式虽然提升了效率,但也带来了透明度降低的风险。
循环Transformer架构在数学和编程等领域展现出独特的优势。它能够更好地处理需要多次迭代的任务,如提出方案、检查错误、更新状态等。这种技术革新正在为人工智能领域开辟新的发展方向。
更多精彩内容,欢迎继续关注谈球吧·(中国)-官方网站最新报道。