Raschka 万字拆解 GPT-6 Astra:循环架构和隐藏的推理链
Sebastian Raschka 试完 GPT-6 Astra 之后,给了一个在他嘴里算很高的评价:「可能是我用过的最好的模型」。 但这篇长文真正的重心不在夸 Astra 有多强,而在追一个未证实的传闻:The Information 说 Astra 用了「循环深度」——也就是 looped transformer。Raschka 花了几千字把这门技术从头到尾拆了一遍,然后给出自己...
新闻摘要
Sebastian Raschka 试完 GPT-6 Astra 之后,给了一个在他嘴里算很高的评价:「可能是我用过的最好的模型」。 但这篇长文真正的重心不在夸 Astra 有多强,而在追一个未证实的传闻:The Information 说 Astra 用了「循环深度」——也就是 looped transformer。Raschka 花了几千字把这门技术从头到尾拆了一遍,然后给出自己...
来源信息
来源:OSCHINA 开源中国。本文同步 RSS 提供的摘要,完整内容请通过下方链接阅读原文。
原文发布时间:2026-09-10 02:47:56 UTC
资料与延伸阅读
你可以通过以下原始资料核对文中概念,并继续深入阅读。