编程 OpenMythos:10天破万Star,用PyTorch重建Claude Mythos的循环深度Transformer架构

2026-09-05 19:00:51

OpenMythos:10天破万Star,用PyTorch重建Claude Mythos的循环深度Transformer架构

2026年4月18日,一个叫 OpenMythos 的项目在 GitHub 上创建,仅用10天 Star 数就突破了10000。作者 Kye Gomez 今年22岁,整个项目压缩后只有68KB,完全基于 PyTorch 实现了一种名为 Recurrent-Depth Transformer(循环深度 Transformer)的架构。

简单来说,它是参考公开论文和社区假设,对 Anthropic Claude Mythos 的理论架构进行逆向重建的可运行代码。

背景:Claude Mythos 为什么引发关注

4月7日,Anthropic 发布了 Claude Mythos Preview。这不是一次普通的模型迭代,而是比现有旗舰 Opus 更强大的新一代模型。

官方披露的数据显示,Mythos 自主识别了数千个高危零日漏洞,覆盖主流操作系统和网页浏览器;在 CyberGym 基准测试中得分83.1%,网络安全能力超越绝大多数人类专家。Mozilla 的报告也提到,Mythos 在 Firefox 148 源代码中发现了271个零日漏洞,并在 Firefox 150 中完成修复。

但 Anthropic 做出了一个出人意料的决定:拒绝向公众发布。原因是网络安全风险——发现漏洞的能力同样可以被用于攻击。模型仅通过 Project Glasswing 向约40到48家合作伙伴开放,包括亚马逊、苹果、微软、Google、CrowdStrike、Cisco、JPMorgan Chase 等关键基础设施公司,专用于防御性安全研究。

这一决定在社区引发了讨论。支持者认为这是负责任的做法,质疑者则认为危险叙事可能被营销化。有独立安全研究机构用更小的开源模型复现测试,发现也能恢复出大部分分析,质疑 Mythos 的独特性是否被夸大。还有报道称,在7000个漏洞中,严重漏洞可能只有10个。

更关键的是,Anthropic 对技术细节完全保密,只发布了 System Card、Alignment Risk Update 和 Responsible Scaling Policy 三份文件,没有公开架构设计。社区一直在猜测 Mythos 到底用了什么架构。

OpenAI O1 和 DeepSeek R1 都是靠生成思考字符,把推理过程明明白白写出来。但 Mythos 不一样,它是在模型内部自己完成深度思考,输出结果时不展示中间推理步骤。

OpenMythos 的核心假设

在这个背景下,OpenMythos 出现了。作者给出的假设是:Mythos 可能采用了 Recurrent-Depth Transformer 架构。

同一组权重被反复使用,每次循环都在潜在空间里做一次推理迭代,但对外不输出任何中间结果。这就像人在思考问题时,先捋一遍大概思路,再往下多想一轮补上漏掉的细节,反复梳理之后最后再精简整合,提炼出关键内容。最终呈现出来的答案看着很简洁,其实私底下已经在脑子里来回打磨优化了好几遍。

这个假设不是空想,而是参考了 Loop, Think, & Generalize(2026)、Parcae(2026)、Reasoning with Latent Thoughts(2025)等多篇近期论文。OpenMythos 把这些理论变成了可运行的代码。

传统 Transformer 推理是一次过的:模型收到输入后,经过固定层数处理一遍,直接出结果,不会反复迭代。OpenMythos 则把架构分成三段:Prelude、Recurrent Block 和 Coda。

循环部分用一套参数就能重复调用、反复运行。每多循环一轮,内部状态就会更新一遍,模型也能慢慢想得更深、更全面。每次循环时,原始输入都会被重新注入,这是为了防止隐藏状态在深层循环中漂移,就像思考时时不时要把问题本身再看一遍,确保没跑题。

其他设计细节

OpenMythos 支持 GQA 和 MLA 两种注意力机制。FFN 层换成了混合专家 MoE 设计,把原本完整的 FFN 拆成一堆小型专家模块。推理时,路由机制会自动给每个 token 挑选最合适的前 k 个专家来干活,不用全部跑一遍。除了被路由选择的专家,还有少量共享专家始终激活,吸收跨领域通用知识,防止每个路由专家都重复学习语法、基本推理等基础内容。

项目提供了7种预设配置,从1B到1T,覆盖从实验到生产的各种需求。训练脚本也准备好了,单 GPU 和多 GPU 分布式训练都支持。

安装与使用

安装只需一行命令:

pip install open-mythos

接着就能用 Python 创建一个简单的模型。想要更深推理,可以调整 n_loops 循环参数,当然也需要更多计算时间。

社区争议与局限

OpenMythos 在社区也引发了争议。支持者认为这是开创性的工作:首次完整实现 Recurrent-Depth Transformer,基于多篇顶级论文,提供了可运行的 PyTorch 代码,为社区探索新型架构提供了工具。

质疑者则指出:这只是架构实现,没有预训练权重,需要大量资源从头训练;不确定是否真的接近 Claude Mythos 架构;作者 Kye Gomez 的 Open-X 系列项目有开源对标闭源的营销嫌疑。README 开头就声明了这是理论重建,与 Anthropic 无任何关联。

项目本身也有局限:无预训练权重,需要从头训练,门槛高;大规模模型100B+需要分布式训练,长上下文1M tokens需要大量显存;虽说 LTI 约束理论上能稳住训练、减少波动,但实际好不好用还得靠大量实测来确认;循环也不是堆得越多越强,深度一旦超标,模型容易想太多、过度推演,最后反而影响预测准确度。

OpenMythos 目前还处于早期阶段,没有预训练权重,需要从头训练。但方向是对的——让社区有机会探索新型架构,而不是只能等官方开源。如果你对 Recurrent-Depth Transformer 感兴趣,可以试试跑一个最小示例,感受一下循环推理的过程。

项目基于 MIT 协议开放。

项目地址:https://github.com/kyegomez/OpenMythos

推荐文章

程序员茄子在线接单