一个匿名的 1M 上下文模型突然出现在 OpenRouter,值得试但别拿生产数据喂
OpenRouter 上最近多了一个模型 ID:stealth/ox-alpha。stealth,隐身,没有公司名,没有官网,没有发布会。开发者是谁,OpenRouter 说它自己也不知道,只知道是"一家选择匿名的第三方提供商"。
但它的配置不太像闹着玩的:
- 上下文窗口:1,048,576 Token(1M)
- 最大输出:131,072 Token
- 输入:文本 / 图片 / 视频
- 输出:文本
- 推理:强制开启
- 价格:免费
- 提供商:匿名 Stealth Provider
三件事凑一块——免费、1M 上下文、多模态——确实值得花十分钟跑一遍实际任务。但在这之前,有几个前提和限制得先讲清楚。
它是什么,不是什么
按 OpenRouter 的官方定位,Ox Alpha 是"面向高效编程、持续 Agent 工作以及现实世界生产环境打造的前沿模型"。它不是为了聊天设计的,目标场景是 Coding Agent、长上下文任务、多模态输入(代码 + 截图 + 视频)混合的活儿。
在 OpenRouter 的 Elo 榜上,官方描述把它放在 GPT-5.6 Sol 之后。一个连参数都没公开的匿名模型直接进顶级牌桌,社区讨论炸开是正常的。
但注意,"排名靠前"和"能力最优"是两回事。Elo 榜单反映的是用户投票和实际对战结果,不代表独立 Benchmark 结论。原文未提供任何第三方评测数据。
1M 上下文:容量是地基,检索能力才是天花板
上下文长度是 AI 编程工具的实际瓶颈。普通模型几十万 Token 到头,Ox Alpha 直接给到一百万。
这意味着一个大型项目的代码、文档、配置、依赖,理论上可以一次性全量塞进去,不用手动切文件、总结前情、拆代码段。
但窗口大不等于用得好。一百万 Token 塞进去,模型能不能精准找到开头第八行那个约定,取决于它对长上下文的检索和推理能力,而不只是窗口尺寸。这一点原文没有提供实测数据,建议拿自己的项目去压测。
多模态输入:真能用的场景
Ox Alpha 支持文本 + 图片 + 视频输入。这对 Agent 工作流很实用:
- 网页截图 → 让它照着改 HTML/CSS
- UI 设计图 → 让它对齐视觉结构
- 报错截图 → 让它结合代码定位问题
- 操作视频 → 让它看完找问题
这比纯文本模型多了一个交互维度,也是它被判断为"给下一代 Agent 工作流准备"的原因。
谁做的:社区猜了,但没实锤
社区主要猜它来自 GLM 系列,理由是 API 参数、行为特征、Tokenizer 与部分 GLM 模型相似,甚至有人声称模型某些情况下自称 GLM 或 Z.ai。
这里有个常识问题:模型的自称不能当证据。系统提示词、训练数据、模型配置都可能影响模型自我描述,甚至可能是提供商故意放的烟雾弹。目前所有归属猜测都是社区推测,官方一个字没认。
另一个猜想是某家顶级公司在匿名测试新模型。逻辑上说得通——同时拿着 1M 上下文、多模态、强推理、Agent Coding 四张牌还免费开放,算力账单不是小团队掏得起的。OpenRouter 数据也显示它上线前两天处理了数千亿级 Prompt Token 和数十亿级 Completion Token,调用量最高的应用是 Hermes Agent、Claude Code、Oh-My-Pi、DeepSeek Harness、ZCode。确实是拿来干活的,不是当聊天机器人玩。
但"合逻辑"不等于"是事实"。原文未提供任何证据支持具体归属。
使用方式
API 直连
OpenRouter 注册账号创建 API Key,配置:
Base URL: https://openrouter.ai/api/v1
Model: stealth/ox-alpha
兼容 OpenAI API 格式。
客户端方案
OpenCode(https://opencode.ai/)官方文档已将 Ox Alpha Free 列为限时免费的 Stealth 模型。拿到免费 API Key 后可接 Hermes Agent 等 Agent 工具使用。
限制和风险:这个必须说清楚
匿名 + 免费 + 强性能,不等于可以无脑上生产环境。
企业代码、私有项目、客户数据、API Key、数据库配置,扔进去之前先确认几个问题:
- 数据过谁的服务器——Provider 身份不明
- 数据保留多久——是否真的 Zero Retention
- 会不会拿去训练
- 免费期多长,限速多少,之后收不收费
不同平台的说法有差异。OpenCode 明确写提供商零数据保留,OpenRouter 那边要以当前模型页面和 Stealth 条款为准。原文作者的做法是只喂 demo 项目,公司代码一行没上。这是合理的保守态度。
另一个容易忽略的点:免费是限时的,限制会随测试阶段调整。 现在的价格、速率限制、数据政策都可能变化,原文未提供任何具体期限或变更时间表。
实际取舍
适合拿来压测的场景:
- 完整项目编写、大型项目修改、Debug、重构
- 整个代码仓库一次性分析
- 截图驱动的 HTML/CSS 修改
- 长时间运行的 Agent 任务(分析→写码→执行→报错→修改→再测试的完整循环)
需要注意的取舍:
- 模型归属不明,数据主权和隐私风险自担
- 免费期不确定,不建议在关键路径上形成依赖
- 性能描述基于 OpenRouter、OpenCode 公开信息和社区讨论,不代表独立 Benchmark 结论
- 模型处于预览测试阶段,价格、可用性、速率限制都可能变动
结论
Ox Alpha 值得花十分钟试一下,尤其是有长上下文或 Agent 任务的场景。但它的定位是"测试期的匿名免费模型",不是"可依赖的生产基础设施"。趁免费玩可以,把公司核心资产喂进去之前,先想清楚上面的问题。