Ox Alpha(模型标识:stealth/ox-alpha)是 2026 年 8 月 20 日悄然现身 OpenRouter 平台的一款匿名前沿大模型。它由一家选择保持匿名的第三方供应商开发运营,OpenRouter 仅负责请求路由。自上线以来,Ox Alpha 凭借百万级上下文窗口、多模态输入能力和免费预览策略,迅速成为 AI 社区讨论度最高的神秘模型。
关于其真实身份,社区存在多种猜测:主流技术分析认为它极可能是智谱 AI(Zhipu AI)尚未发布的 GLM-5.x 系列多模态旗舰模型(尤其是 GLM-5.3 的统一视觉版本),依据包括分词器指纹、视频编码器行为、输出风格等高度匹配;也有少数观点认为它可能是小米 MiMo 下一代版本,但缺乏直接技术证据。截至目前,没有任何官方机构确认或否认这些猜测。

Ox Alpha特点
表格
| 维度 | 具体特点 |
|---|---|
| 上下文窗口 | 1,048,576 Token(约 100 万),可一次性装入中型代码仓库或数小时视频内容 |
| 最大输出 | 131,072 Token(约 128K),远超常规模型的 8K-32K 上限,可一次性生成完整微服务模块或整套测试用例 |
| 多模态输入 | 支持文本、图片、视频三种输入模态,是 OpenRouter stealth 系列中首个支持视频输入的模型 |
| 输出模态 | 纯文本输出 |
| 定价策略 | 预览期内完全免费(输入、输出、缓存读取均为 0 元),免费窗口预计持续约一周 |
| 工具调用 | 支持工具调用、tool_choice 控制及 JSON 结构化输出 |
| 推理控制 | 支持 reasoning.enabled 参数,可启用深度推理模式 |
| API 兼容 | 兼容 OpenAI Chat Completions、OpenAI Resp大模型onses 和 Anthropic Messages 三种 API 格式 |
| 数据政策 | 提示词和生成内容会被供应商留存,但明确不用于模型训练 |
| 服务容量 | 运营方声称具备每日 100 万亿 Token 的处理能力 |
Ox Alpha技术原理
1. 推测架构
基于社区技术指纹分析,Ox Alpha 极可能采用与智谱 GLM-5V-Turbo 类似的 MoE(混合专家)架构:
总参数量:约 7440 亿参数
激活参数量:约 400 亿参数
解码速度:与 GLM-5V-Turbo 相差约 6%
2. 视频编码机制
技术溯源测试显示,Ox Alpha 的视频编码器呈现三项关键特征:
帧率无关的帧采样:视频处理不依赖原始帧率,采用统一的采样策略
时长缩放比例:约每秒 147 Token 的固定缩放比例
逐帧分辨率缩放:按帧进行分辨率自适应缩放
这些特征与 GLM-5V-Turbo 的视频编码行为完全一致,而与 MiMo、Qwen、DeepSeek 等其他候选模型存在明显差异。
3. 分词器指纹
多位独立开发者通过对比 10 款主流模型的 11 项分词器指标发现,Ox Alpha 在全部测试项中与智谱 GLM 系列高度吻合。例如,在数字处理测试中,Ox Alpha 与 GLM 均精准消耗 29 个 Token,而 DeepSeek 消耗 98 个 Token。
4. 长上下文工程
100 万 Token 上下文窗口的实现涉及:
高效注意力机制:支持超长序列的稀疏注意力或滑动窗口优化
内存优化:通过 KV-Cache 压缩、分页注意力等技术降低显存占用
位置编码:支持百万级序列的位置编码稳定性
Ox Alpha功能
Ox Alpha 的核心能力围绕编码和持续 Agent 工作流展开:
1. 代码全生命周期支持
代码生成、重构、调试、测试用例生成、代码解释
支持整库级代码分析,可一次性处理包含数千文件的项目
2. 多模态推理
结合文本、图片、视频进行联合推理
可将前端 Bug 录屏与源码结合,定位 CSS 动画冲突、状态竞争等复杂问题
3. 长周期 Agent 执行
持续读取文件、调用工具、跟踪修改状态
在包含 69 次工具调用的长任务中,仅出现一次错误,无重试循环
支持任务规划、状态总结、工作流推进
4. 结构化输出
支持 JSON 格式输出(暂不支持严格 JSON Schema 约束)
适用于需要机器可读结果的生产集成场景
5. 推理模式
可通过参数启用深度推理,展示完整思考链条
适用于数学证明、逻辑谜题、复杂决策等场景
Ox Alpha应用场景
表格
| 场景 | 说明 |
|---|---|
| 全仓库代码重构 | 利用 1M 上下文一次性投喂整个代码仓库,进行跨文件依赖分析、架构重构、测试补全 |
| 前端视频排障 | 将前端交互 Bug 的录屏(MP4/WebM)与源码一起发给模型,结合视觉和代码定位问题 |
| 长周期软件工程 | 处理涉及服务边界、数据库迁移、API 合同版本变更的复杂维护任务 |
| 网络安全攻防 | 在 CyberGym 等安全基准中达到 SOTA 水平,适用于漏洞分析、渗透测试辅助 |
| Agent 自动化工作流 | 作为 Coding Agent 的执行模型,持续跟踪多步骤任务状态,自动调用工具并修正错误 |
| 大规模文档分析 | 一次性处理完整的技术文档库、法律合同或研究论文,进行跨文档关联分析 |
| 生产环境监控与诊断 | 结合日志、监控截图和配置文件,进行故障根因分析和修复方案生成 |
Ox Alpha性能表现(社区实测)
以下为上线后社区独立测试的非官方成绩:
表格
| 基准测试 | 成绩 | 对比参考 |
|---|---|---|
| Terminal-Bench 3.0 | 28.3 分 | GLM-5.2 仅 4.6 分 |
| DeepSWE v1.1 | 66.9 分 | 处于当前第一梯队 |
| CyberGym | SOTA 级 | 网络安全能力涌现式跃升 |
| 社区 10 项编码任务 | 80% 通过率 | 同场测试其他旗舰约 52%-65% |
运行稳定性:
- 平均吞吐:约 51 Token/秒
- 首 Token 延迟(P50):约 2 秒
- 工具调用错误率:约 3.3%
- 3 天可用性:99.99%
社区横向口碑认为,Ox Alpha 综合能力强于 Kimi K3,与 Claude Fable 5、GPT-5.6 Sol 大致处于同一档位。
Ox Alpha使用方式与注意事项
接入方式:
- OpenRouter:直接使用模型 ID
stealth/ox-alpha,兼容 OpenAI/Anthropic API 格式 - OpenCode Zen:开源编码 Agent OpenCode 已将其加入免费模型池
- IDE 集成:可在 Claude Code、Cursor、Zed、Aider、Cline 等工具中通过自定义端点接入
使用建议:
- 趁免费窗口期处理积压的大规模重构、文档补全等重活
- 整库任务一次完成,避免零散提问导致上下文污染
- 单任务保持专一,不要在同一会话中混杂多个无关项目
风险提示:
- 免费为限时预览,随时可能变价或下线
- 匿名供应商身份不明,含密钥、商业机密的请求不建议发送
- 生产环境接入务必保留回退路由(fallback provider)
最后想说:Ox Alpha 是 2026 年下半年最值得开发者关注的免费前沿模型之一。它以百万级上下文、多模态输入和强大的编码 Agent 能力,重新定义了”整库级 AI 辅助开发”的可能性。无论其最终身份是智谱 GLM 还是其他顶级实验室的作品,它都代表了当前大模型在代码理解和长程任务执行上的前沿水平。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



