Ox Alpha – 牛来智谱AI投放OpenRouter匿名MoE模型介绍

Ox Alpha 是智谱 AI 在 OpenRouter 平台匿名投放的测试代号,对应的正式产品为 GLM‑5.3‑Flash,国内开发者也称其为 “牛来”。上线初期不对外披露开发主体,面向编程、长周期智能体任务、线上生产负载打造。模型支持文本、图片、视频输入,上下文窗口达到 105 万 token,单请求最大输出 13.1 万 token。前期开放免费预览,配套大规模推理算力,后续切换为标准付费 API 服务,权重同步对外开放,支持本地部署。整套模型采用 MoE 混合专家架构,总参数量 320B,激活参数 18B,算力运行依托国产芯片硬件集群。

Ox Alpha - 牛来智谱AI投放OpenRouter匿名MoE模型介绍

Ox Alpha特点

百万级上下文窗口可以完整接纳整套代码仓库、长篇技术文档,长文本信息检索留存表现稳定。支持图像、视频素材解析,录屏截图都可以直接作为任务输入素材,不支持音频输入。代码任务实测表现突出,面对大型仓库的调试、重构任务可以交出可用结果。工具调用稳定性高,长轮次智能体任务过程中很少出现工具调用错乱。

匿名预览阶段开放高吞吐量接口,可承接大规模并发请求。兼容 OpenAI 接口规范,原有业务代码改动很少即可完成接入。同时提供云端 API 和开源权重两套交付形态,企业可以选择公有云调用或是本地私有化部署。

Ox Alpha技术原理

底层采用混合专家 MoE 架构,总参数量 320B,推理阶段只激活 18B 参数。使用稀疏‑线性混合注意力机制,适配超长上下文场景,降低长序列计算开销。训练数据规模达到 30 万亿 token,样本集合纳入大量软件工程样本、智能体多轮交互样本、图文视频多模态素材。

多模态编码器把图片、视频内容转成模型可识别令牌,和文本序列合并送入主干网络完成统一计算。专家路由模块根据输入任务类型激活对应子模块,编程、推理、多模态任务分配给不同专家子网处理。推理集群跑在国产芯片之上,配套软硬件优化,把单 token 推理成本控制到主流 GPU 同等区间。开源版本支持 MIT 协议,允许企业做二次调优与业务改造。

Ox Alpha功能

长文本读取解析,完整加载大型代码库、技术手册、项目文档,完成内容理解与信息抽取。

代码相关处理,包含代码生成、BUG 定位调试、项目重构、测试用例编写、代码解读。

多模态内容解析,读取截图、架构图、操作录屏视频,结合画面内容给出文字方案。

智能体工具调用,多轮执行复杂任务,自主调用外部工具,分步完成目标。

长输出生成,单次请求产出大篇幅文档、完整项目代码、方案材料。

标准 API 服务,兼容 OpenAI SDK,业务系统直接对接调用。

本地私有化运行,下载权重,在内网硬件环境完成全部推理计算。

Ox Alpha应用场景

软件工程研发,直接喂入完整项目仓库,开展代码审查、缺陷排查、模块重构。

智能体应用搭建,开发长流程 Agent 业务,处理需要多步工具调用的复杂任务。

技术文档处理,读取成百上千页资料,完成摘要提取、方案撰写、问题答疑。

视频截图辅助排障,上传程序录屏、报错截图,定位软件运行出现的问题。

企业业务系统接入,把模型能力嵌入内部平台,处理大批量业务文本与代码任务。

离线内网环境部署,敏感项目数据不对外流出,本地硬件完成模型运行。

科研与模型实验,开发者下载开源权重,做二次微调、技术验证。

Ox Alpha同类产品对比

表格

对比项Ox Alpha(GLM‑5.3‑FlashClaude Fable 5
研发主体智谱 AI(Z‑AI)Anthropic
产品定位匿名内测的多模态 MoE 基座,面向长代码库处理、长周期 Agent 生产任务旗舰闭源大模型,侧重复杂推理、长文档与企业 Agent 业务
核心特色105 万 Token 上下文,支持文本 / 图像 / 视频输入;代码与工具调用链路表现突出,最大输出 131072Token,匿名预览阶段可免费调用200 万 Token 上下文窗口,强逻辑推理,文档理解、安全对齐成熟,结构化输出稳定,企业 API 生态完善
部署方式OpenRouter 聚合 API 调用Anthropic 官方 API、第三方聚合平台
适用场景大型代码库审查、复杂 Agent 自动化、图文视频混合任务、开发者测试企业文档分析、复杂业务流程智能体、法律业务、多语种企业服务
© 版权声明
为这篇文章评分
10.0/ 10
2 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...