Ornith-1.5是由知名NLP学者李纪为创立的AI团队DeepReinforce发布的开源大模型系列,是此前Ornith-1.0的全面迭代升级版,专为Agentic编程(智能体编程)任务设计。该系列核心亮点是引入端到端“自我改进循环”训练机制,让模型在训练过程中自主提出任务、生成任务专用脚手架并完成求解,通过强化学习不断优化自身,实现能力自主进化。系列包含三个规格,全部以MIT许可证开源,允许不受限制的商业和研究用途。

Ornith-1.5特点
- 三档规格全场景覆盖:提供Ornith-1.5-397B(MoE,3970亿参数旗舰版)、Ornith-1.5-35B-A3B(MoE,350亿参数中端版)、Ornith-1.5-9B(稠密模型轻量版)三种尺寸,并额外提供9B的移动端量化版Ornith-1.5-9B-Mobile,从云端服务器到智能手机均可部署,同步提供FP8、GGUF、MLX、NVFP4等多种量化版本适配不同硬件生态。
- 自我改进循环训练:区别于传统由研究者手工设计固定训练流程的方式,Ornith-1.5让模型自己提出新任务、生成任务专属的脚手架(scaffold)、产出解题过程,再通过强化学习持续迭代,形成“出题—解题—反馈—提升”的闭环,是训练范式上的重要创新。
- 性能越级表现:旗舰397B版本在Terminal-Bench 2.1(86.1对85.0)和SWE-Bench Verified(86.0对85.8)上超越Claude Opus 4.8,在推理、智能体和编码任务中达到与Opus 4.8相当的水平;9B稠密版在多数测试中性能优于参数规模更大的Gemma-4-31B,35B版本每个Token仅激活约3B参数,在NL2Repo基准上以46.2领先Qwen3.8-27B的42.3。
- 完全开源+MIT许可:模型权重和训练代码全部公开,商业使用无限制,对开发者和企业极其友好。
Ornith-1.5技术原理
Ornith-1.5将Ornith-1.0的“自脚手架”策略升级为完整的端到端自我改进循环。传统强化学习训练中,模型在人类设计的固定测试框架下生成解决方案,而Ornith-1.5将“设计解题流程”本身也变成可学习的对象:模型先根据任务需求提出新的训练任务,再生成针对该任务的专属脚手架(包含工具调用、错误处理、任务拆解的完整工作流),最后基于脚手架生成解决方案,奖励信号同时回传给任务生成、脚手架设计和方案生成三个阶段,通过GRPO(分组相对策略优化)算法持续优化,实现“出题—解题—反馈—提升”的闭环。
为防止模型在自我改进过程中出现reward hacking(如硬编码测试答案、篡改验证环境),团队设置了三层防护机制:固定外层信任边界防止模型篡改环境,确定性监视器拦截越权行为,冻结的LLM裁判在验证器之上做最终否决,确保模型通过真正解决问题获得奖励。
架构上,397B和35B版本采用混合专家(MoE)架构,通过动态路由机制实现参数的高效利用,在保持计算效率的同时提升模型容量;9B版本为稠密模型,采用GatedDeltaNet+GatedAttention混合注意力架构,原生支持256K上下文,可高效处理大型代码库。
Ornith-1.5功能
- Agentic编程:核心能力,支持模型自主规划任务、拆解步骤、调用工具、执行代码、修复错误,完成从需求理解到代码交付的全流程。
- 自脚手架生成:模型能根据任务自动生成专属的任务框架和工作流程,不再依赖人工预设的固定模板,遇到条件变化时能自主调整方案。
- 工具调用与Agent交互:原生支持OpenAI标准的tool_calls格式,可无缝对接各类Agent框架和MCP服务器,完成“问题分析→工具选择→结果整合”的全链路。
- 代码生成与理解:支持大型代码库的结构理解、符合项目规范的代码片段生成、代码修复与重构,多语言编程能力突出,覆盖Python、JavaScript、Java、Go、Rust等主流语言。
- 多步推理:内置结构化思考机制,在数学问题、逻辑推理等复杂决策场景中逐步推导,提升准确性。
- 多模态输入:支持文字、图片、视频等多模态输入,可结合视觉信息完成代码相关任务。
- 多格式部署:提供FP8、GGUF、MLX、NVFP4等多种量化版本,适配vLLM、SGLang、Transformers、llama.cpp、Ollama等主流推理框架。
Ornith-1.5应用场景
- 智能编程助手:开发者可将其作为本地编码Agent的“大脑”,对接终端工具实现自主写代码、跑测试、修bug的完整开发循环。
- 软件工程自动化:自动处理代码修复、功能实现、终端命令执行等软件工程任务,在SWE-Bench等真实代码修复基准上表现突出。
- 端侧AI应用:9B-Mobile版本适合部署在手机、平板等移动设备上,支持离线场景下的代码辅助、文档分析等轻量级智能任务。
- 企业私有化部署:MIT开源许可+多种量化格式,适合对数据安全有要求的企业在本地服务器上部署专属编程Agent。
- AI研究与教育:自我改进循环的训练方法为学术界提供了新的研究范式参考,多规格模型也适合教学演示和实验对比。
- 个人开发者本地工作流:9B版本单张消费级显卡即可运行,个人开发者可在笔记本上搭建私有的AI编程助手,无需依赖云端API。
Ornith-1.5同类产品对比
表格
| 对比维度 | Ornith-1.5 | DeepSeek-V4-Flash |
|---|---|---|
| 研发主体 | DeepReinforce(Ornith AI) | 深度求索 DeepSeek |
| 产品定位 | MIT 协议开源的自改进编码与 Agent 模型家族,主打端到端自主迭代能力 | 开源通用大模型,编码与工具调用为核心优势方向 |
| 模型规格 | 397B MoE / 35B MoE / 9B 稠密三档,9B 提供可端侧运行的量化版本 | MoE 混合专家架构,单 Token 激活参数少,推理成本低 |
| 核心技术 | 全链路自改进循环,自主生成训练任务、解题脚手架与解决方案,通过强化学习完成自我迭代升级 | 多模态统一底座 + 长上下文优化,原生深度适配工具调用与 Agent 执行链路 |
| 核心特色 | 小参数规模下终端任务表现对标闭源旗舰;全版本无商用限制;中小版本单消费级显卡即可部署 | 通用能力均衡,长上下文稳定性强;工业级落地生态成熟,配套工具链完善 |
| 代表能力 | 终端 Agent 执行、代码自动化优化、软件工程任务、自主解题迭代 | 代码生成调试、多工具协同调用、长文档处理、全场景通用推理 |
| 适用场景 | 自托管私有编码智能体、端侧开发辅助、自动化软件工程、自改进模型科研 | 企业级代码助手、全行业 Agent 应用、长文本业务处理、通用 AI 能力底座 |
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



