Neon 开源 4B 模型是由 Neon(云原生 Serverless PostgreSQL 数据库公司)与 Castform(AI 语音智能体与模型训练平台)于 2026年8月6日联合发布的一套面向智能体式检索任务的模型训练方案及后训练模型。
该模型基于一个 40亿参数(4B) 的开源基础模型,通过强化学习进行后训练,专门优化其在文档搜索场景中的决策能力——即教会模型”该搜索什么”。在 Neon 的验证中,该模型在文档搜索准确率上超越了 OpenAI 的 GPT-5.6 Sol,而单次推理成本仅为后者的 1/100。
需要特别说明的是,Neon 本身是一家数据库公司,并非传统意义上的AI模型厂商。这个4B模型是Neon为了解决自身业务场景中的检索成本问题而联合训练的产物。

Neon 4B核心特点
1. 专注检索决策,而非通用对话
这不是一个通用大语言模型,而是一个专门为智能体式搜索(Agentic Search)优化的专用模型。它的核心能力不是回答问题本身,而是判断”面对一个复杂问题时,应该搜索什么、怎么拆分问题、如何基于搜索结果发起下一轮搜索”。
2. 极小参数,极强表现
仅40亿参数,却在特定检索任务上击败了参数量大数十倍乃至上百倍的 GPT-5.6 Sol 和GPT-5.4验证了”在垂直任务上,精调小模型完全可以击败通用大模型“这一趋势。
3. 成本断崖式下降
单次推理成本仅 $0.000929(约0.0063元人民币),而 GPT-5.6 Sol 为 $0.087338(约0.59元人民币),成本差距接近100倍。
4. 完全开源
模型权重和训练方案均开源,开发者可以自由部署、微调和商用。
Neon 4B技术原理
1. 从嵌入式搜索到智能体式搜索
传统文档搜索采用嵌入式搜索(Embedded Search):把文档转为向量,通过相似度匹配找到相关内容。这种方式简单高效,但在面对复杂、多步推理型问题时力不从心。
随着AI智能体的普及,搜索范式正在转向智能体式搜索(Agentic Search):AI模型把一个大问题拆成多个子问题,自主决定搜索查询词,查看搜索结果,再基于结果发起下一轮搜索,循环迭代直到收集到足够信息。这种方式更适合处理复杂问题,但每次搜索都需要调用大模型来”思考下一步该搜什么”,导致耗时和成本急剧上升。
2. 强化学习后训练
Castform 选择了一个相对较小的开源模型(4B参数)作为基座,通过强化学习(Reinforcement Learning)进行后训练。训练流程如下:
- 模型尝试完成检索任务(拆分问题、生成查询、判断结果)
- 系统对结果进行多维度打分:是否找到正确文档、是否引用合适段落、最终答案是否正确
- 评分结果作为奖励信号反馈给模型,纳入后续训练迭代
- 模型逐步学会”什么样的搜索策略能拿到高分”
3. 分工协作架构
整个方案采用清晰的双角色分工:
- Neon 负责提供文档存储和搜索基础设施(数据在哪、怎么检索)
- Castform 负责训练模型学会决策”该搜索什么”(搜索策略和查询生成)
两者结合,构成了一个完整的智能检索管线。
Neon 4B核心优势
1. 性能:刷新纪录
在 Neon 的验证基准中:
表格
| 模型 | 平均评估分 |
|---|---|
| Neon 4B(后训练) | 1.447 |
| GPT-5.6 Sol | 1.369 |
| GPT-5.4 | 1.377 |
Neon 4B 模型刷新了该验证的最高纪录,超过 GPT-5.6 Sol 约 5.7%。
2. 成本:百分之一
表格
| 指标 | Neon 4B | GPT-5.6 Sol |
|---|---|---|
| 单次推理成本 | $0.000929 | $0.087338 |
| 单次搜索耗时 | 远低于10秒 | 超过10秒 |
| 成本倍数 | 1x | ~94x |
对于需要高频调用搜索能力的AI智能体应用而言,这意味着运营成本可以降低两个数量级。
3. 部署灵活
4B参数量的模型对硬件要求极低,可在消费级GPU甚至CPU上运行,支持本地部署和私有化部署,无需依赖任何第三方API。
4. 开源可定制
完全开源意味着开发者可以:
- 在自己的文档集上进一步微调
- 适配特定行业的检索需求
- 与现有系统深度集成
- 自由修改和分发
Neon 4B应用场景
1. AI智能体的检索引擎
这是最核心的场景。当AI智能体需要从企业知识库、产品文档、法规库等大规模文档中查找信息时,用Neon 4B替代GPT-5.6 Sol作为”搜索决策大脑”,在不牺牲准确率的前提下大幅降低成本。
2. 企业知识问答系统
客服机器人、内部知识助手等需要频繁检索企业文档的场景。Neon 4B负责理解用户问题并生成精准的搜索策略,配合Neon数据库完成文档检索和答案生成。
3. RAG(检索增强生成)管线优化
在RAG架构中,检索质量直接决定最终回答质量。Neon 4B可以作为RAG管线中的”查询规划器”,负责将复杂问题拆解为多个精准检索查询,提升整体检索召回率。
4. 法律/医疗/金融等专业领域检索
这些领域的文档量大、专业性强、查询复杂度高,智能体式搜索的优势尤为明显。Neon 4B可以在特定领域文档上进一步微调,实现专业级的检索决策能力。
5. 端侧与边缘部署
4B参数量足够小,可以部署在边缘设备或本地服务器上,满足数据不出域的合规要求,适合对数据隐私敏感的机构使用。
6. 多智能体系统中的轻量路由
在多智能体架构中,Neon 4B可以充当”路由判断”角色——决定一个查询应该交给哪个模型处理,既节省成本又保证质量。
最后想说
Neon 4B模型的出现验证了一个重要趋势:在特定垂直任务上,经过强化学习精调的小模型完全可以击败通用大模型。这不是靠堆参数,而是靠”把知识放到外部系统,把参数留给认知核心”的设计哲学——模型不需要记住所有知识,只需要学会”怎么找到知识”。
这与Andrej Karpathy此前提出的”认知核心”理念高度吻合:将模型中的记忆性知识剥离,保留思考算法和问题解决策略,让模型更轻、更强、更高效。
对于正在构建AI智能体应用的团队而言,Neon 4B模型提供了一个极具吸引力的选择——用1%的成本,获得甚至超越顶级闭源模型的检索决策能力。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



