Nemotron 3.5 Lightning 是英伟达(NVIDIA)正式发布的一款开源混合专家(MoE)大语言模型,定位为智能体系统中的”执行层工人模型”。该模型总参数量为300亿,但每次推理仅激活约30亿参数,专为长时运行的自主智能体(Agentic AI)中的高频执行任务而设计,包括代码审查、工具调用、安全警报监控、账单问答等场景。模型采用OpenMDW-1.1许可证,权重、训练数据与训练方案完全开源,企业可免费下载、使用和修改,无需向英伟达申请额外许可。这是英伟达CEO黄仁勋公开表态支持开源模型后发布的首款开源产品,标志着英伟达从”算力供应商”向”开源模型生态构建者”的战略延伸。

Nemotron 3.5 Lightning核心特点
- 极致参数效率:300亿总参数中每Token仅激活约30亿,以不到10%的激活比例承载了接近120B级模型的任务执行能力,在PinchBench基准测试中准确率达86%,完成1万个智能体任务的速度比Qwen3.6-35B快约30%,同时保持相当的准确率水平。
- 同类最快输出速度:输出速度接近每秒670个Token,相比同规模开源模型最高提升4倍,智能体任务整体完成速度提升30%,在Artificial Analysis Intelligence Index评测中得分24,处于准确率与速度的帕累托前沿。
- 单GPU本地运行:可在消费级GPU(如GeForce RTX 5090)上流畅运行,同时兼容NVIDIA RTX PC、DGX Spark、DGX Station及Jetson等本地设备,无需联网或调用云端API,降低部署门槛与数据隐私风险。
- 百万级上下文窗口:支持100万Token的上下文长度,可一次性处理整本《红楼梦》或数千页财务报告,适合长文档分析和代码仓库理解场景。
- 完全开源可定制:OpenMDW-1.1许可证下权重、训练数据、方法配方全部开放,企业可通过NeMo工具用自有数据进行后训练与微调,实测仅需单张H100、约85美元、两小时即可完成领域定制。
- 与NeMo Switchyard协同:同步发布的开源模型路由库NeMo Switchyard可根据任务复杂度自动分配模型——复杂规划交给前沿大模型,高频执行交给Lightning,实测可将任务成本降至单独使用Opus 4.8的近三分之一。
Nemotron 3.5 Lightning技术原理
- 混合专家(MoE)稀疏激活架构:模型配置了大规模路由专家池,每个Token仅动态激活约30亿参数的专家子集进行计算,其余专家保持休眠。通过可学习的路由器为每个Token分配最优专家组合,并辅以负载均衡机制防止专家退化,使模型以极低的计算成本获得远超同规模稠密模型的知识容量。
- Mamba-Transformer双架构融合:综合了Mamba状态空间模型与Transformer注意力机制的优势。Mamba架构负责高效的长序列增量建模,解决长上下文Agent工作流中KV Cache内存膨胀的瓶颈;Transformer层负责精确的全局注意力计算,保障复杂指令理解与多步推理的准确性。两者的混合设计使模型在100万Token上下文下仍能保持高效推理。
- 多Token预测(MTP)训练目标:在训练阶段引入多Token预测机制,模型不仅预测下一个Token,还同时预测后续多个Token,提升单次前向传播的信息产出效率,同时为推理阶段的推测性解码提供天然的技术基础。
- 三重推测性解码加速:提供三种推测解码方案——内置MTP草稿头、DSpark草稿模型(针对DGX Spark和低并发场景优化)、DFlash草稿模型(针对高吞吐数据中心场景优化)。小模型并行生成多个候选Token序列,由主模型批量验证,将自回归生成的串行瓶颈转化为并行验证,实测输出速度提升最高达4倍。
- NVFP4量化通用格式:采用英伟达专有的NVFP4量化格式,使同一份模型检查点可从数据中心无缝部署到桌面端和边缘设备,无需针对不同硬件维护多套权重,大幅简化运维复杂度。
- 蒸馏训练策略:通过知识蒸馏从英伟达更大规模的Nemotron系列模型中迁移能力,在保持任务执行精度的同时将参数规模压缩至可本地部署的水平。英伟达同步发布了Nemotron-RL-Agentic-Terminal-Pivot数据集,用于进一步强化编码智能体能力。
Nemotron 3.5 Lightning主要功能
- 高频工具调用执行:高效完成调用外部API、执行代码、验证结果、委派子任务等智能体系统中的高频操作,减少大型推理模型的调用次数,降低整体运行成本。
- 代码审查与生成:支持代码理解、审查、调试和修复,经企业微调后在编码任务上可达到超越通用前沿模型的专项准确率。
- 安全警报监控:实时分析安全日志与告警信息,快速识别异常模式并生成响应建议,适用于网络安全运营中心(SOC)的自动化值守。
- 文档分析与知识问答:基于百万级上下文窗口处理长篇文档,完成信息抽取、摘要生成、合规审查、账单问答等任务。
- 任务委派与结果校验:在多智能体系统中承担子任务的执行与验证角色,将复杂任务拆解后的具体执行步骤高效完成,并通过反馈循环确保结果正确性。
- 多智能体协同执行:与NeMo Switchyard配合,在”规划模型+执行模型”的分层架构中承担执行层角色,接受上游规划模型的指令并完成具体操作。
- 边缘设备推理:可在Jetson等嵌入式AI平台上运行,支持工业巡检机器人、智能家居等端侧场景的本地推理,无需云端依赖。
Nemotron 3.5 Lightning项目地址
- 项目官网:https://developer.nvidia.com/blog/nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents/
Nemotron 3.5 Lightning应用场景
- 智能体系统执行层:在长时运行的自主智能体中承担高频、重复的执行工作——工具调用、代码执行、结果验证、子任务委派,将前沿大模型从海量执行调用中解放出来,专注于复杂推理与规划。LangChain实测将145个多轮深度智能体任务的成本降低了74%,仅将7%的调用路由至前沿模型。
- 网络安全运营:CrowdStrike已将Nemotron 3.5 Lightning用于安全警报的实时分析与响应,模型可高速处理海量告警日志,自动分类威胁等级并生成初步处置建议,降低安全分析师的工作负荷。
- 代码审查与DevOps:CodeRabbit结合Baseten将其部署为代码审查智能体的核心引擎,自动分析Pull Request、识别潜在缺陷、生成审查意见,单张H100上即可完成定制化路由智能体的训练。
- 法律服务自动化:Harvey与Trajectory利用该模型处理法律文档分析、合同条款审查、案例检索等高频任务,在保持专业准确性的同时大幅降低法律AI服务的运营成本。
- 科学研究辅助:Lila Sciences将其用于物理和生命科学领域的实验数据分析、文献检索与假设生成,加速科研迭代周期。
- 软件开发与金融医疗:Fastino Labs针对软件开发、金融分析和医疗工作负载进行定制,在各自领域取得了领先的专项准确率。
- 企业私有化智能体部署:中小企业和个人开发者可在单块消费级GPU上搭建本地智能体系统,数据不出域,无需API费用,适合对隐私合规要求高的行业场景。
- 边缘AI与物联网:部署在Jetson平台上驱动工业巡检机器人、智能硬件等边缘设备,实现本地化的实时决策与自动化控制。
Nemotron 3.5 Lightning部署与获取方式
表格
| 方式 | 适用场景 | 说明 |
|---|---|---|
| Hugging Face / ModelScope | 研究、微调、本地部署 | OpenMDW-1.1协议,权重+数据+配方完整开放 |
| Ollama / llama.cpp / LM Studio | 个人开发者快速体验 | 一行命令启动,上手成本最低 |
| NVIDIA build.nvidia.com | 云端API调用 | 免费体验,无需本地GPU |
| OpenRouter | 第三方应用集成 | 提供免费API端点 |
| NeMo工具链 | 企业级微调与部署 | 支持后训练、强化学习与领域定制 |
模型推荐显存配置:24GB为入门门槛,128GB统一内存设备(如Mac Studio)体验最佳。英伟达同时正在推进万亿参数级别的Nemotron 4系列,未来将形成”Nemotron 4负责规划决策 + Nemotron 3.5 Lightning负责高频执行”的分层智能体架构。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



