dots3-note preview – 小红书开源发布的多模态大语言模型

dots3-note preview小红书(RedNote)dots 模型实验室(Dots Studio)开源发布的多模态大语言模型,采用Apache 2.0 协议。它是 dots3 系列的首个公开版本,也是该系列中最轻量级的成员,主打长程智能体(long-horizon agency)与复杂现实任务处理能力。

该模型的同系列前代版本 dots-note-3.0 曾在 2026 年国际数学奥林匹克(IMO)竞赛中获得官方认证的满分 42 分,成为首个达成此成就的 AI 系统。

dots3-note preview - 小红书开源发布的多模态大语言模型


dots3-note preview核心特点

表格

特点说明
长程智能体专为需要数小时甚至数天完成的开放域任务设计,能独立推进并交付结果,而非仅回答单轮问题
多模态原生理解统一处理文本、图像、视频(含音频轨道)和音频输入
超长上下文支持 512K tokens 上下文窗口,可处理整本书、长视频或大型代码库
轻量高效 MoE总参数 280B,仅激活 16B,在算力与效果之间取得平衡
开源可商用Apache 2.0 协议,权重、评测工具、评估环境全部公开
自主学习纠错具备 Self-Critiquing 机制,出错时自动修正并写入动态记忆
交互式任务执行无需专门训练即可接管游戏、破解 ARC-AGI 等需要实时反馈与长程策略调整的任务

dots3-note preview技术原理

1. 多模态 MoE 架构

模型采用 Mixture-of-Experts(MoE) 架构,核心参数如下:
表格

组件规格
总参数量280B
激活参数量16B
层结构1 层致密层 + 45 层 MoE 层
隐藏层大小5,120
FFN 宽度13,824(致密层)/ 1,536(每专家)
路由专家256 个,Top-8 激活
共享专家1 个(每 token 必激活)
词表大小152K
上下文长度512K tokens

2. 混合注意力机制

注意力层采用 DSA(Dynamic Sparse Attention) 与 SWA(Sliding Window Attention) 混合配置,比例为约 1:3(13 层 DSA + 33 层 SWA)。DSA 操作覆盖全局序列中的前 2.048 个关键位置,SWA 负责局部细节建模,兼顾长序列效率与局部精度。

3. 多 Token 预测(MTP)

集成约 11.3 亿参数的 MTP 模块,可在一次前向传播中并行预测多个后续 Token,实现无需额外草稿模型的推测式解码,加速文本生成。

4. 独立感知编码器

感知层与语言模型解耦:

  • 视觉编码器:MoE ViT,7B 总参数,1.2B 激活参数
  • 音频编码器:Dense 架构,800M 参数

这种分离设计允许在仅需文本推理时,通过 vLLM 或 SGLang 的加载标志单独加载语言模型,降低推理开销。

5. TEMPO 强化学习方法

针对需要数十小时才能完成的现实任务,dots 实验室自研了 TEMPO 强化学习训练范式,使模型能够在长周期任务中保持目标一致性、持续更新记忆并适应环境变化。


dots3-note preview项目地址

  • 项目官网:https://studio.dots.ai/dots/dots3-en.html
  • GitHub仓库:https://github.com/studio-dots-ai/dots3-note-prev
  • HuggingFace模型库:https://huggingface.co/dots-studio/dots3-note-prev

dots3-note preview核心功能

表格

功能描述
长程开放域 Agent独立完成旅行规划、婚礼筹备、店铺运营等无标准答案、时间跨度长的复杂任务
复杂推理与数学证明继承 IMO 满分级数学推理与形式化证明能力
多模态理解视觉空间判读、文档图表解析、视频问答、音频内容理解
端到端软件工程独立完成需求分析、技术选型、代码实现、编译构建到验证运行的完整开发流程
工具调用与多步工作流支持多步骤智能体工作流,调用外部工具完成复杂任务
自主学习与纠错在未知规则环境中通过观察假设、验证反馈自主学习,出错时启动自我批判修正
长上下文信息处理在 512K 超长上下文中进行信息检索、摘要与推理

dots3-note preview应用场景

表格

场景说明
个性化旅行规划根据用户偏好、预算、时间约束,自主搜索信息、制定行程、预订推荐,并应对行程中的突发变化
婚礼全流程筹备协调场地选择、供应商沟通、时间安排、预算管理等多维度任务,动态调整方案
小微店铺开业运营从选址分析、供应链搭建到日常运营策略制定,提供长周期商业支持
端到端软件开发从需求文档到可运行代码的完整工程实现,适合独立开发者或小型团队
复杂文档与视频分析处理超长财报、法律合同、教学视频,进行跨模态信息整合与深度问答
交互式游戏与谜题接管需要实时决策和长期策略的游戏环境,如 ARC-AGI 等抽象推理任务
科研辅助数学证明、形式化验证、跨领域知识整合与假设推演

最后想说

dots3-note preview 是小红书开源的 280B/16B 多模态 MoE 模型,以 512K 超长上下文和 TEMPO 强化学习为核心,专攻现实世界中需要数小时至数天完成的开放域长程智能体任务,同时继承 IMO 满分级推理与多模态理解能力。

© 版权声明
为这篇文章评分
10.0/ 10
2 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...