书生‑S2(Intern‑S2‑Preview‑397B)是上海人工智能实验室推出的 397B 参数多模态科学基座模型,面向科研场景打造,采用记忆与推理分离的双引擎架构。模型可直接读取原始科学文献页面,处理图表、公式、分子结构图类多模态输入,具备深度数学推演、跨学科工具调用、长周期智能体任务执行能力。支持 256K 上下文窗口,可通过 API 接口调用,也可完成本地化部署调试,适配生命科学、材料、数学、计算机等方向的科研原型开发与评测工作上海人工智。

书生‑S2特点
采用 Memory Decoder 与 Mobius 组成双引擎架构,知识记忆模块和推理计算模块相互解耦。新增专业领域可插拔记忆模块,接入垂域新知识不会破坏模型原有通用能力。
采用全新视觉预训练范式,直接以完整文献页面作为学习素材,保留图表、公式、排版关联信息,跳过文本提取损耗环节。
长上下文窗口达到 256K,可处理整本论文集、多份实验报告类超长素材。深度思考模式内置,完成复杂数学证明、案例推导、科学假设构建。
原生具备 Agent 执行链路,自主拆解复杂目标,调用代码计算、外部查询工具,多轮迭代修正输出结果。适配国产昇腾算力生态,训练、推理全链路完成优化。
对外开放 API 服务,权重可获取,方便科研人员开展二次评测与场景适配。
书生‑S2技术原理
书生‑S2 基于 Transformer 主干网络,拆分记忆存储与逻辑推理两套计算链路。Memory Decoder 作为可插拔记忆解码器,各学科专业知识在独立模块完成训练,按需接入基座,不改动主模型主体参数。Mobius 推理架构负责逻辑演算,内部构建全局共享知识向量库,推理算子动态调取知识库完成计算。
视觉‑语言联合预训练阶段,模型把文献页面图像、公式、表格、文本映射进同一表征空间,保留图文之间的位置与语义关联。
经过 20 余个科学领域的多任务强化学习,在沙盒交互环境完成长周期智能体训练,学习任务拆解、工具调用、结果校验、方案迭代整套行为逻辑。推理侧支持长序列缓存优化,处理超长输入时维持推理效率。
书生-S2项目地址
- GitHub仓库:https://github.com/InternLM/Intern-S1
书生‑S2功能
科学多模态理解
读取论文扫描页、RNA 结构图、晶体示意图、数学黑板截图,识别图表、公式、分子结构,输出分析结论。
深度数学推理
处理复杂代数、数论类问题,完成案例拆解、质数结构分析,输出完整严谨数学证明过程。
科学假设推演
接收材料、生物领域条件输入,生成候选分子、晶体结构,输出物理合理性校验。
长周期 Agent 任务
接收复杂研究目标,自主规划执行步骤,调用计算、检索工具,多轮迭代得到可落地解决方案。
文献批量处理
批量导入多篇科研文档,提取实验数据,梳理研究脉络,生成结构化综述材料。
模型二次评测与适配
加载科研测试数据集,批量跑科学基准,也可接入自定义记忆模块,定向强化特定学科表现。
书生‑S2应用场景
生命科学研究团队
解析 RNA 二级结构图,开展蛋白结合分子设计,筛选候选化合物,辅助分子层面科研推演。
材料与化学研发
输入化学式预测晶体结构,校验材料物理属性,生成候选材料方案,完成初步仿真推演。
数学与理论科研
辅助命题推导、构造证明步骤,处理复杂数学案例,产出完整演算过程。
AI 科研实验室
用作科学智能方向的基线基座,开展记忆推理分离架构、多模态科学理解、长周期 Agent 相关实验。
高校教学科研
处理课程文献、习题素材,完成复杂题目分步解析,搭建课堂科研原型演示。
科研平台开发
接入科研平台,承接文献解析、初步假设生成、工具调用类业务,搭建面向科研人员的 AI 服务。
书生‑S2同类产品对比
表格
| 对比项 | 书生‑S2(Intern-S2) | Gemini Advanced Science |
|---|---|---|
| 研发主体 | 上海人工智能实验室 | |
| 产品定位 | 开源科学多模态大模型,面向 AI4S 科研场景 | 闭源科学专用多模态模型 |
| 核心特色 | 知识与推理分离双引擎,支持晶体 / 分子结构生成,适配昇腾生态 | 强文献理解、科学计算、实验仿真,多模态科研推理 |
| 适用场景 | 材料、化学、生物科研智能体,本地私有化部署 | 科研文献解析、科学仿真、云端科研助手 |
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



