神珍 – 上海科学智能研究院发布的科学多模态基础模型

“神珍”(Monkey King Bang, MKB)是上海科学智能研究院发布的科学多模态基础模型,总参数量约110亿,专为统一处理DNA、RNA、蛋白质、小分子、地球系统和医学影像六类科学数据而设计,在保留各类数据原生结构特性的同时,实现科学理解与多模态结果生成的融合。无需将科学数据强制转换为单一格式,而是通过差异化处理通路保留序列依赖、分子连接、气象时空演化等关键规律,显著提升跨领域科学任务的精准性。

神珍 - 上海科学智能研究院发布的科学多模态基础模型

神珍核心特点

1. 科学数据原生结构保留

  • 差异化数据处理通路:针对六类科学数据分别设计专用处理流程,严格保留序列的先后依赖关系、分子的原子连接结构、气象场的空间分布特征及医学影像的局部细节,避免传统方法因格式统一化导致的信息损失。
  • 多模态统一框架:所有数据通过共享主干模型(Qwen3-VL-8B)协同处理,既保留学科特异性,又挖掘跨领域共性规律,实现“一模型多任务”的科学智能范式。

2. 轻量化与高性能平衡

  • 110亿参数实现跨领域竞争力:在生物序列、小分子、气象预报等任务中,性能接近甚至超越部分参数量超百倍的专用模型(如与1万亿参数的Intern-S1-Pro相比,在20项生物任务中各有10项领先)。
  • 参数效率导向设计:证明科学模型能力不单纯依赖参数规模,关键在于对科学规律的精准建模。

3. 开放生态支持

  • 完整开源体系:提供模型权重、推理代码、示例脚本及文档,支持通过星河启智平台、Hugging Face和GitHub直接获取。
  • 可组合性:与星河启智平台已有的1500余个科学模型和工具无缝集成,便于科研人员二次开发。

神珍技术原理

1. 分层架构设计

  • 共享主干+领域适配器:以Qwen3-VL-8B作为基础Transformer主干,为六类科学数据独立设置编码器与解码器(如DNA适配器、气象适配器等),确保输入输出符合学科规范。
  • 动态模态调度机制:通过Target-modality dispatch模块自动识别任务类型,调用对应的数据处理通路与生成逻辑,避免冗余计算。

2. 科学数据原生表征

  • ScienceTokenizer技术:为每类科学数据设计专用分词器,将DNA序列、分子结构等直接编码为高保真科学Token,而非简单转为文本。
  • 跨模态对齐训练:在联合训练中强制模型学习不同科学模态间的隐式关联(如蛋白质序列与医学影像的病理关联),提升多模态推理一致性。

3. 理解-生成双路径能力

  • 双向任务支持:既可解析输入的科学数据(如识别RNA功能),也能直接生成结构化科学内容(如输出SMILES分子式、全球气象场数据)。
  • 自反思机制:模型能对生成结果进行内部验证,例如通过分子结构规则校验生成的SMILES是否合法。

神珍功能表现

1. 生物序列任务

  • 在DNA、RNA、蛋白质相关的20项评测任务中,9项取得三款参评模型中的最优结果,17项位列前二。
  • 例如,在非编码RNA(ncRNA)家族分类任务中,准确率达91.46%,显著优于同量级模型Biology-Instructions(63.09%)。

2. 小分子与气象预测

  • 小分子属性理解:在SMolInstruct基准的6项任务中,4项达到最优,如血脑屏障穿透性(BBBP)分类准确率96.95%
  • 气象滚动预报:基于初始大气场生成未来10天全球气象场,离线评测结果达到或优于业务级数值预报水平

3. 医学影像分析

  • 医学影像分割任务中,平均Dice得分高达91.20,在7种参评方法中排名第一,可精准标出器官或病灶区域。

神珍应用场景

1. 生命科学研究

  • 基因与蛋白质分析:快速识别DNA功能区域、预测蛋白质结构稳定性,加速药物靶点发现。
  • RNA设计与验证:直接生成具备特定功能的RNA序列,并输出结构化验证报告。

2. 气候与地球科学

  • 短临气象预报:在无高性能计算资源的场景下,本地化生成区域级气象预测,支持灾害应急响应。
  • 环境模拟:结合地球系统数据,模拟污染物扩散、碳循环等复杂过程。

3. 医疗诊断辅助

  • 医学影像自动分割:从CT或MRI影像中实时标注肿瘤边界、器官轮廓,辅助医生制定手术方案。
  • 跨模态诊断支持:整合患者基因数据、影像结果与病历文本,提供多维度分析建议。

4. 科研智能体核心组件

  • 作为系统级科研智能体“大圣”的超级大脑,支撑从任务拆解到实验验证的全流程自动化科研,例如在siRNA筛选中提升成功率超50%,或驱动“天算实验室”实现星载气象模型实时推理。

“神珍”模型的价值在于突破科学智能领域的“格式割裂”困境,通过保留科学数据的原生结构特性,使单一模型能同时满足多学科研究的精准需求。其设计逻辑表明:科学大模型的竞争力不仅取决于参数规模,更依赖对学科本质规律的尊重与建模。随着开源生态的完善,该模型有望成为连接基础研究与产业落地的关键基础设施,尤其在隐私敏感(如医疗数据)、算力受限(如野外科考)或需实时响应(如灾害预警)的场景中发挥不可替代作用。

© 版权声明
为这篇文章评分
10.0/ 10
1 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...