Faraday – Inherent推出的AI Scientist智能体

Faraday 是由伦敦 AI 实验室 Inherent 于 2026 年 8 月推出的”AI Scientist”(AI 科学家)智能体。它基于阿里巴巴通义千问Qwen 3.6 模型,参数量仅 270 亿,却在独立复现已发表科研论文这一高难度任务上,超越了体量远大于它的 Claude Opus 4.8GPT-5.5

Inherent 由前 Google DeepMind 研究人员 Edward Hughes、Tantum Collins、Louis Kirsch 等人创立,2026 年 5 月完成 5000 万美元种子轮融资后浮出水面。Faraday 的命名灵感来自 19 世纪物理学家迈克尔·法拉第——法拉第正是通过亲手复现他人实验,在复现过程中发现了电磁感应,最终发明了电动机。Inherent 希望 Faraday 也能在复现中孕育原创发现。

Faraday - Inherent推出的AI Scientist智能体


Faraday 特点

表格

维度具体特点
极小参数仅 270 亿参数,与 Claude Opus 4.8、GPT-5.5 等前沿大模型体量差距悬殊
复现能力领先在论文复现任务上全面超越 Claude Opus 4.8 和 GPT-5.5,尤其在元学习、结构生物学、材料科学领域优势显著
科研品味不仅追求”做对”,更强调”研究品味”——判断哪些实验值得做、如何设计实验方案的直觉
工具调用不自建编码工具,而是调用 GPT-5.5 Codex 完成编程任务,类似人类科学家使用现有软件
无外部框架依赖不需要手工编码的进化框架,也没有测试时奖励,模型内在地学会珍视发现
泛化能力训练时使用 GPT-5.4-mini,测试时可自适应切换到更强的 GPT-5.5 Codex
分布外表现对近期发表、基础模型预训练时未见过的研究,复现效果衰减更少

Faraday 技术原理

1. 核心架构

  • 基础模型:Qwen 3.6(27B 参数)

  • 训练范式长时程强化学习(Long-Horizon Reinforcement Learning),奖励成功结果而非预设规则

  • 工具层:将 GPT-5.5 Codex 作为编码工具调用,形成”小模型指挥大模型”的协作架构

2. Replica 训练任务集

Inherent 设计了名为 Replica 的可扩展强化学习任务空间:

  • 100 篇机器学习和 AI for Science 论文中提取

  • 生成 310 个“复现图表”任务,涵盖自然语言处理、材料科学、天气预报等领域

  • 每项任务要求:在有限时间和算力预算内,不访问原始图表,复现论文中的某个图

  • 242 个任务用于训练,68 个用于测试

3. 奖励信号设计

复现图表不等于成功复现,还需考量实验设计、科学实践、对原文的忠实度、资源利用效率等。为此:

  • LLM 评判器 + 人工验证:验证评判器能否捕捉专家的”科研品味”

  • 每任务评分标准(Per-Task Rubrics):解决底层模型随机性带来的噪声奖励问题,提升一致性和稳定性

  • 多样本聚合 + 回合级别信用分配:解决长时程强化学习的典型不稳定性

4. 训练目标

Faraday 被训练去恢复论文中未写明的”99% 的汗水”——即作者尝试失败、调整方向、最终找到正确路径的完整探索过程。这要求智能体具备假设驱动的探索能力,而非简单模仿已知答案。


Faraday 功能

  1. 独立论文复现 接收一篇已发表论文,在不提前获知答案的前提下,自主分析论文、设计实验方案、编写代码、运行实验,最终复现论文中的核心结论和图表。
  2. 跨领域科研辅助 覆盖自然语言处理、材料科学、结构生物学、天气预报、元学习等多个领域,作为人类研究者的”AI 队友”。
  3. 迭代式人机协作 主动探索假设、运行实验、带着结果向人类研究者汇报并征求意见,而非被动等待指令。
  4. 科学判断与工具调度 作为”科学判断层”,评估实验方向的价值,并调度更强大的编码智能体(如 GPT-5.5 Codex)执行具体编程任务。
  5. 递归自我改进基础 复现被视为通往创新的课程。未来可通过移除更多信息、改变资源约束、甚至让智能体复现”想象的论文”来激发原创发现。

Faraday 应用场景

表格

场景说明
学术论文验证快速验证新发表论文的可复现性,识别”无法复现”的研究,提升科研可信度
材料科学探索复现新型材料合成与性能预测实验,加速材料发现周期
结构生物学研究复现蛋白质结构预测、分子动力学模拟等实验,辅助药物研发
气象与气候模型复现天气预报算法,验证模型在不同数据集上的泛化表现
AI 算法复现复现机器学习顶会论文中的新架构、新训练技巧,降低研究门槛
科研教学训练作为 PhD 学生的”虚拟师兄”,演示如何从论文出发设计实验、排查错误
递归科学组织Inherent 的终极愿景:围绕 Faraday 重构研究机构的运作方式——算力分配、会议形式、人机协作模式、组织如何从每次实验中学习

Faraday 性能表现

在 Replica 基准测试中:
  • 同分布任务:Faraday 在 73% 的任务上优于对照 Agent
  • AI for Science 留出任务:在 60% 的任务上优于对照 Agent
  • 平均分:比 Claude Opus 4.8 高 6%,比 GPT-5.5 高 8%

最后想说

Faraday 的核心突破在于证明:小参数模型 + 强化学习 + 科学品味培养 + 工具调用,可以在高难度的科研复现任务上击败体量数十倍于己的前沿大模型。它不是一个简单的”论文复读机”,而是一个具备实验设计直觉、能在探索中学习、能与人类协作的”AI 科学家雏形”。Inherent 的更长远目标,是让 Faraday 从”复现已知”迈向”发现未知”,最终成为推动科学创新的自主研究伙伴。

© 版权声明
为这篇文章评分
0.0/ 10
0 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...