Faraday 是由伦敦 AI 实验室 Inherent 于 2026 年 8 月推出的”AI Scientist”(AI 科学家)智能体。它基于阿里巴巴通义千问的 Qwen 3.6 模型,参数量仅 270 亿,却在独立复现已发表科研论文这一高难度任务上,超越了体量远大于它的 Claude Opus 4.8 和 GPT-5.5。
Inherent 由前 Google DeepMind 研究人员 Edward Hughes、Tantum Collins、Louis Kirsch 等人创立,2026 年 5 月完成 5000 万美元种子轮融资后浮出水面。Faraday 的命名灵感来自 19 世纪物理学家迈克尔·法拉第——法拉第正是通过亲手复现他人实验,在复现过程中发现了电磁感应,最终发明了电动机。Inherent 希望 Faraday 也能在复现中孕育原创发现。

Faraday 特点
表格
| 维度 | 具体特点 |
|---|---|
| 极小参数 | 仅 270 亿参数,与 Claude Opus 4.8、GPT-5.5 等前沿大模型体量差距悬殊 |
| 复现能力领先 | 在论文复现任务上全面超越 Claude Opus 4.8 和 GPT-5.5,尤其在元学习、结构生物学、材料科学领域优势显著 |
| 科研品味 | 不仅追求”做对”,更强调”研究品味”——判断哪些实验值得做、如何设计实验方案的直觉 |
| 工具调用 | 不自建编码工具,而是调用 GPT-5.5 Codex 完成编程任务,类似人类科学家使用现有软件 |
| 无外部框架依赖 | 不需要手工编码的进化框架,也没有测试时奖励,模型内在地学会珍视发现 |
| 泛化能力 | 训练时使用 GPT-5.4-mini,测试时可自适应切换到更强的 GPT-5.5 Codex |
| 分布外表现 | 对近期发表、基础模型预训练时未见过的研究,复现效果衰减更少 |
Faraday 技术原理
1. 核心架构
基础模型:Qwen 3.6(27B 参数)
训练范式:长时程强化学习(Long-Horizon Reinforcement Learning),奖励成功结果而非预设规则
工具层:将 GPT-5.5 Codex 作为编码工具调用,形成”小模型指挥大模型”的协作架构
2. Replica 训练任务集
Inherent 设计了名为 Replica 的可扩展强化学习任务空间:
从 100 篇机器学习和 AI for Science 论文中提取
生成 310 个“复现图表”任务,涵盖自然语言处理、材料科学、天气预报等领域
每项任务要求:在有限时间和算力预算内,不访问原始图表,复现论文中的某个图
242 个任务用于训练,68 个用于测试
3. 奖励信号设计
复现图表不等于成功复现,还需考量实验设计、科学实践、对原文的忠实度、资源利用效率等。为此:
LLM 评判器 + 人工验证:验证评判器能否捕捉专家的”科研品味”
每任务评分标准(Per-Task Rubrics):解决底层模型随机性带来的噪声奖励问题,提升一致性和稳定性
多样本聚合 + 回合级别信用分配:解决长时程强化学习的典型不稳定性
4. 训练目标
Faraday 被训练去恢复论文中未写明的”99% 的汗水”——即作者尝试失败、调整方向、最终找到正确路径的完整探索过程。这要求智能体具备假设驱动的探索能力,而非简单模仿已知答案。
Faraday 功能
- 独立论文复现 接收一篇已发表论文,在不提前获知答案的前提下,自主分析论文、设计实验方案、编写代码、运行实验,最终复现论文中的核心结论和图表。
- 跨领域科研辅助 覆盖自然语言处理、材料科学、结构生物学、天气预报、元学习等多个领域,作为人类研究者的”AI 队友”。
- 迭代式人机协作 主动探索假设、运行实验、带着结果向人类研究者汇报并征求意见,而非被动等待指令。
- 科学判断与工具调度 作为”科学判断层”,评估实验方向的价值,并调度更强大的编码智能体(如 GPT-5.5 Codex)执行具体编程任务。
- 递归自我改进基础 复现被视为通往创新的课程。未来可通过移除更多信息、改变资源约束、甚至让智能体复现”想象的论文”来激发原创发现。
Faraday 应用场景
表格
| 场景 | 说明 |
|---|---|
| 学术论文验证 | 快速验证新发表论文的可复现性,识别”无法复现”的研究,提升科研可信度 |
| 材料科学探索 | 复现新型材料合成与性能预测实验,加速材料发现周期 |
| 结构生物学研究 | 复现蛋白质结构预测、分子动力学模拟等实验,辅助药物研发 |
| 气象与气候模型 | 复现天气预报算法,验证模型在不同数据集上的泛化表现 |
| AI 算法复现 | 复现机器学习顶会论文中的新架构、新训练技巧,降低研究门槛 |
| 科研教学训练 | 作为 PhD 学生的”虚拟师兄”,演示如何从论文出发设计实验、排查错误 |
| 递归科学组织 | Inherent 的终极愿景:围绕 Faraday 重构研究机构的运作方式——算力分配、会议形式、人机协作模式、组织如何从每次实验中学习 |
Faraday 性能表现
在 Replica 基准测试中:
- 同分布任务:Faraday 在 73% 的任务上优于对照 Agent
- AI for Science 留出任务:在 60% 的任务上优于对照 Agent
- 平均分:比 Claude Opus 4.8 高 6%,比 GPT-5.5 高 8%
最后想说
Faraday 的核心突破在于证明:小参数模型 + 强化学习 + 科学品味培养 + 工具调用,可以在高难度的科研复现任务上击败体量数十倍于己的前沿大模型。它不是一个简单的”论文复读机”,而是一个具备实验设计直觉、能在探索中学习、能与人类协作的”AI 科学家雏形”。Inherent 的更长远目标,是让 Faraday 从”复现已知”迈向”发现未知”,最终成为推动科学创新的自主研究伙伴。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



