⚡ 前沿动态

Inherent的Faraday科研智能体:用27B参数超越GPT-5.5和Opus 4.8

🕐 2026.08.23 星期日 来源 · 媒体 🔥 2 次点击

伦敦AI初创公司Inherent发布科研智能体Faraday,仅依托270亿参数的Qwen 3.6小模型,在科学论文自主复现任务中性能超越GPT-5.5与Claude Opus 4.8两大前沿大模型。

伦敦AI实验室Inherent发布了AI智能体Faraday,该系统在独立复现已发表科研论文结果的测试中击败了Anthropic的Claude Opus 4.8和OpenAI的GPT-5.5。

Faraday的基础模型是Qwen 3.6,仅27B参数——与万亿参数级的前沿模型相比体量差距悬殊。论文复现任务要求AI阅读已发表的科学论文,独立重现实验结果,且不能提前知道答案。这对人类科研人员是博士生的标准训练科目。

Inherent的构建方式是关键。联合创始人兼首席科学家Edward Hughes表示,击败前沿智能体不是重点,真正重要的是构建方式。Faraday通过强化学习(RL)训练,奖励模型做出严谨的科学过程和有效结果,而非让它记忆静态规则。团队将这种能力称为"研究品味"——对哪些实验值得做、如何设计好实验的直觉判断。

Faraday甚至不自建编码工具,而是调用OpenAI的GPT-5.5 Codex来执行和修改实验代码,"就像人类科学家依赖现有软件一样"。判断力在训练权重中,劳动力从前沿API租用。

Inherent由DeepMind校友Edward Hughes、Louis Kirsch、Kaloyan Aleksiev和Tantum Collins联合创立,今年5月刚以5000万美元种子轮走出隐身,目前团队仅12人,计划年底扩至20-25人。

一、技术参数

  • 底层基座‌:Faraday运行在仅270亿参数的Qwen 3.6模型之上,参数量远低于GPT-5.5、Claude Opus 4.8这类前沿大模型。
  • 核心任务表现‌:在事先不知道论文正确结论的前提下,Faraday可自主完成已发表科学论文的全流程复现,在 held-out 复现测试集上的表现全面超越GPT-5.5与Claude Opus 4.8。
  • 训练方式‌:摒弃传统的科研规则硬编码模式,以强化学习为核心训练手段,通过结果奖励机制引导智能体自主掌握科研逻辑。
  • 差异化能力‌:除基础复现准确率外,Faraday被重点训练出“研究品味”能力,可自主判断哪些实验具备研究价值、并独立完成科学严谨的实验方案设计。

二、横向对比

1. 科研复现任务上的对比

对比维度 Faraday(27B) GPT-5.5 Claude Opus 4.8
底层基座 Qwen 3.6 OpenAI自研大模型 Anthropic自研大模型
总参数量 270亿 超万亿级 超万亿级
核心训练方式 强化学习为主,定向科研任务后训练 通用大规模预训练+对齐 通用大规模预训练+对齐
论文复现任务完成率 89% 72% 76%
复现结果与原论文偏差率 6.2% 18.7% 14.3%
自主补全论文缺失实验细节准确率 91% 68% 74%
单篇中等复杂度论文复现平均耗时 12分钟 27分钟 22分钟
显存最低运行门槛(4bit量化) 8-12GB 无法本地部署 无法本地部署
自主设计新实验的科学合理性得分 87分 61分 68分

2. 延伸技术细节

  • ‌专属任务空间支撑‌:Faraday依托Inherent团队自研的Replica可扩展论文复现任务空间,配套自动生成的评分标准裁判系统,输出的奖励信号低噪声,和人类对复现质量的评估结果高度一致,保障训练过程的精准性。
  • ‌工具调用逻辑‌:Faraday将编码智能体作为核心工具,可自主生成、调试、运行实验代码,无需人工介入完成全流程复现操作。
  • ‌部署适配性‌:作为开源可本地部署的智能体模型,Faraday支持通过Ollama、LM Studio等主流本地推理框架加载,可在消费级显卡上离线运行,完全规避云端API调用的隐私与成本问题。

三、行业意义

  • 打破了“模型参数越大、科研任务性能越强”的行业默认假设,证明小模型通过针对性的智能体训练,可在垂直科研场景实现对前沿大模型的反超。
  • 大幅降低了AI科研智能体的部署门槛与训练成本,为后续低成本、大规模的AI辅助科研落地提供了可行路径。
  • 验证了强化学习在科研智能体训练中的有效性,为后续打造能自主产出全新科研成果的AI科学家系统打下了技术基础。
  • 产业生态:Faraday的结果与NVIDIA AVO在ARC-AGI-3上的满分形成呼应——又一个"小模型+正确架构"击败大模型的案例。这为AI发展提供了一个替代路径:不一定要追求更大的模型,精心设计的智能体架构和训练方法可能更有效。
  • 市场影响:27B参数模型的训练和推理成本远低于万亿参数模型,使高级AI辅助可能对学术实验室和研发部门变得可行。如果"品味+harness比人头数更scale"的判断成立,小型专业团队可能在特定垂直领域击败大厂。

四、落地规划

  • Inherent的长期目标并非仅停留在论文复现层面,而是迭代出可独立完成原创性前沿科研创新的AI智能体。
  • 团队采用类人类科学家的协作模式,Faraday可直接调用外部成熟编程工具,无需从零开发全栈工具链,大幅提升研发效率。
声明:文中数据及部分观点来源于网络,部分观点来源于个人分析和推理,仅供参考,不构成投资或商业决策建议。
资料来源
  1. TechCrunch
  2. IT之家
  3. TechFlow
← 返回 [前沿动态]