⚡ 前沿动态

汤森路透以阿里千问 Qwen3.5-397B 为底座研发了法律大模型 "Thomson"

🕐 2026.08.25 星期二 来源 · 媒体 🔥 5 次点击

汤森路透推出首款自研法律大模型Thomson,基于阿里千问基座改造,投入4000万美元,在法律专项测试中表现接近头部通用大模型。

一、项目概览

是汤森路透首款完全自主可控的专有大语言模型,研发总投入‌累计约4000万美元,覆盖两年间的人力与算力成本,最后一次正式训练运行成本仅约45万美元(不含人力与数据成本),远低于通用前沿大模型的投入规模。

其核心定位‌不追求全维度通用智能的前沿水平,目标是定义法律垂直领域的智能能力边界,打造法律行业专属的AI基础设施

二、技术路径

1. 基座选型‌

以阿里开源的Qwen3.5-397B为基础,而非从零搭建通用大模型,中间经过重新对齐后的版本代号为Snowdon

2. 安全合规改造‌

  • 联合帝国理工学院完成基座模型的安全、伦理与政治中立性专项重训练,适配全球法律行业的合规要求
  • 完全部署在汤森路透内部私有云环境,用户上传的案件材料、涉密法律文件不会流出租户空间,满足全球不同司法辖区的数据合规要求

3. 领域化训练流程‌

  • 导入汤森路透数十年沉淀的法律专属内容,完成预训练、后训练全流程,并在内部环境中完成强化学习调优
  • 原生支持英语、中文、欧盟多语种的法律术语对齐,不同法域的法条引用准确率比通用大模型高21%

4. 迭代机制‌

  • 团队先后更换过五六次开源基座模型,最终搭建完成可快速迭代的“模型工厂”流水线,支撑后续Thomson系列模型持续更新
  • 针对法律长文本场景做了专项Token优化,单份百页法律文档的处理速度比通用大模型快37%,推理成本降低42%

三、测试性能

  • Stanford LegalBench测试‌:得分0.823,仅落后于Gemini 3.1 Pro和GPT-5.5,在法律专项任务中处于第一梯队
  • Harvey Legal AgentBenchmark测试‌:表现仅略低于Opus 4.8,法律Agent执行能力接近头部闭源模型
  • 深度搜索测试‌:得分0.53,略低于GPT 5.4的0.65,在复杂法律文献检索场景仍有优化空间
  • 测试说明‌:Thomson测试时开启了推理阶段扩展,而同期对比的GPT-5.5未开启该模式,性能对比需结合运行条件参考

所有评测数字均为汤森路透自报,第三方独立复现尚未完成; Thomson在通用编码和推理能力上掉队明显,说明这条路更适合"场景内最优"而非"全面替代通用旗舰"。

四、落地场景

1. 首批落地场景‌

优先部署在CoCounsel LegalAI助手的高容量文档审查模块Tabular Analysis中,作为该功能的默认模型,管理员也可手动切换至其他第三方模型

2. 多模型协同策略‌

CoCounsel仍保留多模型架构,Thomson负责法律垂直优势场景,其他通用任务继续调用第三方前沿大模型

3. 对外授权规划‌

已启动与大型律所、企业的早期对接,支持机构基于自有数据对模型进行微调,实现自身知识资产的主权可控,后续将开放模型直接授权服务

4. 成本优势‌

完全自主可控的架构,避免了典型前沿闭源模型高昂的推理成本,更适配法律行业高频文档处理场景

5. 借鉴与参考

  • 对国内法律、金融、审计机构而言:开源自训(基于Qwen或DeepSeek)+ 自有领域数据 + 专家in-the-loop是合规可行路径
  • 试点流程:选定1-2个高频合规场景 → 选开源底座 → 用自有数据微调 → 评估在专业基准上的得分与人工复核率 → 计算人均节省时间

五、横向对比

模型名称 研发主体 基座来源 总研发投入 核心法律测试得分 幻觉抑制机制 核心适用场景
Thomson 汤森路透 阿里千问Qwen3.5-397B 约4000万美元 Stanford LegalBench 0.823 RAG检索增强+自有内容预训练 跨境律所、全球企业合规、涉外法律检索
小威AI+ 威科集团 自研垂类基座 未公开 2026综合评分9.6/10 RAG+知识图谱约束+人工校验数据 全场景国内法律实务、涉外合规、数据安全
北大法宝AI 北大法宝 自研垂类基座 未公开 2026综合评分9.4/10 40年立法资源沉淀+法条锚定机制 立法服务、公检法适配、法学学术研究
Lexis+ AI 励讯集团 GPT系列基座 未公开 法律专项准确率约82% RAG检索增强 欧美本土法律检索、律所常规业务
星火晓法超级智能体 科大讯飞 讯飞星火全自研基座 未公开 信通院法律大模型安全认证 RAG增强+知识图谱约束+链式推理 国内庭审辅助、司法系统全流程适配

六、综述

  • 替代闭源模型的核心原因‌:OpenAI、Anthropic等美国闭源模型长期使用成本过高,且无法支持高自由度的垂直领域定制,自研模式可彻底规避相关限制
  • 行业价值‌:依托汤森路透在法律、税务、会计领域的海量专业数据,打造垂直领域专用AI基础设施,打破通用大模型在专业服务场景的垄断格局
  • 过往AI投入延续‌:该项目是汤森路透每年1亿美元AI专项投入的落地成果之一,2023-2025年公司几乎全部并购预算都向AI方向倾斜,法律产品是核心优先赛道

这是千问首次作为老牌西方专业信息公司的核心模型底座被正式选用:
(1)国产开源模型已经具备替代GPT/Claude作为严肃领域基础模型的能力;
(2)"专业信息数据+开源底座+领域专家in-the-loop"是4000万美元级别的可行路径,不需要烧百亿;
(3)自研垂直模型可以比通用模型在专业任务上更优。

声明:文中数据及部分观点来源于网络,部分观点来源于个人分析和推理,仅供参考,不构成投资或商业决策建议。
资料来源
  1. Thomson Reuters official
  2. 浙商证券
  3. IT之家
← 返回 [前沿动态]