共计 1151 个字符,预计需要花费 3 分钟才能阅读完成。
桥水基金最新研究: 前沿 AI 模型金融判断准确率未达 80% 可信门槛,GPT 和 Claude 仅有 50~70%
通用大模型在金融专业场景里的表现,再次受到现实检验 。 桥水基金旗下 AIA Labs 与 Thinking Machines Lab 的研究显示, 在若干基础金融信息筛选任务中,GPT、Claude、Gemini 等前沿模型并未稳定达到研究团队设定的可信部署标准。
📌 前沿模型卡在金融“基础判断”上
研究团队从投资分析师的日常工作中抽取了六类任务,内容包括判断财经文章是否值得高管层关注, 以及识别央行文件是否暗示未来利率方向变化。这类任务看似基础, 却高度依赖行业语境和长期经验。
报告提到,专业投资者通常能快速作出判断, 但未必能把判断逻辑完整写成规则。正因如此, 模型不仅要理解文本表面信息, 还要捕捉背后的业务重要性。
🔍 提示词优化后仍未过 80% 门槛
在使用基础提示词时,多款前沿大语言模型的平均准确率约为 50%。研究团队随后引入专家撰写的详细提示词, 并采用“相关且有趣”“相关但无趣”“不相关”的三级分类体系, 准确率提升到约 70%。
但这一结果仍低于研究人员设定的 80% 可信部署门槛, 说明单纯依赖更复杂提示词, 并不能完全解决专业判断稳定性问题。
💡 微调 Qwen3-235B 后达到 84.7%
研究团队随后选择开源模型路线, 以阿里 Qwen3-235B 为基座, 通过 Thinking Machines Lab 的 Tinker 平台进行训练。数据构建阶段最初使用了非专业标注服务, 但团队发现其中存在较多错误标签。
为降低专家标注成本,团队先用存在缺陷的标签训练模型, 再让模型重新评估同一批数据, 将模型判断与原始标签冲突的样本交给专家校正。经过交错批次训练、CISPO 损失函数与非对称裁剪、同策略蒸馏等优化后, 微调模型测试准确率达到 84.7%。
- 基础提示词下, 前沿模型平均准确率约 50%;
- 专家提示词优化后, 准确率约 70%;
- 最佳前沿模型测试准确率为 78.2%;
- 微调模型达到 84.7%, 错误率降低 29.8%;
- 推理成本约为前沿模型的十四分之一。
📊 企业专有知识成为关键变量
这项研究强调,前沿模型并未囊括所有可用知识。许多企业内部数据、专家经验和隐性判断标准并不会自然进入通用模型训练集, 尤其是机构有意保持私密的内容。
对金融机构而言,微调开源模型的价值不只在于成本更低, 也在于控制权更强。企业可以更好地管理模型权重、训练数据和算力基础设施, 减少将核心数据交给外部模型供应商的顾虑。
🚀 总结: 专业场景更需要定制化智能
桥水方面表示,该模型已经投入日常使用, 并认为面向特定组织需求的“差异化智能”将成为未来方向。就当前结果看, 通用前沿模型仍适合广泛任务, 但金融等高专业度场景需要更贴近企业知识的定制模型。