大模型赋能投研系列之二十三:Kimi K3超越GPT 5.6了吗?—投研Agent模型能力对比评测.pdf

  • 上传者:b**
  • 时间:2026/07/20
  • 热度:95
  • 0人点赞
  • 举报

研究目的与方法

本报告为金融工程专题研究,旨在评估2026年7月发布的GPT 5.6 Sol、Kimi K3以及对照模型GLM-5.2在真实金融投研场景中的综合能力。测评采用估值建模、多因子回测和行业研究三类典型任务,通过统一结构化提示词,检验模型从理解需求、调用工具到形成交付物的长程Agent能力。

核心发现

三款模型均已具备完成复杂投研任务的基础能力,但表现分化明显。GPT 5.6 Sol综合表现最佳:估值任务中Excel模型支持联动更新并设置检查表与来源表;回测任务中明确区分信号形成日与交易执行日;行业研究任务中来源管理最规范,建立了六维评分体系与四层公司筛选方法。Kimi K3报告结构和分析逻辑整体较好,采用"销量×单价"预测收入,六维投资框架完整,但估值模型缺少联动、部分公式错误,回测任务未明确区分信号日与执行日,Wiki内容沉淀不足。GLM-5.2覆盖范围最广、展示效果较好,但估值任务底稿公式异常且目标价与评级冲突,回测任务中间计算过程披露不足,行业研究投资框架逻辑支撑较弱、Wiki来源管理和内部链接不完整。

关键数据

测评涉及的具体技术细节包括:Kimi K3总参数2.8T、上下文1M Token;GPT 5.6 Sol上下文1.05M Token、最大输出128k Token;GLM-5.2总参数744B、激活参数40B。API价格方面,Kimi K3输入3美元/百万Token、输出15美元/百万Token;GPT 5.6 Sol输入5美元/百万Token、输出30美元/百万Token;GLM-5.2输入8元/百万Token、输出28元/百万Token。第三方Artificial Analysis Intelligence Index显示,GPT 5.6 Sol综合得分59分排名第二,Kimi K3以57分排名第三,GLM-5.2以51分排名第十。

研究局限

Kimi K3测试于发布当天进行,出现推理速度较慢和请求无法响应的情况,可能受首日访问量和服务负载影响,暂不对其响应速度和服务稳定性作确定判断。本次结论基于有限次数的任务测试,可能受任务样本、提示词设计和推理模式等因素影响,后续需多轮测试验证结果的稳定性和可复现性。

风险提示

历史规律不代表未来,市场环境变化时模型存在失效风险;策略依据历史数据回测得到,交易成本或其他条件改变可能导致收益下降;大模型输出存在随机性和准确性风险;观点基于特定提示词产生,结果可能随提示词变化;部分应用存在安全风险,用户需自行承担后果;使用AI生成内容需注意版权问题。

1页 / 共26
大模型赋能投研系列之二十三:Kimi K3超越GPT 5.6了吗?—投研Agent模型能力对比评测.pdf第1页 大模型赋能投研系列之二十三:Kimi K3超越GPT 5.6了吗?—投研Agent模型能力对比评测.pdf第2页 大模型赋能投研系列之二十三:Kimi K3超越GPT 5.6了吗?—投研Agent模型能力对比评测.pdf第3页 大模型赋能投研系列之二十三:Kimi K3超越GPT 5.6了吗?—投研Agent模型能力对比评测.pdf第4页 大模型赋能投研系列之二十三:Kimi K3超越GPT 5.6了吗?—投研Agent模型能力对比评测.pdf第5页 大模型赋能投研系列之二十三:Kimi K3超越GPT 5.6了吗?—投研Agent模型能力对比评测.pdf第6页 大模型赋能投研系列之二十三:Kimi K3超越GPT 5.6了吗?—投研Agent模型能力对比评测.pdf第7页 大模型赋能投研系列之二十三:Kimi K3超越GPT 5.6了吗?—投研Agent模型能力对比评测.pdf第8页
  • 格式:pdf
  • 大小:3.3M
  • 页数:26
  • 价格: 3积分
下载 获取积分

免责声明:本文 / 资料由用户个人上传,平台仅提供信息存储服务,如有侵权请联系删除。

  • 相关标签
  • 相关专题
      热门下载
      • 本年热门
      • 本季热门
      • 本月热门
      分享至