Kimi K3与GPT 5.6 Sol投研Agent能力对比:三类金融任务实测分析

  • 来源:国金证券
  • 发布时间:2026/07/20
  • 浏览次数:80
  • 举报
相关深度报告REPORTS

大模型赋能投研系列之二十三:Kimi K3超越GPT 5.6了吗?—投研Agent模型能力对比评测.pdf

研究目的与方法本报告为金融工程专题研究,旨在评估2026年7月发布的GPT5.6Sol、KimiK3以及对照模型GLM-5.2在真实金融投研场景中的综合能力。测评采用估值建模、多因子回测和行业研究三类典型任务,通过统一结构化提示词,检验模型从理解需求、调用工具到形成交付物的长程Agent能力。核心发现三款模型均已具备完成复杂投研任务的基础能力,但表现分化明显。GPT5.6Sol综合表现最佳:估值任务中Excel模型支持联动更新并设置检查表与来源表;回测任务中明确区分信号形成日与交易执行日;行业研究任务中来源管理最规范,建立了六维评分体系与四层公司筛选方法。KimiK3报告结构和分析逻辑整体较好...

模型背景与测评设计

2026年7月,OpenAI与Moonshot AI先后推出面向长程Agent任务的新一代模型GPT 5.6 Sol和Kimi K3,智谱同期发布的GLM-5.2亦具备相近定位。为验证新一代模型在真实金融研究场景中的综合能力,本次测评将上述三款模型进行横向比较,围绕估值建模、多因子回测和行业研究三类典型金融投研任务展开实测。相较于单轮问答测试,本次任务更强调复杂工作流下的连续执行与成果交付,要求模型自主拆解任务、规划执行路径,并在多个工具和数据源之间完成协同操作。

三类任务覆盖数据库取数、Excel建模、Python代码执行、图表生成、资料溯源和研究报告输出等关键环节,采用完全相同的结构化提示词,以综合评估各模型的任务完成度、结果准确性、研究深度与交付质量。

估值建模任务表现

估值任务以中际旭创为研究对象,要求模型获取历史财务和最新经营数据,建立经营预测、三张报表、DCF和相对估值模型,并输出敏感性分析及投资报告。该任务核心检验模型能否将业务判断转化为财务假设,保持收入、利润、现金流和估值之间的联动,同时保证Excel模型、研究报告、目标价和投资评级相互一致。

GPT 5.6 Sol在该任务中表现最优。其估值模型支持修改假设后联动更新经营预测、财务报表和估值结果,并设置检查表和来源表,对输入项、计算值和跨表引用进行颜色区分,模型的可复算性和可检查性最强。投资报告中的目标价、评级和投资逻辑一致,建立了模型自检和数据追溯机制。

Kimi K3采用"销量×单价"预测收入,报告逻辑基本自洽,投资报告中没有明显逻辑冲突。但其Excel模型中部分关键数据以静态形式呈现,各表之间未形成有效公式联动,核心投资结论页存在公式和引用错误,影响了底稿对报告结论的复核功能。

GLM-5.2的底稿存在多处公式异常,摘要页出现当前股价、总市值显示为0,DCF和PE目标价出现#DIV/0!,收入增速出现#REF!等问题。更为严重的是,其报告给出"增持"评级,但加权目标价低于估值基准股价,估值结果与投资建议之间存在明显冲突。

多因子回测任务表现

回测任务要求模型基于沪深300历史实际成分股,构建价值、质量、动量和低波动等因子,完成IC、Rank IC、十分组收益、多因子选股及策略回测。核心检验模型能否正确处理历史成分股、行业分类、财务披露日、复权价格、调仓时点和不可交易状态。

GPT 5.6 Sol明确采用"月末形成信号、下一交易日执行"的方式,使用月末交易日的收盘价、估值和财务数据形成因子信号,并在下一交易日执行交易,较好地避免了同日信号和同日成交造成的时点偏差,是三个模型中交易时点处理最严谨的。但其回测区间较短,未计入交易成本,对跌停股票无法卖出的情况处理也不完整。

Kimi K3保留了Python代码、每期选股、组合收益和净值等结果,计算过程的可检查性较好。但没有明确区分信号日与执行日,也未完整处理交易成本和不可交易状态。执行过程中出现数据库连接中断,虽利用已有数据完成回测框架和结果交付,但影响了数据覆盖范围。

GLM-5.2覆盖区间最长,但同样没有明确区分信号日和执行日,未完整处理交易成本和不可交易状态。底稿没有充分披露每期选股、调仓记录和组合净值明细,使用者难以还原策略结果的形成过程,部分图表存在标题超出画布、显示不完整的问题。

行业研究任务表现

行业研究任务以半导体设备产业链为对象,要求模型检索行业和公司资料,梳理上游零部件、中游设备及下游晶圆制造,建立海外龙头与国内公司的对应关系,并形成公司数据库、投资框架、跟踪指标和风险分析,同时沉淀Wiki知识库。

GPT 5.6 Sol的研究逻辑和来源管理最为规范。其建立了六维评分体系,从市场空间、成长速度、技术壁垒、盈利能力、竞争格局和估值水平六个方面评价不同产业环节,并进一步建立四层公司筛选方法,按照订单兑现、产品平台化、财务质量和客户验证等条件对公司进行分层。Wiki包含来源摘要页,raw目录保存了来源信息JSON,资料追溯最为方便。但公司实体页数量较少,仅建立4个实体页。

Kimi K3的报告和投资框架较为完整,同样建立了六维评分体系,综合得分可以复算,投资机会排序直观。但Wiki实际沉淀不足,仅建立2个公司实体页和2个主题页,没有实际生成来源摘要页和综合研究页,raw目录未保存原始研究资料,部分内部链接指向尚未创建的公司页面。

GLM-5.2覆盖公司最多,Wiki建立了10个实体页和6个主题页,报告展示效果较好。但投资框架分析逻辑不够清楚,评分权重和计算方法不够明确,框架的可复核性相对较弱。Wiki没有建立来源摘要页,实体页和主题页中的数据与观点没有形成追溯链条,部分链接指向未创建的页面。

综合评估与结论

三款模型均已具备完成复杂投研任务的基础能力。GPT 5.6 Sol综合表现最佳,在任务完成度、研究细节保留和长程执行稳定性方面均较为突出,其估值模型的可复算性、回测时点的严谨性和来源管理的规范性均领先。Kimi K3的报告结构和分析逻辑整体较好,但底稿联动和任务执行稳定性仍需提升,Wiki内容沉淀明显不足。GLM-5.2擅长任务拆解与报告展示,但底稿报错、结论不闭环及Wiki断链影响了交付物的可用性。

需要说明的是,本次Kimi K3测试于模型发布当天进行,测试过程中出现推理速度较慢和请求无法响应的情况,可能受到发布首日访问量和服务负载影响。因此,本文主要评价其已经完成的交付结果,暂不对响应速度和服务稳定性作出确定判断。与此同时,本次结论仅基于有限次数的任务测试,也可能受到任务样本、提示词设计和推理模式等因素影响,后续仍需通过多轮测试验证结果的稳定性和可复现性。

编辑:流星雨
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至