2024年大模型专题报告:从技术路径,纵观国产大模型逆袭之路
- 来源:德邦证券
- 发布时间:2024/07/05
- 浏览次数:1330
- 举报
大模型专题报告:从技术路径,纵观国产大模型逆袭之路.pdf
大模型专题报告:从技术路径,纵观国产大模型逆袭之路。海外大模型龙头轮番抢占性能第一宝座,比拼整体性能和多模态交互。大模型的宝座三次更迭:初代GPT-4o自我革命,持续刷新综合性能;二代谷歌Gemini更极限的上下文理解、更低延时;翘楚Claude3.5聚焦视觉和交互体验。大模型高地争夺:多模态的理解和响应,原生多模态技术比拼。大模型的效果取决于多模态理解与生成,毫秒级响应,更先进的视觉与音频理解能力,智能感知语气与语态。端到端原生多模态技术、统一神经网络,是竞争的主要角力点。大模型的比较维度升级:从模型到叠加终端,跨设备的使用效果体验。如谷歌推出AIAgent项目Astra模型,可以手机、眼睛...
海外龙头轮番抢占第一宝座, 比拼整体性能和多模态交互
高速迭代,海外龙头轮换占领大模型之巅
OpenAI、Google、Antropic三大厂商竞相轮 换大模型第一宝座:自23年初GPT-4发布以 来,在1年左右时间内基本稳定处于大模型 最强位置。2024年海外大模型迭代速度有所 加快,龙头竞争格局悄然发生变化。 1)5月,OpenAI发布新的旗舰模型GPT-4o, 实现跨模态即时响应,相比GPT-4 Turbo, 刷新SOTA实现性能飞跃。 2)5月,Google发布Gemini 1.5 Pro进阶版, 实现200万tokens上下文,具备更强大的推 理和理解能力。 3)6月,Antropic发布Claude 3.5 Sonnet, 具备更强的代码和视觉能力,基准测试结果 全方位碾压Gemini 1.5 Pro和Llama-400b, 大部分优于 GPT-4o,一定程度上暂时代表 着当前大模型性能最高水平。
初代:GPT-4o自我革命,持续刷新综合性能
在传统基准测试中,GPT-4o在文本、推理和编码智能方面实现了GPT-4 Turbo级别的性能,同时在多语言、音频和视 觉功能上达到了新的高水位线。 文本推理:GPT-4o在0-shot COT MMLU(常识问题)上创下了88.7%的新高分。此外,在传统的5-shot no-CoT MMLU上, GPT-4o创下了87.2%的新高分。相较于GPT-4 Turbo而言,GPT-4o文本推理能力有一定提升。 多语言识别:与Whisper-v3相比,GPT-4o在多种语言的识别中表现优异,尤其是资源匮乏的语言。 音频翻译:GPT-4o在音频翻译表现上达到新的高水准,且在MLS基准测试中优于Whisper-v3。
二代:谷歌Gemini更极限的上下文理解、更低延时
(高性能)进阶版Gemini 1.5 Pro:谷歌5月发布,上下文窗口翻倍、具备 更强大的推理与理解能力。上下文:过往Gemini 1.5 Pro支持100万tokens上下文,升级后可支持 200万tokens(理论极限为1000万tokens),意味着可输入分析2小时视 频、22小时音频、超过6万行代码或者140多万单词。这使得Gemini 1.5 Pro能处理更大量的复杂信息,生成更准确、更细致的输出。 性能:通过数据和算法改进,升级版的Gemini 1.5 Pro增强了模型的代 码生成、逻辑推理和规划、多轮对话以及音频和图像理解能力,在MMMU、 AI2D、MathVista、ChartQA、DocVQA等多项公共基准测试中取得了显著 改进,在多项图像和视频理解基准测试中也实现了最先进性能。 价格:输入7美元/百万tokens;3.5美元/百万tokens(128k上下文)。
翘楚:Claude3.5聚焦视觉和交互体验
Claude 3.5 Sonnet :Anthropic迄今为止最强大的视觉模型。在解释图表、图形等视觉推理任务中改进明显。可以 准确地从粗略图像中转录文本,并输出更多洞察,这也是零售、物流和金融服务等领域的核心能力。 引入Artifacts变革交互方式。当要求Claude生成代码、文本或网站设计等内容时,Artifacts会出现在对话旁边的专 用窗口中,供用户实时查看、编辑和构建Claude的创作。相当于形成了一个动态工作空间,将AI生成的内容更无缝集 成到自己的项目和工作流程中。这项功能标志着Claude从对话式AI向协作工作环境的演变,未来将拓展至团队协作中。
最终判断依据:多模态的理解、生成和响应
多模态理解与生成,毫秒级响应,实现即时语音对话。 GPT-4o实现毫秒级视觉理解,GPT-4o能够接受文本、音频和 图像的任意组合作为输入,并生成文本、音频和图像的任意组合输出。使用语音模式与ChatGPT对话当中,GPT-3.5与 GPT-4平均延迟分别为2.8s、5.4s,而GPT-4o对音频输入的响应时间最短为232毫秒,平均为320毫秒,这与人类在对 话中的响应时间相似。 更先进的视觉与音频理解能力,智能感知语气与语态。与现有模型相比,GPT-4o展现了出色的视觉和音频理解能力: 首先,用户可在对话中随时打断;其次,可根据场景生成多种音调,带有人类般的情绪和情感;直接通过和AI视频通 话让它在线解答各种问题。
技术争夺:端到端原生多模态技术,统一神经网络
在语音对话场景,传统语音AI通常经过三步法实现对话功能,在这过程中会丢失很多信息且不能判断情绪变化。三步 法具体为:1)语音识别或ASR:音频到文本,类似 Whisper;2)LLM 计划下一步要说什么:文本1到文本2;3)语音 合成或TTS:文本2到音频,类似ElevenLabs或VALL-E。GPT-4便采用该模式,在这过程中不仅响应速度更慢而且丢失 了大量信息,无法直接观察语调、多个说话者或背景噪音,也无法输出笑声、歌唱或表达情感等。 GPT-4o为跨模态(文本、视觉和音频)端到端训练新模型,意味着所有输入和输出都由同一神经网络处理,成为真正 的多模态统一模型,带来性能的飞跃提升。
比较维度升级:叠加终端,跨设备的使用效果体验
谷歌推出AI Agent项目Astra模型,具备类似GPT-4o的能力,可以实现跨文本、音频、视频多模态实时推理。Astra和 GPT-4o的使用效果类似,用户可以通过它和AI实时对话,以及视频聊天。在发布会上,工作人员在演示视频中将手机 镜头对准身边的物品,并向Project Astra提出一些疑问,它几乎能做到零延时地准确回答。 Astra特点:1)利用用户设备上的摄像头和麦克风为日常活动提供无缝辅助;2)具备多模态能力,无缝处理音频、 图像、视频和文本输入,为用户提供全面的体验;3)深度理解视觉内容,并具备内容回溯能力;4)语调丰富。 Astra VS. GPT-4o:两者均具备音频、图像、视频等多模态处理能力,不同的是,GPT-4o专注于对多模态输入的实时 交互,Astra专注于通过外界设备无缝捕获和解释视觉信息,使其能够根据现实世界的观察提供与上下文相关的响应。
国内大模型逆袭之路:聚焦 长文本,降价迭代提升竞争力
先文后理:理科能力差距较大,注重文科能力的提升
整体比较而言,国内大模型与GPT4(官网)尚存在明显差距,但个 别能力上已展现出优势。 理科能力差距明显。除通义千问 2.1的工具使用能力较高,其它国 内大模型的得分均低于GPT-4(官 网)。 文科能力差异缩小。GPT-4在语义 理解中保持优势,国内大模型在其 他能力上表现出色。 通义千问2.1:在知识百科、长文本、 角色扮演和生成与创作等具有突出优 势,得分较GPT-4高。 Kimi:kimi在长文本能力上表现出色, 与GPT-4的较量中得分占优。
长文本的三大难题和解决之道
Transformer架构的大模型在长文本中存在注意力机制计算 复杂度、上下文记忆以及最长文本约束难题: (1)注意力机制计算复杂度:注意力机制的计算时间复杂 度、空间复杂度都是序列长度的二次方O(L²),随着序列变 长,存在计算速度变慢和内存增长的问题,模型的训练和推 理均存在负担。(2)上下文记忆:LLM缺乏显性的内存机制,仅依靠KV缓存 来存储以前所有token之间的信息,在结束了一次查询调用 操作后,除非将历史上所有token的信息重新加载到KV缓存 中,否则transformer不会保存该次查询的信息。因而,每 次调用时,模型只拥有较短的上下文工作内存,而不具备长 期记忆。这虽然在并行计算方面有优势,但在对长期记忆有 要求的聊天机器人场景中存在应用困难。 (3)最长文本约束:在训练时,由于GPU内存的限制,工程 师通常会确定最长的超参数长度(如1K、2K、4K等,表示任 意批训练中样本序列长度的限制),随着序列变长,模型性 能可能下降。在推理过程中,Transformer在访问长文本中 间时性能也会显著下降,LLM服务商通常会限制用户prompt 上下文长度,以保证模型性能的稳定。
降价抢占API调用量,撬动大模型“飞轮迭代”
随着技术进步和市场竞争,大模型训练&推理成本降低,国内大模型厂商纷纷降价,以吸引用户和提高市场份额。 国内大模型降价从初创公司开启,由云厂商加速,更多初创公司并未降价。根据智东西微信公众号统计,5月6日,深度求索开源MoE模型DeepSeek-V2, 百万tokens仅需1元。5月15日,字节宣布旗下通用模型豆包pro-128k版模型推理输入价格定价比行业价格低95.8%,豆包pro-32k模型推理输入降至比 行业价格低99.3%。之后阿里、百度、科大讯飞、腾讯等云厂商或科技企业相继加入降价队伍。对初创公司而言,除了深度求索、智谱AI之外,包括 百川智能、月之暗面、零一万物在内的几家头部大模型初创公司并未加入降价行列。 高幅度降价以轻量级、入门级模型为主,主力模型、旗舰模型降幅相比较小。 我们认为,降价不等于恶性竞争和模型缺陷,更多的是在技术支持下商业逻辑的打磨与模型能力的完善。云厂商降价行为更活跃,与其具备更完善的 云算力基础设施息息相关,通过降价的方式积累更多的用户,进一步抢占市场份额。
降价的背后是训练&推理成本的下降
国产大模型DeepSeek V2压缩KV缓存的实践: 技术路线:采用多头潜在注意力机制MLA将 KV缓存显著压缩成一个潜在向量来保证有效 的推理,从而提高推理效率。传统MHA方法, 一个Q向量与一对KV向量对应,而GQA和MQA 在压缩KV缓存时,多个Q向量会对应一组KV 向量,实现缓存的压缩,但一定程度上会影 响模型性能。MLA使用了低秩KV缓存联合压 缩的方法,通过引入低秩向量将KV压缩到低 维空间,相比MHA显著降低推理过程中缓存 的大小,并取得更好的性能。 根据DeepSeek-V2的技术论文,DeepSeek-V2 相对上代模型KV缓存减少93.3%,最大吞吐 量提升576%。简单估计,DeepSeek-V2以 236B总参数、21B激活,大致达到70B~110B Dense的模型能力,同时消耗的显存(KV Cache)只有同级别Dense模型的1/5~1/100, 每token成本大幅降低。实际部署在8卡H800 机器上,输入吞吐量超过每秒10万tokens, 输出超过每秒5万tokens。
报告节选:


编辑:火腿肠 -
标签
- 大模型
- 热门文档
- 热门文章
- 本年热门
- 本季热门
- 本月热门
- 1 关于2025年国民经济和社会发展计划执行情况与2026年国民经济和社会发展计划草案的报告——2026年3月5日在第十四届全国人民.pdf
- 2 中国网络视听协会:中国网络视听发展研究报告(2026) .pdf
- 3 市场监管局:2025直播电商行业发展白皮书.pdf
- 4 房地产行业第8_9周周报(2026年2月14日_2026年2月27日):26年春节新房成交量低于23_25年,二手房成交量高于23_25年;上海优化限购、公积金和房产税政策.pdf
- 5 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 6 中国股票策略:中国最佳商业模式研究(第二版).pdf
- 7 互联网行业:第57次中国互联网络发展状况统计报告.pdf
- 8 2026年政府工作报告.pdf
- 9 中国2026年展望:探索新动能.pdf
- 10 2025中国新就业形态报告.pdf
- 1 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 2 腾讯研究院-从超级个体到超级团队:AI时代组织变革的涌现路径.pdf
- 3 兰花科创-600123-优质无烟煤龙头,煤化一体静待周期反转与技改红利释放.pdf
- 4 机械设备行业:拥抱科技,重视AI为主线的设备及硬件等投资机会.pdf
- 5 TGV玻璃基板行业动态报告:玻璃基板崛起,赋能先进封装.pdf
- 6 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 7 玻璃基封装行业专题:玻璃基板有望成为先进封装新平台.pdf
- 8 投资策略-激光通信行业深度:行业现状、终端结构、市场规模及相关公司深度梳理.pdf
- 9 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 10 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 1 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 2 房地产行业专题报告:城市更新推动高质量发展.pdf
- 3 千瓜数据-消费行业:2026年上半年热门行业数据简报.pdf
- 4 AI医疗行业2026年6月月报:AI诊断与药研资本化提速,医疗智能体加速落地.pdf
- 5 厄尔尼诺如何影响资产价格:气候风险传导、历史复盘与2026年展望.pdf
- 6 投资策略:这一次,是金银的拐点吗?.pdf
- 7 风电行业2026年中期策略报告:短期招标承压,看好“十五五”两海成长空间.pdf
- 8 宏观专题:俄乌冲突最新进展如何?.pdf
- 9 腾讯研究院-FDE模式行业观察与实践:前线共创,双向赋能.pdf
- 10 银行业理财登记托管中心-中国银行业理财市场半年报告(2026年上).pdf
- 本年热门
- 本季热门
- 本月热门
- 1 2026年莱特光电公司深度报告:“一核双擎”打造中国电子材料领军企业
- 2 2025年医药行业2026年度策略报告:创新药产业链景气度持续提升
- 3 2026年大族激光公司研究报告:PCB消费电子利好有望助力2025_27年盈利持续增长
- 4 2026年分众传媒公司深度报告:基本盘稳固,格局优化+“碰一碰”开启成长新周期
- 5 2026年春季港股及海外中资股投资策略:分化与回归
- 6 2026年航空行业夏航季民航时刻计划详解:稳中求进,国内控总量、国际促复苏
- 7 2026年春季A股投资策略:为第二阶段上涨蓄力,时代资产不退场
- 8 2026年中银香港公司研究报告:高股息护航,财富与出海共促成长
- 9 2026年春季北交所化工新材料行业投资策略:周期迎拐点,成长正当时
- 10 2026年固收增厚产品系列报告之一:可转债基金的再定位与再解析
- 1 2026年6月人形机器人行业月报:资本化提速与量产渐近
- 2 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 3 2026年6月A股市场研判:AI引领向上,聚焦算力与景气延伸
- 4 2026 AI重塑影视产业:漫剧爆发与产业链重构深度解析
- 5 2026年7月A股量化择时:AI识图聚焦半导体与芯片赛道
- 6 氧化锆断供与HBM瓶颈:全球产业趋势跟踪周报(2026年6月29日)
- 7 2026 ASCO年会国产创新药双抗ADC临床数据梳理
- 8 2026年中期医药生物行业投资策略:AI新药加速推进
- 9 A股2026年6月策略:景气强化与震荡上行配置建议
- 10 宁德时代发布钠电储能方案,7月中国电池排产环比增长
