2025年AI大模型深度报告:大模型研究框架(2025)
- 来源:国海证券
- 发布时间:2025/04/22
- 浏览次数:1470
- 举报
AI大模型深度报告:大模型研究框架(2025).pdf
AI大模型深度报告:大模型研究框架(2025)。大模型发展回顾:以Transformer为基,Scalinglaw贯穿始终。2017年谷歌团队提出Transformer架构,创造性推动注意力层以及前馈神经网络层的发展,加速提升模型性能。2018–2020年是预训练Transformer模型时代,GPT-3以1750亿参数突破大规模预训练的可能性界限,而SFT及RLHF等技术帮助模型加速对齐人类价值观。此后随着训练侧ScalingLaw描述的幂律关系出现收益递减,叠加高质量文本数据或逐步被AI耗尽,推理模型开始进入人们视野;以OpenAI发布o1-preview将AIME2024的模...
一、大模型发展回顾:以Transformer为基,Scaling law贯穿始终
大语言模型(LLMs)的兴起——自回归架构强化文本生成能力
语言模型是一种人工智能系统,旨在处理、理解和生成类似人类的语言。它们从大型数据集中学习模式和结构,使得能够产生连贯且上下文相关的文本,应用于翻译、摘要、聊天机器人和内容生成等领域。大语言模型(LLMs)是语言模型系统的子集。大语言模型规模显著更大,通常包含数十亿个参数(例如,GPT-3 拥有 1750 亿个参数),使得大语言模型在广泛的任务中表现出卓越的性能。大语言模型这一术语在2018至2019年间随着基于 Transformer 架构的模型出现开始受到关注,在 2020 年 GPT-3 发布后,LLMs开始被广泛使用。 大多数LLMs以自回归方式操作,根据前面的文本预测下一个字(或token/sub-word)的概率分布。这种自回归特性使模型能够学习复杂的语言模式和依赖关系,从而善于文本生成。在文本生成任时,LLM通过解码算法确定下一个输出的字,这一过程可以采用的策略包括:1)选择概率最高的下个字;2)从预测的概率分布中随机采样一个字。
Transformer架构克服RNN长文本局限性,标志着NLP的分水岭时刻
2017年谷歌团队提出Transformer模型,Transformer架构也标志着NLP的分水岭时刻。Transformer突破了早期模型如循环神经网络(RNNs)与长短期记忆网络(LSTMs)在捕捉长依赖及顺序处理上的难点,同时RNN和LSTMs计算低效且易受梯度消失等问题困扰。Transformer的横空出世扫清了这些障碍,重塑了该领域格局,并为当代大型语言模型发展铺设了基石。
Transformer核心点1——自注意力机制(Self-Attention)
注意力机制允许模型在解码时,根据当前生成的词动态地关注输入序列中的不同部分,有效捕捉与输出相关的输入信息,而非依赖于某个固定的上下文向量。注意力机制使得模型更容易捕捉长距离依赖关系,模型在每个时间步都可以选择关注距离较远的输入部分。数学表达上,注意力度量两个向量之间的相似性并返回加权相似性分数,标准的注意力函数接受三个主要输入,即查询、键和值向量。例如,在电商平台搜索特定商品时,输入内容即为Query,搜索引擎据此匹配Key(涵盖商品种类、颜色、描述等),并通过计算Query与Key的相似度(即权值),得出匹配内容(Value)。
Transformer核心点2——前馈神经网络:
前馈神经网络是最基本的人工神经网络结构,由多层节点组成,每个节点都与下一层的所有节点相连。前馈神经网络的特点是信息只能单向流动,即从输入层到隐藏层再到输出层,不能反向流动。工作原理上表现为,输入数据首先进入输入层,然后通过权重和偏置传递到隐藏层,隐藏层中的节点对输入进行加权求和,并通过激活函数进行非线性转换,最后输出层接收到经过隐藏层处理的信号,并产生最终的输出。
GPT-3以1750亿参数开启了预训练侧Scaling law叙事
2020年OpenAI发布GPT-3(1750亿参数模型),NLP模型迎来了转折点。1750亿参数突破了大规模预训练的界限,展示了显著的少样本和零样本学习能力,在推理时只需提供最少或无需示例即可执行任务。GPT-3的生成能力扩展到了创意写作、编程和复杂推理任务,展示了超大模型的潜力。预训练侧Scaling law的叙事开始出现,模型性能随着模型大小、数据集大小以及训练使用的计算量的增加而平稳提升。在2018年至2020年间,研究人员发现随着模型规模的增长,模型在捕捉复杂模式和泛化到新任务方面变得更好。这种规模效应得到了三个关键因素的支持:1)数据集大小:更大的模型需要庞大的数据集进行预训练;2)计算资源:强大硬件(如GPU和TPU)的可用性以及分布式训练技术,使得高效训练具有数十亿参数的模型成为可能;3)高效架构:混合精度训练和梯度检查点等创新降低了计算成本,使得在合理的时间和预算内进行大规模训练更加实际。
二、国内大模型进展:行业充分竞争,降本提效为主旋律
国内大模型:行业充分竞争,降本提效为主旋律
国产大模型生产蓬勃发展。据工信部数据,截至2024年10月,现有完成备案并 上线为公众提供服务的生成式人工智能服务大模型近200个,注册用户超过了6亿, 相较2024年初实现了翻倍以上的增长。 国产模型中,典型代表包括不限于:具备先发优势的百度文心一言、清华大学 学术血脉的智谱清言、B端市场发力的讯飞星火、文字生成领域具备领先优势的 Kimi、媲美Sora视频生成能力的可灵、聚焦B端发力的华为盘古、霸榜开源社区 下载量的Qwen、依托腾讯生态优势的元宝、依托字节巨大流量入口的豆包以及 凭借算法优化媲美GPT-o1的DeepSeek。
DeepSeek:早期确立AI战略,模型家族涵盖标准语言模型/推理模型/多模态模型
DeepSeek是一家于2023年成立的中国初创企业,创始人是AI驱动量化对冲基金幻方量化的掌门人梁文锋。2021年,幻方量化的资产管理规模突破千亿大关,跻身国内量化私募领域的“四大天王”之列。2023年梁文锋宣布正式进军通用人工智能领域,创办DeepSeek,专注于做真正人类级别的人工智能。 DeepSeek团队以年轻化为主,具备深厚技术底蕴。创始人梁文锋曾在36氪的采访中,给出了DeepSeek的员工画像:“都是一些Top高校的应届毕业生、没毕业的博四、博五实习生,还有一些毕业才几年的年轻人。”自2023年5月诞生以来,DeepSeek始终维持约150人的精英团队,推行无职级界限、高度扁平化的文化,以此激发研究灵感,高效调配资源。2023年5月DeepSeek正式成立时,团队已汇聚近百名卓越工程师。如今,即便不计杭州的基础设施团队,北京团队亦拥有百名工程师。
以DeepSeek视角看模型降本增效范式
2025年2月24日,DeepSeek官宣开源周开放五大核心技术单元库,呈现DeepSeek高性能低成本核心架构。其中包括提升计算效率为主的FlashMLA架构及DeepGEMM库,通过降低向量计算维度实现降低显存的占用空间,进而实现GPU在显存利用率以及计算效率上的提升。而DeepEP面向通信层面,实现GPU节点间以及GPU节点内部的通信效率的大幅提升。DualPipe+EPLB则面向计算+通信任务之间的调度,通过大幅降低GPU空置率提升整体的计算效率;最后3FS则是面向数据读取环节,基于高速缓存和读取架构提升文件的随机读写效率。
豆包大模型:实时语音、视频生成/理解领域布局,2024H2发力月活冲上全球第二
2023年以来,字节积极布局生成式AI。2023年2月组建“Seed”团队,专注于AI领域的语言与图像研究,6月上线“火山方舟”;11 月成立专注于AI创新业务的新部门 Flow,聚焦于 AI 大模型及 AI 应用层的产品研发。2024 年 5 月,字节跳动正式发布了自研的豆包大模型,通过火山引擎正式对外提供服务。 2024H2豆包发力模型,月活冲刺6000万位居全球第二国内第一。2024年8月,豆包大模型正式实现用户和云端大模型的实时语音通话。2024年9月,豆包·视频生成模型正式上线;2024年12月,豆包视觉理解模型正式发布,通用模型能力全面对齐GPT-4o。2024年11月全球大模型月活跃排行榜上,豆包大模型MAU(月活)达5998万,仅次于OpenAI的ChatGPT,位列全球第二、国内第一。 2025年1月,豆包实时语音大模型上线开放,语音理解和生成一体化,实现端到端语音对话。相比传统级联模式,在语音表现力、控制力、情绪承接方面表现惊艳,并具备低时延、对话中可随时打断等特性;据外部用户真实反馈,该模型整体满意度较 GPT-4o 有明显优势。
三、海外大模型进展:资源头部集中,压铸AGI
海外大模型:CSP大厂重点参与,格局头部集中
海外头部大模型依托资源壁垒形成强马太效应。大模型随着2022年ChatGPT的发布进入大 众视野,同时与OpenAI资源匹敌的Google、Meta同样成为了底层模型的主要竞争者, Google、Meta基于自身超过30亿的用户体量,不断基于用户数据反哺模型训练;而亚马逊 则通过投资Anthropic来布局AI领域。当前海外主流的AI模型竞争玩家包括技术能力以及用 户数全球领先的OpenAI系GPT模型、依托亚马逊/谷歌投资的Anthropic模型Claude、谷歌自 研模型Gemini、Meta自研模型Llama、马斯克旗下自研模型xAI等。
OpenAI:全球AI大模型风向标,自然语言/多模态/推理模型上均作为引领角色
OpenAI以非营利性组织形式创立,GPT1-GPT4迭代实现能力跃升。2015年,OpenAI由马斯克、Sam Altman等人共同创立,以非营利性组织的形式成立。2018年,OpenAI基于Transformer推出第一代GPT模型GPT-1,核心在于采用了Transformer的解码器架构,通过生成式预训练以及微调的方式开启了自然语言处理领域的新篇章。2019年GPT-2发布,参数规模扩大到15亿,并引入多样化数据集进行训练;2020年发布GPT-3,参数规模达到1750亿,在自然语言处理任务上取得了突破性的进展。 2023年4月,GPT-4的发布在多个维度上实现了跨越式提升,无论是专业领域知识问答以及创意写作等方面能力远超以往模型水平,多模态能力上能同时处理文本和图像信息。 多模态+推理模型上均实现引领作用。2024年2月,OpenAI发布视频生成模型Sora,首次由 AI 生成了长达1分钟的多镜头长视频,输入寥寥数语便能生成效果炸裂视频,镜头感堪比电影。2024年9月,OpenAI发布o1推理模型,在回答问题之前像人类一样将问题拆解成多个思维步骤,经此,美国数学邀请赛(AIME)中,GPT-4o 的平均解题成功率为 13.4%,而 o1 的正确率则高达 83.3%。
Google:Gemini面向智能体时代新作,原生多模态领域前瞻布局
早期谷歌BERT是经典的NLP模型,主要面向单向/双向文本理解,Gemini是谷歌面向智能体以及多模态时代的下一代模型。2023年12月,谷歌正式发布原生多模态模型Gemini 1.0,原生支持文本、图像、音频、视频跨模态处理,在多方面能力测评中超越GPT-4。2024年2月发布Gemini 1.5Pro,上下文窗口扩展至100万token,支持更复杂的推理与长文本处理。 谷歌全线产品进入Gemini2.0时代,原生多模态能力再提升。2024年12月,谷歌正式发布人工智能大模型 Gemini 2.0,首个版本为Gemini 2.0Flash;2025 年 2 月谷歌宣布产品线全面升级,所有用户进入“Gemini 2.0” 时代,推出了正式版 Gemini 2.0 Flash、Gemini 2.0 Flash - Lite 以及新一代旗舰大模型 Gemini 2.0 Pro 实验版,同时在 Gemini App 中推出其推理模型 Gemini 2.0 Flash Thinking 实验版。Gemini2.0集成谷歌搜索、代码执行以及第三方用户定义函数等工具,进一步拓展原生工具集成,同时拓展上下文窗口,Gemini 2.0 Flash 和 Flash - Lite 支持100 万tokens,Gemini 2.0Pro实验版支持 200 万 tokens;性能提升上,Gemini 2.0 Flash 速度是 Gemini 1.5 Pro 的两倍。
四、模型未来研判:投注后训练+算法的大幅优化
模型架构的演进:从Dense到MoE,模型大幅降本提效
MoE(Mixture of Experts,混合专家模型)是一种用于提升深度学习模型性能和效率的技术架构。其主要由一组专家模型和一个门控模型组成,核心思想是在处理任务时只激活部分专家模型,并通过门控模型控制专家模型的选择和加权混合。简言之,MoE在训练过程通过门控模型实现“因材施教”,进而在推理过程实现专家模型之间的“博采众长”。 从Transformer架构上看,MoE使用稀疏的MoE层代替稠密的前馈网络(FFN)层,专家可以是 FFN,也可以是更复杂的网络,甚至是MoE本身,这样就会形成有多层 MoE 的 MoE;而门控网络或者路由来决定将哪个 token 发送给哪个专家。
模型架构的演进:从Dense到MoE,模型大幅降本提效
MoE与Transformer融合,逐步成为主流架构。MoE 起源于 1991 年的论文《Adaptive Mixture of Local Experts》。2020年,谷歌Gshard首次将MoE引入Transformer构建分布式并行计算架构,打开MoE发展新思路。之后,MoE逐渐进入规模发展阶段,作为一种底层架构优化方法,与Transformer结合,陆续被用于推荐系统、自然语言处理、计算机视觉、多模态大模型等领域。 国内外主流企业差异化推进MoE大模型布局和落地,2024年全球MoE大模型数量呈爆发增长态势。据53AI网统计,2024年1-5月全球发布MoE大模型数量约20个,超2021-2023三年总量(约10个),且以多模态大模型为主(占比约90%)。谷歌、OpenAI、阿里、华为、腾讯等大型企业侧重利用MoE提升大模型性能和实用性。而Mistral AI、昆仑万维、MiniMax、幻方量化等初创企业侧重利用MoE低成本优势抢占AI市场。
合成数据作为AI时代新石油,支撑模型继续在pre training上scaling
合成数据(Synthetic Data)通常由算法和数学模型创建。首先通过建模真实数据的分布,然后在该分布上进行采样,创建出新数据集,模拟真实数据中的统计模式和关系。 目前市面上已有许多工具可生成合成数据,如英伟达发布3D仿真数据生成引擎Omniverse Replicator、微软开源合成数据工具SyntheticDataShowcase等。6月14日,英伟达发布开源大模型Nemotron-4 340B,包含基础模型Base、指令模型Instruct和奖励模型Reward,也可用于生成高质量合成数据,其中Instruct模型用于生成基于文本的合成输出,Reward模型对生成的文本进行评估并提供反馈,指导迭代改进并确保合成数据的准确性。合成数据作为数字经济时代的“新型石油” ,在高质量数据或耗尽的背景下继续支撑模型scaling。据Gartner预测,2024年AI训练中用到的数据有60%是合成数据,到2030年绝大部分训练数据将是合成数据。据著名市场调研机构Nester预测,全球合成数据的市场呈现蓬勃发展趋势,年复合增长率达35%,预计到2035年底,合成数据市场规模将达124.5亿美元。
报告节选:


编辑:火腿肠 -
标签
- AI
- 热门文档
- 热门文章
- 本年热门
- 本季热门
- 本月热门
- 1 关于2025年国民经济和社会发展计划执行情况与2026年国民经济和社会发展计划草案的报告——2026年3月5日在第十四届全国人民.pdf
- 2 中国网络视听协会:中国网络视听发展研究报告(2026) .pdf
- 3 市场监管局:2025直播电商行业发展白皮书.pdf
- 4 房地产行业第8_9周周报(2026年2月14日_2026年2月27日):26年春节新房成交量低于23_25年,二手房成交量高于23_25年;上海优化限购、公积金和房产税政策.pdf
- 5 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 6 中国股票策略:中国最佳商业模式研究(第二版).pdf
- 7 互联网行业:第57次中国互联网络发展状况统计报告.pdf
- 8 2026年政府工作报告.pdf
- 9 中国2026年展望:探索新动能.pdf
- 10 2025中国新就业形态报告.pdf
- 1 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 2 腾讯研究院-从超级个体到超级团队:AI时代组织变革的涌现路径.pdf
- 3 兰花科创-600123-优质无烟煤龙头,煤化一体静待周期反转与技改红利释放.pdf
- 4 机械设备行业:拥抱科技,重视AI为主线的设备及硬件等投资机会.pdf
- 5 TGV玻璃基板行业动态报告:玻璃基板崛起,赋能先进封装.pdf
- 6 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 7 玻璃基封装行业专题:玻璃基板有望成为先进封装新平台.pdf
- 8 投资策略-激光通信行业深度:行业现状、终端结构、市场规模及相关公司深度梳理.pdf
- 9 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 10 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 1 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 2 房地产行业专题报告:城市更新推动高质量发展.pdf
- 3 千瓜数据-消费行业:2026年上半年热门行业数据简报.pdf
- 4 AI医疗行业2026年6月月报:AI诊断与药研资本化提速,医疗智能体加速落地.pdf
- 5 厄尔尼诺如何影响资产价格:气候风险传导、历史复盘与2026年展望.pdf
- 6 投资策略:这一次,是金银的拐点吗?.pdf
- 7 风电行业2026年中期策略报告:短期招标承压,看好“十五五”两海成长空间.pdf
- 8 宏观专题:俄乌冲突最新进展如何?.pdf
- 9 腾讯研究院-FDE模式行业观察与实践:前线共创,双向赋能.pdf
- 10 银行业理财登记托管中心-中国银行业理财市场半年报告(2026年上).pdf
- 本年热门
- 本季热门
- 本月热门
- 1 2026年莱特光电公司深度报告:“一核双擎”打造中国电子材料领军企业
- 2 2025年医药行业2026年度策略报告:创新药产业链景气度持续提升
- 3 2026年大族激光公司研究报告:PCB消费电子利好有望助力2025_27年盈利持续增长
- 4 2026年分众传媒公司深度报告:基本盘稳固,格局优化+“碰一碰”开启成长新周期
- 5 2026年春季港股及海外中资股投资策略:分化与回归
- 6 2026年航空行业夏航季民航时刻计划详解:稳中求进,国内控总量、国际促复苏
- 7 2026年春季A股投资策略:为第二阶段上涨蓄力,时代资产不退场
- 8 2026年中银香港公司研究报告:高股息护航,财富与出海共促成长
- 9 2026年固收增厚产品系列报告之一:可转债基金的再定位与再解析
- 10 2026年春季北交所化工新材料行业投资策略:周期迎拐点,成长正当时
- 1 2026年6月人形机器人行业月报:资本化提速与量产渐近
- 2 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 3 2026年6月A股市场研判:AI引领向上,聚焦算力与景气延伸
- 4 2026 AI重塑影视产业:漫剧爆发与产业链重构深度解析
- 5 2026年7月A股量化择时:AI识图聚焦半导体与芯片赛道
- 6 氧化锆断供与HBM瓶颈:全球产业趋势跟踪周报(2026年6月29日)
- 7 2026 ASCO年会国产创新药双抗ADC临床数据梳理
- 8 2026年中期医药生物行业投资策略:AI新药加速推进
- 9 A股2026年6月策略:景气强化与震荡上行配置建议
- 10 宁德时代发布钠电储能方案,7月中国电池排产环比增长
- 1 2026年8月A股策略:否极泰来蓄势进攻,科技修复与业绩高增方向并重
- 2 2026年上半年小红书六大热门行业消费趋势洞察
- 3 2026年7月A股回调归因与底部布局策略分析
- 4 2026上半年小红书六大热门行业消费数据洞察
- 5 2026年A股中报业绩预告点评:全A盈利延续改善,结构性景气主导
- 6 2026年8月A股静态指标:资产联动回撤与市场情绪降温下的反攻酝酿
- 7 2026年8月煤炭行业:旺季需求带动去库,煤价上行动力渐强
- 8 2026上半年国内AI剧漫剧行业数据报告
- 9 2026年8月投资组合报告:从极致抱团到均衡修复
- 10 2026年7月费城半导体回撤超20%:2024年调整周期复盘与跨市场启示
