2026年电子行业LPU专题报告一:架构创新突破大模型推理延迟瓶颈,广阔市场空间有望快速放量
- 来源:财通证券
- 发布时间:2026/03/18
- 浏览次数:109
- 举报
电子行业LPU专题报告一:架构创新突破大模型推理延迟瓶颈,广阔市场空间有望快速放量.pdf
电子行业LPU专题报告一:架构创新突破大模型推理延迟瓶颈,广阔市场空间有望快速放量。LPU为新一代面向大模型推理阶段的芯片,核心为TSP架构:LPU是专为顺序处理的计算密集型任务设计的新型芯片架构,核心在于TSP架构,包含五大功能模块,将经典的处理器五级流水线拆散在整个芯片内,进而消除了硬件的复杂性,使指令执行顺序和时间具有确定性。在TSP架构下,编译器可以直接访问并精确控制芯片的底层硬件状态,实现了软件定义硬件。LPU可缩短大模型推理过程中的延迟,提高用户体验感:大模型在推理过程中会存在延迟,延迟与用户体验感精密挂钩,大模型推理过程中的延迟主要在Decode阶段,核心瓶颈在于内存带宽。LPU...
LPU 面向大模型推理阶段,TSP 架构为核心
1.1 LPU 是一款用于大模型推理阶段的定制芯片
LPU 是一款专用于大模型推理阶段的定制芯片。LPU(Language Processing Unit,语言处理单元)是专为顺序处理的计算密集型任务设计新型芯片架构,其 核心目标是通过架构创新优化语言模型的推理效率。LPU 由 Groq 公司推出, Groq 成立于 2016 年,LPU 旨在用于大模型推理阶段,LPU 是唯一一款为开发 者提供所需性能且成本不影响开发者的定制推理芯片。
LPU 采用 14nm 制程工艺,集成 SRAM,可提供 80TB/s 的片上内存带宽。LPU 没有采用尖端制程工艺,选择了 14nm 制程,集成了 230MB 容量的 SRAM 来 替代 DRAM,以保证内存带宽,其片上内存带宽高达 80TB/s。在算力层面,Groq 芯片的整型(8 位)运算速度为 750TOPs,浮点(16 位)运算速度则为 188TFLOPs。

1.2 LPU 核心在于 TSP 架构,指令执行顺序和时间具有确定性
LPU 核心 TSP 架构,包含五大功能切片。整体芯片架构包含五大功能切片,MXM 用于执行矩阵运算,SXM 用于对矢量进行移位和旋转操作,MEM 用于内存读/ 写运算,VXM 用于向量上的算术运算,ICU 为指令控制单元,负责获取和调度 指令并在其他切片上执行。从整体来看,ICU 排布于芯片下方,MXM、SXM、 MEM 功能切片以 VXM 功能切片为中心呈双侧对称分布。
相较于传统多核处理器,TSP 将经典的处理器五级流水线拆散在整个芯片内。在 传统的 MultiCore 架构中,每个 PE 都是一个完整的多级流水线架构配置了独立 的指令译码/派发器件和独立的 Cache 层次化结构;在 TSP 微架构上,对传统的 多核处理器微架构进行了重组。经典的处理器五级流水线被拆散在了整个芯片内。

指令垂直下发,数据水平流动。相较于传统多核处理器,Groq 整个芯片构建了独 立的 ICU(Instruction Control Units)用于取指和译码,整个芯片被水平地划分 为多个功能切片。在每个时钟周期中,ICU 会向下方对应的功能切片垂直地、同 步地广播指令,这种执行方式类似于 SIMD,所有位于同一垂直列上的 FU 在同 一时刻执行由顶部 ICU 发出的指令;数据从一个功能切片产生,变成一个“流”, 水平地流向下游的功能切片进行运算,计算结果再继续以流的形式向下游传递, 或者被写回 MEM 单元。
TSP 架构消除了硬件的复杂性,指令执行顺序和时间具有确定性。基于微架构的 设计,在 CPU 和 GPU 上执行指令是不确定的,无法保证特定指令何时执行、完 成需要多长时间以及何时提供结果。CPU 中指令执行的顺序和时间不确定且难 以推理,而 GPU 还有其他一些非确定性因素,包括缓存、共享和全局内存、动 态资源分区等。非确定性带来的问题是,很难推理程序的性能,也很难保证最坏 情况下的性能限制。相较于 CPU 和 GPU,Groq 的 TSP 没有不确定的行为, 这消除了硬件的复杂性,使编译器能获得更大的权利,精确调度和控制指令的执 行,保证对程序性能的限制。
1.3 软件定义硬件,编译器定义芯片行为
软件定义硬件,编译器可以直接访问并精确控制芯片的底层硬件状态。TSP 的设 计人员简化了硬件,编译器需要精确地调度指令和数据流,以正确执行给定的程 序,并以最有效的方式执行;同时,由于 TSP 硬件中没有非确定性行为,因此编 译器可以准确了解每条指令的延迟,以及程序中的数据流,编译器的后端可以跟 踪片上任何流的位置和使用时间,称为软件定义硬件。
1.4 单节点内 Fullmesh 拓扑,单机柜内 Dragonfly 拓扑
单节点包含 8 个 GroqChip,一个机柜包含 9 个 GroqNode。据 Groq 提供的整 体端到端实时 AI 和 HPC 解决方案,主要是四部分:GroqChip、GroqChip、 GroqNode、GroqRack。
节点内 Fullmesh 拓扑,机柜内 Dragonfly 拓扑。在 Node 中,8 张 GroqCard 通过线缆构成一个 Fullmesh 的结构,每张卡顶部有 7 个互联接口,通过线缆链 接到其他 7 张卡;每张 GroqCard 背板位置有 4 个接口用于链接其他 Node,并 构成一个 Dragonfly 拓扑。

LPU 可缩短大模型推理过程中的延迟,提高用户 体验感
2.1 大模型推理延迟与用户使用体验感紧密挂钩,延迟主要发生在 Decode 阶段
2.1.1 大模型推理过程分为 Prefill 和 Decoding 两个阶段
大模型推理过程可分为 Prefill 和 Decoding 两个阶段。目前主流的大模型采用的 架构是 Decode-Only 架构,在使用 Decode-Only 架构的大模型进行推理时, 整个推理过程主要分为两个阶段:一个是 Prefill 阶段,一个是 Decode 阶段。
Prefill 阶段:大模型接收到用户输入的问题(Prompt)后,生成回答中的第一个 单词(Token)的阶段;Decode 阶段:大模型根据输出的第一个单词(Token) 的回答后继续进行后续预测输出的阶段。 在大模型推理过程中,大模型会不断根据输入的 Prompt 持续输出 Token。从大 模型与使用者进行交互并生成回答的过程中,使用者会先将问题输入给大模型, 对于大模型而言,这个问题叫做“Prompt”,也就是提示词;大模型接收到提示 词后,便开始执行推理过程:大模型会根据“Prompt”来回答第一个回答的单词, 随后会根据输出的第一个回答的单词来不断地预测后一个回答的单词,直到把需 要回答的单词全部生成完。 Prefill 阶段和 Decode 阶段具有共通点。两个阶段在大模型运行的过程是一样的, 不一样的是大模型接收到的输入不一样。以下图场景为例,对于大模型来说,第 一次的输入(Prefill 阶段的输入)是“今天吃饭了吗”这句话,模型的输出是回 答中的第一个词,也就是“我”,随后将得到的输出和输入合并成一个新的 Prompt输入给大模型,大模型输出“不”,依次类推,直到满足一定的条件(如输出最后 一个字符),大模型停止输出,模型回答完毕。
引入 KVCache 技术减轻计算量。在每个步骤输入的 Prompt 存在大量的重复单 词,为减轻重复单词带来的计算量,引入了 KVCache 技术,KVCache 技术就 是把上一步骤已经计算过的单词进行缓存,方便在下一步骤的时候直接使用,并 且把新的输入加到已经缓存好的单词的末尾就可以了。

2.1.2 延迟/吞吐/利用率为衡量大模型推理性能的指标,延迟与用户使用体验感 紧密挂钩
大模型在推理过程中有一些重要的性能指标的定义和含义,对于这些指标,大致 可分为三类:延迟 Latency、吞吐 Throughput、利用率 Utilization。
2.1.3 大模型推理过程中的延迟主要在 Decode 阶段,核心瓶颈在于内存带宽
Prefill 阶段和 Decode 阶段对于资源的需求不同。1)Prefill 阶段:大模型一次 性对 Prompt 中所有 Token 进行计算 QKV,由于不同 Token 的计算是独立的, 因此该过程可以并行,在 Attention 部分,计算得到的 QKV 进一步计算出 Output 矩阵,再经过后续的 FFN 层和解码得到首字母 Token。因此 Prefill 阶段存在大 量矩阵乘法和 Attention 计算,GPU 的算力利用率很高,但内存带宽压力较小。 Prefill 是典型的 Compute-bound 阶段;2)Decode 阶段:计算过程可以复用 Prefill 阶段的 KV 结果,也可以复用 Decode 阶段已经产生的 KV 结果,在 KVCache 技术下,对于 Q 矩阵,每次需要计算的只是 Q 的最后一行 q,计算关 于 qKV 的 attention,而不是关于 QKV 的 attention,这样复杂度降低了一个量 级,实现以存换算。每次 Decode 阶段只需要把最新的生成的 Token 输入进去, 拿之前的 KVCache 来做 attention,预测下一个 Token,而每生成一个 Token, 都需要访问所有历史的 KVCache,计算量小,但内存带宽压力大。Decode 是 典型的 Bandwidth-bound 阶段。 LLM 推理的核心瓶颈在于逐个 Token 生成的 Decode 阶段,其本质受限于内存 带宽,而非计算峰值。LLM 推理阶段包括 Prefill 阶段和 Decode 阶段,其中 Prefill 阶段类似于训练,需要同时处理输入序列的所有 Token,本质上具有高度并行性, 通常受计算能力限制。相比之下,Decode 阶段本质上是顺序执行的,每一步仅 生成一个输出 Token,这使其性能受限于内存带宽。大模型推理过程中 90%以 上的时间耗费在Decode阶段,单线程生成首个Token的延迟一般不超过0.1s, 后续每生成一个 Token 的量级大概为 50ms。
2.2 LPU 具备更快的内存带宽,可缩短大模型推理过程中的延迟
2.2.1 LPU 采用 SRAM 作为存储介质,解决大模型推理阶段面临的内存带宽 受限问题
LPU 采用 SRAM 作为存储介质,解决大模型推理阶段面临的内存带宽受限问题。 在 Groq 的设计中,芯片内部没有调度器。每一比特数据在芯片内部的流动路径、 在哪个时钟周期到达哪个功能单元,全都在编译阶段由算法计算完成,带来了硬 件不再需要为了“猜测”指令流向而浪费晶体管和功耗。同时,Groq 采用 SRAM 替代 HBM,带来了确定性时延、数据流设计等优势。Groq 通过静态调度,去除 了所有与计算无关的“控制开销”,而在传统 CPU/GPU 中,约有 60%-80%的 能量消耗在数据的搬运、缓存管理和指令调度上。
2.2.2 基于 LPU 的大模型具有更快的推理速度和更具性价比的价格
基于 LPU 的大模型具有更快的推理速度和更具性价比的价格 。根据 Articical Analysis 的数据显示,Grop 推出的 Mixtral 8×7B Instruct API,以每秒处理约 430 个 Token 的速度,且每百万个 Token 的价格仅为 0.27 美元。
编辑:火腿肠-
标签
- 电子
- 热门文档
- 热门文章
- 本年热门
- 本季热门
- 本月热门
- 1 关于2025年国民经济和社会发展计划执行情况与2026年国民经济和社会发展计划草案的报告——2026年3月5日在第十四届全国人民.pdf
- 2 中国网络视听协会:中国网络视听发展研究报告(2026) .pdf
- 3 市场监管局:2025直播电商行业发展白皮书.pdf
- 4 房地产行业第8_9周周报(2026年2月14日_2026年2月27日):26年春节新房成交量低于23_25年,二手房成交量高于23_25年;上海优化限购、公积金和房产税政策.pdf
- 5 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 6 中国股票策略:中国最佳商业模式研究(第二版).pdf
- 7 互联网行业:第57次中国互联网络发展状况统计报告.pdf
- 8 2026年政府工作报告.pdf
- 9 中国2026年展望:探索新动能.pdf
- 10 2025中国新就业形态报告.pdf
- 1 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 2 腾讯研究院-从超级个体到超级团队:AI时代组织变革的涌现路径.pdf
- 3 腾讯研究院:2026丰饶之后:AI Coding 观察报告.pdf
- 4 兰花科创-600123-优质无烟煤龙头,煤化一体静待周期反转与技改红利释放.pdf
- 5 机械设备行业:拥抱科技,重视AI为主线的设备及硬件等投资机会.pdf
- 6 TGV玻璃基板行业动态报告:玻璃基板崛起,赋能先进封装.pdf
- 7 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 8 玻璃基封装行业专题:玻璃基板有望成为先进封装新平台.pdf
- 9 投资策略-激光通信行业深度:行业现状、终端结构、市场规模及相关公司深度梳理.pdf
- 10 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 1 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 2 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 3 易观分析-具身智能行业:2026年中国具身智能重点行业应用与场景价值分析报告.pdf
- 4 中国汽车工业协会-汽车行业:2025中国汽车后市场年度发展报告.pdf
- 5 房地产行业专题报告:城市更新推动高质量发展.pdf
- 6 产业深度:生根与重构——2026年全球人工智能技术、政策、产业与投融资趋势全景洞察报告.pdf
- 7 硕远咨询-银发旅游行业:2026年银发旅游研究报告.pdf
- 8 能源电子行业月报:功率器件交期持续拉长,行业景气度稳步提升.pdf
- 9 AI医疗行业2026年6月月报:AI诊断与药研资本化提速,医疗智能体加速落地.pdf
- 10 千瓜数据-消费行业:2026年上半年热门行业数据简报.pdf
- 本年热门
- 本季热门
- 本月热门
- 1 2025年医药行业2026年度策略报告:创新药产业链景气度持续提升
- 2 2026年大族激光公司研究报告:PCB消费电子利好有望助力2025_27年盈利持续增长
- 3 2026年莱特光电公司深度报告:“一核双擎”打造中国电子材料领军企业
- 4 2026年春季港股及海外中资股投资策略:分化与回归
- 5 2026年航空行业夏航季民航时刻计划详解:稳中求进,国内控总量、国际促复苏
- 6 2026年春季A股投资策略:为第二阶段上涨蓄力,时代资产不退场
- 7 2026年春季北交所化工新材料行业投资策略:周期迎拐点,成长正当时
- 8 2026年中银香港公司研究报告:高股息护航,财富与出海共促成长
- 9 2026年春季海外宏观展望:结构性“滞胀”
- 10 2026年固收增厚产品系列报告之一:可转债基金的再定位与再解析
- 1 2026年6月人形机器人行业月报:资本化提速与量产渐近
- 2 2026年6月A股市场研判:AI引领向上,聚焦算力与景气延伸
- 3 2026 AI重塑影视产业:漫剧爆发与产业链重构深度解析
- 4 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 5 氧化锆断供与HBM瓶颈:全球产业趋势跟踪周报(2026年6月29日)
- 6 2026年7月A股量化择时:AI识图聚焦半导体与芯片赛道
- 7 2026 ASCO年会国产创新药双抗ADC临床数据梳理
- 8 A股2026年6月策略:景气强化与震荡上行配置建议
- 9 宁德时代发布钠电储能方案,7月中国电池排产环比增长
- 10 2026年中期医药生物行业投资策略:AI新药加速推进
