天数智芯全栈自研软件栈如何实现对CUDA生态兼容及性能优化?

在国产GPU替代进程中,软件生态兼容性是降低客户迁移成本的关键。请结合天数智芯的技术架构,分析其全栈自研软件栈DeepSpark如何实现与英伟达CUDA生态的兼容?具体在算子优化、模型适配及客户定制方面具备哪些差异化优势?

最佳答案 匿名用户编辑于2026/06/28 08:40

天数智芯通过全栈自研的DeepSpark软件栈及其核心中间件IXUCA,构建了差异化的生态兼容性优势。首先,在架构层面,公司通过自研中间表示层将计算图与底层指令集解耦,实现了对英伟达CUDA生态的“API级别兼容”。这意味着开发者无需修改原有模型代码即可完成编译映射,实际迁移效率显著提升,有效降低了客户的迁移摩擦。

其次,在性能优化方面,全栈自研赋予了公司从芯片架构到核心算子的极致调优能力。由于拥有完整的算子库、编译器及硬件RTL仿真环境,公司可以在每一处细节进行调优,将硬件性能释放到极致。例如,在FA算子调优过程中,公司成功将MFU(模型浮点运算利用率)从初始的13.26%提升至56.12%。在实测场景中,得益于深度软件栈优化和高算力利用率,天数智芯的GPGPU在计算密集型的Prefill场景下表现优异。在LLaMA2 7B场景下,随着Token数增加,其吞吐性能逐步超越A800;在DeepSeek R1 671B场景下,整体吞吐性能亦优于A800。

最后,在客户定制方面,全栈自研赋予了公司应对下游客户深度定制需求的灵活性。在与头部客户合作时,公司能够按客户业务场景进行底层调优,这在依赖第三方库或受限开源代码的厂商中较难实现。完整的自研经验使研发团队能够深度理解从硬件利用率到软件性能瓶颈的每一层环节,在特定场景响应能力(如PD分离、长上下文优化等)上形成较强工程化能力,截至2025年末,该软件栈已累计完成超过450个AI模型的执行验证,构建了强大的生态粘性。

参考报告REPORT

天数智芯-9903.HK-深度研究:时来天地皆同力,国产GPU主力爆发在即.pdf

本文对天数智芯(09903.HK)进行深度研究,认为公司作为国产GPU主力厂商,正迎来爆发拐点。公司深耕GPGPU架构多年,构建了“云端训练+云边推理+边端算力”协同互补的完整产品矩阵,核心技术人员具备深厚全球GPU产业经验。近年来公司营收高速增长,2022至2025年营收分别为1.89亿元、2.89亿元、5.40亿元及10.34亿元,增速逐年抬升,反映出国产替代需求释放与产品矩阵成型的叠加效应。截至2025年末,公司累计服务超过340名客户,在逾1000个项目中部署应用。报告指出,当前AI算力市场受Agent需求爆发及海外供给受限双重影响,国产供需缺口持续扩大。天数智芯具备全栈自研能力,从芯...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

用户解答榜
分享至