端侧AI发展现状及未来趋势分析

端侧AI发展现状及未来趋势分析

最佳答案 匿名用户编辑于2025/03/24 11:37

端侧 AI 快速发展,DeepSeek 让端侧模型低成本成为可能。

AI 计算主要依赖于云端,但云端计算存在延迟和数据隐私的问题。而端侧 AI 可以在本地处理 数据和任务,实现快速响应,无需将数据传输到云端,从而提升用户体验并保护隐私。随着 NPU 的 广泛应用,端侧设备逐渐具备了处理 AI 任务的能力。NPU 是专为神经网络计算设计的加速器,与传 统 CPU 和 GPU 相比,它在执行 AI 模型时效率更高、功耗更低,适合资源受限的设备。NPU 技术的进 步推动了终端设备在语音识别、图像处理和自然语言处理等多模态任务上的性能提升。例如,现代 智能手机可以利用内置 NPU 实现实时物体识别,帮助用户管理和分类照片。

目前,端侧大模型主要发展语言模型和文生图模型,未来将向多模态领域拓展。多模态模型能 处理语言、图像、音频、视频等多种数据,满足多样应用需求。比如用户能用自然语言和图片与设 备交互,获得更智能体验。这不仅推动人机交互进步,还让终端更懂用户需求。端侧 AI 的个性化 也是未来重点。通过在设备上个性化训练,它能适应不同用户习惯,提供定制服务。像手机 AI 学 习用户拍照偏好后,能自动调参数、推荐拍摄模式。这既能提升用户依赖度,也为终端厂商带来商 业机遇。 端侧 AI 的应用场景从智能手机、PC 等拓展到可穿戴设备。随着 NPU 技术提升,可穿戴设备 虽体积小巧,却能实现语音识别、健康监测和图像处理等功能。比如搭载 NPU 的智能手表,能本地 处理语音命令,使用更便捷。新兴的智能眼镜等可穿戴设备,借助端侧 AI 实现实时翻译、情绪识 别等功能,拓宽了应用边界。在可穿戴设备中引入 AI,厂商能打造更具吸引力的产品,在市场竞争 中占据优势。像兼具实时语音翻译和心率监测功能的智能手表,在出国旅行、健康管理等场景实用 性强,提升了用户生活质量。

智算在 AI 深度学习领域发挥着举足轻重的作用,主要应用体现在以下关键方面: 加速模型训练:深度学习模型结构复杂,参数数量庞大,训练过程对计算资源需求极高。智能 算力借助 GPU(图形处理器)、TPU(张量处理单元)这类高性能计算设备,显著加快了模型训练进 程。以 GPT-4 等大型语言模型为例,训练时需要处理海量文本数据,智能算力的强大运算能力可快 速完成复杂的矩阵运算,大幅缩短训练时间。 优化推断推理:在模型推断阶段,智能算力通过高性能计算设备与专门的推理芯片,显著加速 了深度学习模型的推断过程。这使得模型能够在更短时间内处理输入数据并输出结果,大幅提升了 模型的实时性和稳定性。在智能安防领域,实时视频监控的目标检测任务需要快速响应,智能算力 可确保检测结果及时准确输出。 助力模型优化:借助智能算力,能够对模型进行自动化的超参数调优,精准找到最适配的参数 组合;开展网络结构搜索,探寻更高效的模型架构;实施模型剪枝,去除冗余连接,从而进一步提 升模型的精度和效率。

人工智能芯片的架构与应用类型存在较大区别。架构上,传统计算机架构含 GPU、FPGA、ASIC。 GPU 用于图像处理,适合数据密集计算;FPGA 可无限次编程,开发时间短;ASIC 依特定需求定制, 能效高。类脑计算架构的 NPU 模仿大脑神经结构,多为研究型芯片,商业化程度低。应用方面,训 练算力对芯片算力要求高,多为 FP32 与 FP16 精度;推理算力对芯片算力要求低,多为 FP32 与 FP64 精度,强调低延时等特性。 Deepseek 浪潮席卷 AI 领域,端侧成本逐步下降。2025 年 1 月 20 日,DeepSeek 正式发布其 DeepSeek-R1,最大的亮点:1,性能比肩 OpenAI o1 正式版。2,价格为每百万输入 tokens 1 元(缓 存命中)/4 元(缓存未命中),每百万输出 tokens 16 元。而且在开源 DeepSeek-R1-Zero 和 DeepSeek-R1 两个 660B 模型的同时,通过 DeepSeek-R1 的输出,蒸馏了 6 个小模型开源给社区,其中 32B 和 70B 模型在多项能力上实现了对标 OpenAI o1-mini 的效果。更强的性能,更低 的训练与推理成本,将加速推动 AI 应用与硬件的普及和落地。

借助算法能力,DeepSeek 降低 AI 普及成本。借助算法创新,如 FP8 低精度训练,大幅降低大 模型训练成本,减少内存占用与通信开销,让国产 GPU 在算力不足时也能高效训练。推动开源,吸 引全球开发者,降低模型使用门槛,助力 AI 技术向产业渗透。端侧应用爆发推高算力需求,其推 理端低成本优势或推动市场格局转变,让端侧模型低成本成为可能。

LLM 单纯云端部署(例如 ChatGPT)并不广泛接受。88%的参与者倾向于边缘 -云协作架构,其中 58.33%支持本地部署,81.82%对现有的仅云端解决方案不满意。他们的主要担 忧是:1)远程大型语言模型服务的高延迟,2)将个人数据传输到云端的风险,3)云端大型语言模型服 务的成本。

2023 年边缘大型语言模型开始陆续爆发,当时出现了几个参数量低于 10B 的模型,使其能在边 缘设备上运行,包括 meta 的 LLaMA 系列,微软的 Phi 系列,智谱的 ChatGLM,阿里巴巴的 Qwen 等。 进入 2024 年创新步伐加快,边缘端部署的优势是能够缩短响应时间,并直接应用在如手机、汽车、 可穿戴设备上。2022 年至 2032 年,按终端用户划分的全球设备边缘人工智能市场规模。市场将以 25.9%的复合年增长率增长,预计 2032 年的市场规模为 1436 亿美元。 尽管在边缘端部署大模型有诸多优势,但考虑到端侧有限的计算能力、存储能力和能源限制等, 使得直接部署基于云端的 LLM 困难重重。再评估设备端大型语言模型的性能时,有几个关键指标需 要考虑:延迟、推理速度、内存使用、存储和能耗。通过优化这些性能指标,设备端大型语言模型 能够在更广泛的场景中高效运行,提供更好的用户体验。同时针对边缘设备的部署,在保持性能的 同时提高计算效率至关重要,通过量化、剪枝、知识蒸馏和低秩分解,这些方法通过平衡性能、内 存占用和推理速度来提高大语言模型的运行效率,确保其在设备端应用中的可行性。

近年来,人工智能技术的迅猛发展和移动设备硬件的不断升级,使得在边缘设备上部署大型语 言模型成为可能。作为人们日常生活中最常用的设备,智能手机上的语言模型引人注目。目前,全 球主要手机品牌已开发并发布了多款先进的模型,这些模型采用设备端部署或设备-云协同策略。

设备端语言模型正开启一个智能、响应迅速、个性化应用的新时代。通过将先进的自然语言处 理能力直接引入用户设备,这些模型正在改变人们与技术互动的方式。从即时消息建议到实时语言 翻译,从保密医疗咨询到尖端自动驾驶汽车。在资源受限设备上部署 LLM 面临独特挑战,这些挑战 与传统的基于云的实施有显著不同。这些挑战涉及多个领域,包括模型压缩、高效推理、安全性、 能源效率,以及与多样化硬件平台的无缝集成等。

随着蒸馏模型能力提升,端侧 SoC 未来发展呈现新趋势。蒸馏模型可将大型模型知识迁移至小 型模型,大幅降低对硬件资源要求,让端侧设备运行复杂 AI 模型成为现实。以 DeepSeek R1 等 模型为例,其运用强化学习和模型蒸馏技术,能在本地设备高效推理,且训练只需极少量标注数据, 既增强了模型适应性与灵活性,又降低了部署成本。在硬件方面,未来 NPU 等专用硬件加速器进一 步发展,将使端侧设备处理复杂 AI 任务的能力更高效。这些趋势将推动 AI 从云端向本地设备转 移。一方面,设备能够在离线状态下独立完成复杂 AI 任务,数据无需上传至云端处理,提高了数 据隐私保护水平,避免数据在传输与存储过程中可能面临的泄露风险。另一方面,减少了对网络连 接的依赖,无需等待云端响应,直接在本地快速处理,提升了处理效率,使 AI 应用在更多场景下 得以快速、安全地实现,为用户带来更便捷、高效且安全的体验,也为 AI 在更多领域的深入应用 拓展了空间。

参考报告REPORT

电子行业专题报告:重构科技生态,引领智能革命.pdf

电子行业专题报告:重构科技生态,引领智能革命。大模型商业生态推动端侧场景落地。过去ChatGPT引领了全球AI产业,国内外公司纷纷布局AI赛道。国内多家厂商探索商业化路径,在激烈竞争下大模型成本不断降低,推动技术普及,Deepseek-V3及R1大模型凭借性能出色、成本低且开源,获国内厂商适配,加速商业化进程,并为产业发展探索新路径。在端侧应用方面,端侧AI能有效赋能终端产品。其中,手机引入AI功能升级,手机、PC有望承载个人大模型需求,提供个性化服务。同时,AI大模型助力AR眼镜升级为智能眼镜,端侧AI产业链上下游积极推动AI在端侧部署,在SoC、存储、散热、电池等方面有升级需求。全球云厂商...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

用户解答榜
分享至