手机端实现300亿参数模型:每秒处理330个Token
在2026骁龙峰会上,高通展示了一项突破性技术:基于第六代骁龙8超级至尊版移动平台,成功在手机上运行300亿参数的混合专家(MoE)模型,预填充吞吐量达到每秒330个Token。这一成就让许多人感到震惊,因为两年前,类似的想法似乎不可实现,因其要求极高的存储和计算资源。
该技术的关键在于混合专家架构,通过只激活与特定任务相关的部分专家模块,显著降低计算量和内存需求,使得大型模型可以在手机上稳定运行。此外,开发团队还对推理引擎、异构调度和存储方案进行了联合优化,使得内存需求比行业标准减少了超过50%。
值得一提的是,该方案能够在不连接互联网的情况下完成包括邮件理解与草拟、行程规划与日历同步、航班及酒店推荐、行程分享等任务。将这些功能转移到端侧后,用户数据无需出设备,从而提高了隐私保护和减少了网络延迟的影响。 球友会
在性能方面,该模型在预填充阶段的吞吐量超过每秒330个Token,而解码吞吐量也超过每秒28个Token,这表明其在处理长提示和批量请求时的能力。虽然行业专家指出,大参数MoE模型在手机端的应用将促进延迟较低和保障隐私的智能助手的发展,但实际的规模化应用仍需考虑终端成本、功耗、模型可靠性及用户接受度等多重因素。