Llama 4 Scout 拆解:为什么Meta要在手机上跑千亿参数?
Scout是什么 Llama 4 Scout是Meta在2026年Q1发布的轻量化旗舰模型,定位是「能部署在边缘设备上的多模态模型」。核心参数:总参数量约109B,但采用MoE(混合专家)架构,每次推理只激活约17B参数。上下文窗口10M tokens,支持图文输入。 按Meta的说法,这个模型能在单张H100或…

Scout是什么
Llama 4 Scout是Meta在2026年Q1发布的轻量化旗舰模型,定位是「能部署在边缘设备上的多模态模型」。核心参数:总参数量约109B,但采用MoE(混合专家)架构,每次推理只激活约17B参数。上下文窗口10M tokens,支持图文输入。
按Meta的说法,这个模型能在单张H100或消费级4090上流畅运行,甚至针对移动端做了量化优化。
MoE的关键:「激活参数」才是真实算力消耗
很多人看到「109B参数」就以为这是个需要多卡才能跑的怪物。实际不是。
MoE架构的特点是「稀疏激活」——每次处理一个token,只有一部分「专家」子网络会被调用。Scout每次激活的是17B,这才是真实的推理算力需求。对比一下,Llama 3.1 70B是密集模型,每个token都要用全部70B参数。
所以Scout的实际推理成本,大约相当于一个17B的密集模型——但它的「知识容量」更接近100B级别。这就是MoE的价值。
10M上下文:能用还是说说而已?
10M tokens是个夸张的数字——相当于几百本书。但历史告诉我们,支持不等于好用。
真正的问题是:在接近上限的长度下,模型的实际召回精度是多少?从已有的第三方测试来看,Scout在约100k tokens以内的召回率比较稳定,超过500k之后开始出现明显的遗漏。这和大多数「长上下文」模型的表现曲线一致。
不过,哪怕「只能」稳定用100k,也已经够处理一个完整的中型代码库了。对很多实际场景来说,这已经足够了。
Meta的真实战略意图
Scout不是一个「跑分用的」模型,而是Meta争夺AI基础设施话语权的棋子。
几个信号:
- Scout是Apache 2.0授权,完全开源,允许商业使用
- 针对骁龙8 Gen系列和Apple Silicon做了专门的量化版本
- Meta同期发布了Llama 4 Maverick(671B,对标GPT-4o的云端版本)
逻辑很清楚:用开源策略降低企业采用门槛,用边缘部署能力卡住不想把数据传云端的客户,用Maverick吃高端API市场。这是一套完整的从设备端到云端的覆盖策略,而不是单纯在技术上内卷。
实测:在4090上跑起来是什么感觉
SFD实验室的MS01装的是Mac Studio,没有独立GPU,所以我们用MLX量化版本做了测试。Q4量化下,Scout跑中文对话的速度大约是15-20 tokens/s,对比我们之前用的Qwen 72B大概慢20%,但多模态能力强了不止一个档次。
直接的感受:图文理解准了很多。之前让Qwen分析一张架构图,它只能描述图里的文字;Scout能识别方框之间的箭头关系,输出的是实际的数据流逻辑,而不是图片的文字抄写。
值不值得现在就切换?
如果你的场景是纯文本,暂时没必要换。Scout的文本能力比Qwen 72B强,但幅度有限,而且中文表达在某些场景下还不如专门针对中文优化过的模型自然。
如果你需要多模态——图文混合输入、文档理解、视觉QA——Scout是目前开源方案里最实用的选择之一,值得认真试一试。
SFD编者注
我们已经把Scout放进了本地推理集群的备选名单。近期会做一次和Qwen3 72B的系统性对比测试,重点看中文写作质量、代码生成准确率和多模态实用度。结果出来后会写一篇详细的评测报告。