连 V 神也开始本地部署大模型了。
他在一台 Strix Halo 笔记本上运行 Qwen3.8-Flash-Next,并直接评价这个模型真的非常惊艳,同时称 llama.cpp 对它的支持正在快速进步。
这可能是开放权重模型和本地 AI 获得的最强 endorsement 之一。
V 神长期关注隐私、去中心化和个人自主权。如今他选择把大模型直接运行在自己的电脑上,也说明本地 AI 已经逐渐从技术爱好者的实验,变成真正可以处理日常任务的工具。
我最近也部署了同一模型。
在单张 RTX PRO 6000 96GB 上,我们运行的是 EXL3 K4.25 + FP8 PLE 版本,保留完整 256K 上下文。
实测 Prose 单路生成达到 160.7 tok/s,Prefill 达到 8000 tok/s,速度明显高于 V 神在 Strix Halo 笔记本上展示的结果。
V 神用笔记本证明了这个模型可以随身运行,我们则用 PRO 6000 展示了它作为本地 Agent 服务时的速度上限。
本地 AI 真的开始了,模型属于你,数据留在本地,速度也已经完全进入可用范围。