
一、本周概览开源一周发生了什么2026 年 8 月第 4 周的开源圈只能用狂暴形容。如果只看下载量与基准分数本周有三个标志性事件Qwen3.8-27B8/1427B 稠密 多模态 262K 上下文Apache 2.0发布 48 小时内 HF 下载量破 100 万社区衍生量化版本超 500 个被誉为本地 Opus 4.6。DeepSeek-V4-Pro-08138/13 GA权重 8/121.7T MoE DSpark 推测解码 1M 上下文 MIT 许可证Artificial Analysis 智能指数从 45 跃升至 53首次在 Terminal-Bench 上以 87.9 反超 Opus 4.8 的 85.0。MiniMax-H38/3 但热度延续至今33B 单流 omni-transformer原生视频 立体声联合生成ComfyUI 发布当天原生集成squeeze profile 跑通 8GB 显存。与此同时Qwen3.8-Max2.4T MoE、Kimi K32.8T MoE、GLM-5.2智能指数 52.6和 Meta Muse GlimmerApache 2.0 的本地 Agent 30B也持续在 Trending 榜厮杀。本文按消费级可跑 → 数据中心旗舰分层梳理本周值得关注的 6 款模型。二、六大模型速览模型发布方参数 / 激活许可证上下文智能指数本周关注点Qwen3.8-27B阿里千问27B DenseApache 2.0262K52.0消费级显卡本地 AgentDeepSeek-V4-Pro-0813DeepSeek1.7T / 49B MoEMIT1M53.2MIT 反超 Opus 4.8Qwen3.8-Max阿里千问2.4T / 95B MoEModified MIT1M57.7史上最大开源权重MiniMax-H3MiniMax33B Dense开放权重视频 15s—原生音视频联合生成GLM-5.2智谱 Z.ai745B / 400B MoEMIT1M52.6智能指数/价格比最高Kimi-K3月之暗面2.8T / 104B MoE自定义*1M59.7智能指数周榜冠军*Kimi K3 许可证非 MIT采用自定义协议。月活 1 亿或年营收 2000 万美元的产品需在 UI 展示模型名。数据来源Artificial Analysis 智能指数2026-08 实时Hugging Face 模型卡modelgrep.com 周榜。Qwen3.8-27B 与 DeepSeek-V4-Pro-0813 已在本专栏前几日文章中详细测评本文聚焦横向决策。三、横向测评六维能力雷达为统一对比口径下表数据均来自第三方独立评测与厂商官方发布的统一 Harness 复跑结果评测维度Qwen3.8-27BDeepSeek-V4-ProQwen3.8-MaxMiniMax-H3GLM-5.2Kimi-K3SWE-bench Pro61.7%53.4%67.7%—60.2%64.5%Terminal-Bench 2.173.087.980.0—81.088.3DeepSWE 1.142.262.751.0—46.267.5LiveCodeBench90.3%89.6%——93.5%—HLE带工具—60.0%——54.7%56.0%本地 24GB 可跑✅❌需数据中心❌✅量化❌❌关键解读代码 AgentDeepSeek-V4-Pro 以 Terminal-Bench 87.9 / DeepSWE 62.7 首次在开源可下载前提下追平甚至反超 Opus 4.885.0 / 58.0。27B 的 Qwen3.8 在 SWE-bench Pro 上反而更优61.7 vs 53.4——再一次印证 27B 紧凑尺寸在 Agent 任务上的性价比拐点。多模态Qwen3.8-27B 是 6 款中唯一原生支持图像视频输入且可在 24GB 显卡运行的模型MiniMax-H3 独占视频输出赛道。价格 / 智能比DeepSeek-V4-Pro 输入 $1.32/M 输出 $3.96/M对比 Opus 4.8$5/$25约为 1/6 成本。GLM-5.2 的 $0.966/M 输入价 52.6 智能指数是独立验证维度的性价比之王。本地部署友好度本周末档仅 Qwen3.8-27B 与 MiniMax-H3 可在消费级硬件运行。其余 4 款均需 8×H100 / 4×H200 起步。数据来源Artificial Analysis、DeepSeek 官方 Harness、阿里千问官方发布、Z.ai 博客、Kimi 官方发布2026-08 截至。四、部署实战本周两款最值得部署的模型4.1 Qwen3.8-27B24GB 显卡首选完整的部署细节见 2026-08-22 期《Qwen3.8-27B 量化部署实测》下方给出最常用的 vLLM 启动 调用片段bash# 环境准备 conda create -n qwen38 python3.10 -y conda activate qwen38 pip install vllm transformers accelerate huggingface-cli download Qwen/Qwen3.8-27B-FP8python# vLLM 启动FP8 版本48GB 显卡可全速跑 # 命令行 # vllm serve Qwen/Qwen3.8-27B-FP8 \ # --served-model-name qwen3.8-27b \ # --tensor-parallel-size 1 \ # --max-model-len 32768 \ # --enable-auto-tool-choice \ # --reasoning-parser qwen3 \ # --port 8000 # 24GB 显卡改用 INT4 GPTQ 版本 # huggingface-cli download Qwen/Qwen3.8-27B-GPTQ-Int4 from openai import OpenAI client OpenAI(base_urlhttp://localhost:8000/v1, api_keyEMPTY) resp client.chat.completions.create( modelqwen3.8-27b, messages[{role: user, content: 解释 Transformer 中 GQA 与 MQA 的区别}], extra_body{reasoning_effort: medium}, max_tokens2048, ) print(resp.choices[0].message.content) print(f输出 {resp.usage.completion_tokens} tokens)4.2 DeepSeek-V4-Pro-0813数据中心旗舰 推测解码DeepSeek-V4-Pro 的部署关键是启用 DSpark 推测解码吞吐量提升约 2.3–2.7 倍bash# 数据中心部署4×GB300 节点为官方推荐配置 pip install vllm0.20.0 # 或更新版本需支持 DSpark huggingface-cli download deepseek-ai/DeepSeek-V4-Pro-0813 # vLLM 启动4×GB300 FP4 DSpark 推测解码 vllm serve deepseek-ai/DeepSeek-V4-Pro-0813 \ --tensor-parallel-size 4 \ --quantization mxfp4 \ --speculative-model deepseek-ai/DeepSeek-V4-Pro-0813 \ --speculative-method dspark \ --num-speculative-tokens 5 \ --max-model-len 1048576 \ --port 8000python# 三档推理深度控制low / high / max from openai import OpenAI client OpenAI( api_keysk-xxx, base_urlhttps://api.deepseek.com/v1 ) # 日常 agent 任务用 highDeepSeek 推荐档位 resp client.chat.completions.create( modeldeepseek-v4-pro, messages[{role: user, content: 重构这个 Python 类...}], reasoning_efforthigh, max_tokens4096, ) print(resp.choices[0].message.content)关键提醒DeepSeek-V4-Pro-0813 自 8 月 16 日 16:00 UTC 起执行新价格peak $1.32/$3.96off-peak $0.66/$1.98。如用旧 SDK注意 cache-hit 价格提升 6 倍以上。4.3 消费级显存快查表显存可流畅运行的模型推荐部署栈8–12GBMiniMax-H3 squeeze profile、Qwen3.8-27B IQ2_XXSComfyUI / llama.cpp16GBQwen3.8-27B Q3_K_MOllama / llama.cpp24GBQwen3.8-27B Q4_K_M / Q5_K_M、MiniMax-H3 balancedvLLM / llama.cpp48GBQwen3.8-27B FP8、DeepSeek-V4-Flash-0731 INT4vLLM80GB × 8DeepSeek-V4-Pro-0813、Qwen3.8-MaxvLLM 张量并行140GB × 4MiniMax-H3 lossless 全常驻SGLang Ulysses五、选型决策一张表选对你的开源模型按用得上 跑得起两条硬约束把读者最常见的 5 类场景压缩成决策表你的场景首选次选关键参数本地编程助手 / Claude Code 替代Qwen3.8-27BApache 2.0DeepSeek V4-Flash-0731MIT48GBINT4 24GB vLLM长周期 Agent / 自主研发DeepSeek-V4-Pro-0813MITQwen3.8-MaxModified MITDSpark data center消费级本地视频/音视频生成MiniMax-H3—ComfyUI INT8中文长文档分析 / 100 万字上下文Qwen3.8-Max / Kimi K3DeepSeek-V4-Pro1M context 32K 显存/层隐私敏感企业内部 AgentQwen3.8-27BApache 2.0GLM-5.2MIT国产合规私有化部署 微调策略建议预算无上限、要 frontierDSpark 启用的 DeepSeek-V4-Pro-0813MIT 协议商用零障碍。单张 4090 / 5090 起步Qwen3.8-27B INT4/Squeeze profile 是唯一甜点。要视频 音轨联合输出MiniMax-H3 是当前唯一开源方案ComfyUI 路线最稳。要 Apache 2.0 长上下文Qwen 家族独占仅 Qwen3.8-27B 与 Qwen3.6-35B-A3B 满足。要中文 价格敏感GLM-5.2 输入 $0.966/M 52.6 智能指数独立验证维度的中国版性价比之王。六、本周趋势观察与下周展望6.1 三个值得留意的趋势MIT 许可证成新默认本周发布的 DeepSeek-V4-Pro-0813、Muse Glimmer、GLM-5.2 全部采用 MIT 或 Apache 2.0仅 Kimi K3 保留自定义许可。宽松协议从差异化卖点变成准入门槛。推测解码下沉到旗舰DSpark 内置到模型权重中意味着无需训练 draft model 即可启用推测解码吞吐量提升 2–3 倍。Agent Harness 开源化DeepSeek V4-Pro Harness v0.1 同 MIT 开源宣告模型 运行环境 评测框架三位一体的开源策略进入主流。6.2 下周展望日期计划主题预期看点8/24周一通用大模型GLM-5.3 深度评测智谱 Z.ai 8 月新版本预测8/25周二多模态Muse Spark 1.2 开源版Meta 旗舰 LLM 首次开源8/26周三推理优化工具DSpark 工程实践DeepSeek 推测解码全链路8/27周四领域专用Code专用模型横评Qwen3.8-Coder / DeepSeek-Coder8/28周五新发布周末前 24h 速报Trending Top 108/29周六量化方案NVFP4 实战RTX 5090 / Blackwell 路径七、互动话题本周你下载了哪款开源大模型Qwen3.8-27B、DeepSeek-V4-Pro 还是 MiniMax-H3欢迎在评论区聊聊你的硬件配置 跑分结果我们一起拼一张消费级显卡大模型跑分图下篇预告明日周一将发布《GLM-5.3 通用大模型深度评测》敬请关注。数据声明本文性能数据来源标注如下——智能指数来自 Artificial Analysis2026-08 实时榜DeepSeek-V4-Pro 基准来自 DeepSeek Harness v0.1 官方统一评测Qwen3.8-27B 基准来自千问官方发布Claude Code HarnessMiniMax-H3 部署数据来自 ComfyUI 社区实测已多源交叉验证。价格数据来自各厂商官方价目表截至 2026-08-23。未经标注实测的数据均为引用仅供参考。