两种本地 Agent 架构

两种本地 Agent 架构 由 Archify 生成的架构图。 Muse Spark · Meta 教师模型 · Meta 超级智能实验室 · 2026-08-10 · Apache 2.0 · 更大、闭源 Muse Spark Meta 教师模型 更大、闭源 Logit 蒸馏 · pre + mid + post · Meta 超级智能实验室 · 2026-08-10 · Apache 2.0 · 能力迁移 Logit 蒸馏 pre + mid + post 能力迁移 Muse-Glimmer 30B · dense 因果 Transformer,52 层 · Meta 超级智能实验室 · 2026-08-10 · Apache 2.0 · 29.6B,131K 上下文 Muse-Glimmer 30B dense 因果 Transformer,52 层 29.6B,131K 上下文 ViT-G/14 编码器 · 约 1.8B 参数,冻结 · Meta 超级智能实验室 · 2026-08-10 · Apache 2.0 · 独立视觉 ViT-G/14 编码器 约 1.8B 参数,冻结 独立视觉 DFlash drafter · 5 层,块长 16 · Meta 超级智能实验室 · 2026-08-10 · Apache 2.0 · 投机解码 DFlash drafter 5 层,块长 16 投机解码 Qwen3.5 · 架构基础 · 阿里 Qwen 团队 · 2026-08-14 · Apache 2.0 · 血统 Qwen3.5 架构基础 血统 Qwen3.8-27B · 原生视觉语言,64 层 · 阿里 Qwen 团队 · 2026-08-14 · Apache 2.0 · 27B,262K 上下文 Qwen3.8-27B 原生视觉语言,64 层 27B,262K 上下文 Gated DeltaNet · 线性注意力,每 4 层占 3 层 · 阿里 Qwen 团队 · 2026-08-14 · Apache 2.0 · 混合注意力 Gated DeltaNet 线性注意力,每 4 层占 3 层 混合注意力 MTP 头 · 多 token 预测 · 阿里 Qwen 团队 · 2026-08-14 · Apache 2.0 · 投机解码 MTP 头 多 token 预测 投机解码 教师输出 蒸馏进 视觉 token 提议 16 token 块 架构基础 注意力层 解码头 Meta 超级智能实验室 · 2026-08-10 · Apache 2.0 阿里 Qwen 团队 · 2026-08-14 · Apache 2.0 图例 前端 后端 数据库 云服务

压缩而来

  • • 能力来自更大教师的 logit 蒸馏
  • • 教科书式 dense Transformer:每个框架都会训
  • • 视觉是独立冻结编码器;上下文 131K+

原地生长

  • • 长在 Qwen3.5 混合架构上:Gated DeltaNet + 每 4 层一组 Gated Attention
  • • 视觉融合进 LM,含视频;262K 原生、1M 可扩展
  • • MTP 头训练进模型:投机解码是模型的一部分

交换条件

  • • 蒸馏换来最小官方配方:4-bit 不到 20GB,24/32GB 内存包络,公布 tok/s
  • • 原生生长换来更新架构和更高上限,最后一公里留给社区(HF 上 1,035 个量化版)