SummFlow 2026-06-25 Hugging Face

Qwen-AgentWorld-35B-A3B (Qwen)

语言世界模型,模拟7种智能体交互环境

入选理由
Qwen-AgentWorld 是世界模型,可模拟 MCP/搜索/终端/软件工程/安卓/网页/OS 七种 agent 环境,适合研究 agent 仿真,需4卡部署。
对位
对位 Qwen3.5-35B-A3B (基座)
适合
智能体环境状态预测 / 多域交互轨迹仿真
不适合
通用对话或实际命令执行
规模
35B (3B激活) · 262k · Q4 ~23GB / FP16 ~83GB
授权
Apache-2.0 · 需自查
框架
transformers / vllm / sglang
血统
微调自 Qwen3.5-35B-A3B-Base
可信度
模型权重与评测框架全部开源,三阶段训练流程透明

仅 safetensors · 无 pickle 加载风险

社区实测

社区普遍认为这是一个定位特殊的语言世界模型,核心价值在于模拟 agent 环境而非充当通用聊天或编程模型。Qwen 官方对模型定位的说明不够清晰,导致不少用户一开始误以为是常规 agent 模型,实际体验后发现它能跑通用任务但真正用途是环境仿真。

  • 以仅 3B 激活参数模拟 MCP、Search、Terminal、SWE、Android、Web、OS 七类 agent 环境,无需运行真实工具即可生成交互轨迹
  • 可通过 llama.cpp 本地部署,Q8 量化在 AMD Strix 机器上解码速度约 60 tok/s
  • 支持 256K 上下文窗口,适合长交互历史的模拟
  • 具备标准 tool calling 和 function calling 能力,可执行网页搜索、CLI 命令等操作
  • 可用于 agent 训练的模拟 RL,避免真实环境成本,且世界模型质量是模拟 RL 效果的瓶颈
  • 在 easy 到 hard 级别的 bug 修复任务上表现稳定,超过半数能正确处理
  • 单一模型统一覆盖七个 agent 交互域,无需为不同环境切换模型
  • 可通过 vLLM、SGLang、Docker 等多种方式部署,支持 NVIDIA DGX Spark 等硬件
  • 不适合作为代码生成器使用,官方定位是世界模型而非编程模型
  • 在 expert 级别复杂任务上频繁输出空白,超过一定难度阈值后直接"沉默"
  • Qwen 团队对模型定位的解释不够清晰,社区普遍反映没看懂这模型到底是干什么的
  • 推理过程较长,CoT 链式思考耗时较多
  • 不是标准 chat/instruction 模型,不能当作常规对话模型使用
  • 复杂任务上会崩溃而不产出结果,从 expert 级别开始出现大量空输出

截至 2026-06-28

快速上手

vllm serve Qwen/Qwen-AgentWorld-35B-A3B --max-model-len 262144 --reasoning-parser qwen3 --trust-remote-code