SummFlow 2026-06-27 Hugging Face

Qwen-AgentWorld-35B-A3B (Qwen)

语言世界模型,模拟7类agent交互环境

入选理由
Qwen-AgentWorld 35B的GGUF量化版,可本地运行世界模型模拟7种agent环境,适合研究agent仿真与低成本部署。需至少16GB显存运行量化版。
对位
对位 Qwen3.5-35B-A3B(同架构)
适合
7域agent环境状态预测 / world model研究与模拟数据生成
不适合
非通用助手,不适用直接问答
规模
35B (3B激活) · 262k
授权
Apache-2.0 · 需自查
框架
vllm / sglang / transformers / llama.cpp
血统
量化自 Qwen-AgentWorld-35B-A3B
可信度
HF 28.6k下载,67赞,AgentWorldBench 7域评测透明

社区实测

社区普遍认为 Qwen 对这款模型的定位说明不够清晰——它并非通用聊天或代码模型,而是一个用于模拟 agent 交互环境的「语言世界模型」。实测中它可以作为工具调用模型正常推理、执行 CLI 和 web 搜索,部署门槛低(Q8 约 60 tok/s),但在复杂编码任务上会出现空白输出崩溃,不应被当作代码生成器使用。整体看,它在环境模拟和 agent 训练场景下有明确价值,但作为日常助手或编程模型则定位错位。

  • 模拟 MCP、终端、SWE、Android、Web、OS 等七种 agent 交互环境,无需运行真实环境即可生成交互轨迹
  • 可通过 llama.cpp 本地部署,Q8 量化在 AMD Strix 上约 60 tok/s
  • 具备工具调用与推理能力,可执行 web 搜索和 CLI 命令
  • 在简单到中等难度的编程任务上表现稳健
  • 35B 总参数仅 3B 激活,本地部署硬件门槛较低
  • 支持 256K 上下文长度
  • Sim RL 训练效果显著优于仅用真实环境的 RL,世界模型质量是瓶颈
  • 定位模糊,官方未清晰说明其与通用聊天/指令模型的区别,导致社区困惑
  • 从专家级难度起频繁输出空白,复杂任务上崩溃
  • 不适合作为代码生成器使用
  • 非标准聊天/指令模型,不能当作通用对话助手
  • 推理过程较长

截至 2026-06-28

快速上手

ollama run hf.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF