模型 / FastContext-1.0-4B-SFT (Microsoft)

FastContext-1.0-4B-SFT (Microsoft)

轻量仓库探索子代理,供编码代理按需调用,减少 token 消耗

作者
microsoft
对位
对位 Qwen3-4B 作为编码子代理
适合
辅助编码代理定位仓库相关代码 / 降低主代理 token 消耗
不适合
独立对话或直接生成代码
入选理由
这个模型可让代码代理高效定位代码文件,减少token消耗,适合需要自动代码修复或仓库探索的开发者。使用需部署SGLang服务。
规模
4B · 262k · 最低 ~2.4GB · 4-bit(估算)
授权
MIT · 可商用
框架
transformers / sglang
工具调用
Qwen 风格工具调用 (READ/GLOB/GREP)
血统
微调自 Qwen3-4B-Instruct-2507
国内访问
需代理
可信度
集成后 SWE-bench Multilingual 73.3 (↑1.6), token 降 20.4%

社区实测

FastContext被社区视为一个实用的开源仓库探索子代理,基于Qwen3-4B,核心卖点是本地部署零API费用,通过将仓库搜索从主代理剥离来大幅降低token消耗;但实际编码能力提升有限,更像一个降本增效的辅助组件而非独立编码工具。

  • 降低主编码代理的token消耗(最高60%),直接减少API账单
  • 将仓库探索与任务求解分离,避免搜索痕迹污染主代理上下文
  • 本地部署无需API密钥和月费,完全自托管
  • 基于Qwen3-4B-Instruct,4B参数轻量可本地运行
  • 支持Transformers、vLLM、SGLang、Docker Model Runner多种推理方式
  • INT4量化后仅需约2.2GB VRAM,消费级GPU即可部署
  • 返回紧凑的文件路径和行范围,减少无关代码干扰
  • 开源(MIT协议?),可自由修改和集成到自有编码代理流程中
  • 端到端解决率提升仅最高5.5%,并非颠覆性改进
  • 仅支持只读工具(READ/GLOB/GREP),不能写代码或修改文件
  • FP16推理仍需约8.8GB VRAM,低配GPU需量化才能运行
  • 必须配合主编码代理使用,不能独立完成编码任务
  • 目前仅验证在Mini-SWE-Agent框架下的效果,其他代理框架兼容性未知
  • RL版本(4B-RL)也已发布但社区讨论极少,实际效果待验证
  • 模型族跨度4B-30B,但社区关注几乎全集中在4B版本,大版本缺乏实测

截至 2026-06-21

本形态 ~2.4GB 4-bit · 国内 需代理 · 13 下载

快速上手

python3 -m sglang.launch_server --model-path microsoft/FastContext-1.0-4B-SFT --tool-call-parser qwen --context-length 262144 --trust-remote-code --dtype bfloat16 --tp-size 1

本形态源 ↗

下载动量

观测时间线

模型家族

查看全部家族 →