FastContext-1.0-4B-SFT (Microsoft)
轻量仓库探索子代理,供编码代理按需调用,减少 token 消耗
社区实测
FastContext被社区视为一个实用的开源仓库探索子代理,基于Qwen3-4B,核心卖点是本地部署零API费用,通过将仓库搜索从主代理剥离来大幅降低token消耗;但实际编码能力提升有限,更像一个降本增效的辅助组件而非独立编码工具。
- 降低主编码代理的token消耗(最高60%),直接减少API账单
- 将仓库探索与任务求解分离,避免搜索痕迹污染主代理上下文
- 本地部署无需API密钥和月费,完全自托管
- 基于Qwen3-4B-Instruct,4B参数轻量可本地运行
- 支持Transformers、vLLM、SGLang、Docker Model Runner多种推理方式
- INT4量化后仅需约2.2GB VRAM,消费级GPU即可部署
- 返回紧凑的文件路径和行范围,减少无关代码干扰
- 开源(MIT协议?),可自由修改和集成到自有编码代理流程中
- 端到端解决率提升仅最高5.5%,并非颠覆性改进
- 仅支持只读工具(READ/GLOB/GREP),不能写代码或修改文件
- FP16推理仍需约8.8GB VRAM,低配GPU需量化才能运行
- 必须配合主编码代理使用,不能独立完成编码任务
- 目前仅验证在Mini-SWE-Agent框架下的效果,其他代理框架兼容性未知
- RL版本(4B-RL)也已发布但社区讨论极少,实际效果待验证
- 模型族跨度4B-30B,但社区关注几乎全集中在4B版本,大版本缺乏实测
来源
microsoft/FastContext-1.0-4B-SFT - Hugging FaceMitko Vasilev's Post - LinkedInComment "SCOUT" and I'll DM you the repo Run this AI tool for ...FastContext: Training Efficient Repository Explorer for Coding AgentsFastContext-1.0-4B-SFT GPU Requirements: VRAM & Cheapest GPUFastContext: Training Efficient Repository Explorer for Coding Agentsmicrosoft/FastContext-1.0-4B-RL - Hugging Face
截至 2026-06-21
快速上手
python3 -m sglang.launch_server --model-path microsoft/FastContext-1.0-4B-SFT --tool-call-parser qwen --context-length 262144 --trust-remote-code --dtype bfloat16 --tp-size 1