模型 / FastContext-1.0-4B-SFT (Microsoft)

FastContext-1.0-4B-SFT (Microsoft)

轻量仓库探索子代理,供编码代理按需调用,减少 token 消耗

作者 microsoft

仓库标识microsoft/FastContext-1.0-4B-SFT

显存未知许可 可商用任务 文本生成最近核对 2026-08-05
运行内存
权重格式未知,无法估算显存
运行时
PYTHON3
下载
13

Hugging Face 源仓库 ↗

快速上手示例

python3 -m sglang.launch_server --model-path microsoft/FastContext-1.0-4B-SFT --tool-call-parser qwen --context-length 262144 --trust-remote-code --dtype bfloat16 --tp-size 1

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
这个模型可让代码代理高效定位代码文件,减少token消耗,适合需要自动代码修复或仓库探索的开发者。使用需部署SGLang服务。
对位
对位 Qwen3-4B 作为编码子代理
适合
辅助编码代理定位仓库相关代码 / 降低主代理 token 消耗
不适合
独立对话或直接生成代码

独立证据与社区反馈

7 个独立来源 · 另 2 官方/转载最近验证 2026-08-05

FastContext 是一个 4B 参数的仓库探索子模型,通过分离仓库探索与任务求解来降低编码代理的 token 消耗,最高可节省 60.3% 的 token;社区实测发现它确实能节省大量 token 并提升部分基准的端到端准确率,但检索准确性不稳定,有时会返回不存在的文件路径;此外微软已删除原始模型仓库,仅靠社区镜像维持可用。

  • 大幅降低主编码模型的 token 消耗,最高可达 60.3%
  • 提升多个主模型在 SWE-bench Pro、SWE-bench Multilingual、SWE-QA 等基准上的端到端准确率
  • 4B 参数量的轻量模型可在本地运行,有 GGUF 量化版本可用
  • 将仓库探索与任务求解分离,减少大模型在文件读取和搜索上浪费的工具调用与上下文
  • 4B-RL 版本在部分基准上可超越 30B-SFT 版本
  • MIT 许可证开源,社区可自由分发与二次开发
  • 微软已删除原始模型仓库及 GitHub 页面,官方分发渠道已不可用
  • 检索结果存在准确性缺陷,社区实测中出现返回不存在文件路径的情况
  • 社区反馈综合体验不佳,有用户直接评价为'trash'
  • 论文自述部分基准任务可能与预训练数据有重叠,结果需谨慎解读
  • vLLM 部署时需使用 hermes 解析器,不能直接使用通用 OpenAI tools schema
  • 模型使用 tie_word_embeddings=true,lm_head 权重可能与常规 checkpoint 结构不同
  • NVFP4 格式的 KV cache 在主流部署栈上不可用,需使用 fp8 KV

可信度集成后 SWE-bench Multilingual 73.3 (↑1.6), token 降 20.4%

完整规格

规模
4B · 262k · 权重格式未知,无法估算显存
授权
MIT · 可商用
框架
transformers / sglang
工具调用
Qwen 风格工具调用 (READ/GLOB/GREP)
血统
微调自 Qwen3-4B-Instruct-2507
访问提示
Hugging Face 可能需要代理

下载动量

观测时间线

模型家族

查看全部家族 →