greghavens / kimi-k3-coding-and-debugging-traces
Kimi K3模型在真实仓库中完成编码与调试的轨迹数据。
仓库许可不等于数据内容权利已全部清理,商用仍需核对数据来源、隐私与版权条款。
项目资料与外部反馈
该数据集仅含 3 条汇编编码任务的 Kimi K3 推理轨迹,规模极小且领域极度狭窄,轨迹本身带有大量回溯噪声与已知的幻觉内容,实用价值有限。
- 提供真实模型在汇编编码任务上的完整推理轨迹,可用于研究推理过程中的回溯行为或 token 效率
- 轨迹包含大量自我质疑与回溯噪声(如反复出现"Wait, actually..."),信号质量较低,用于训练或评估时需额外清洗
- 底层模型 Kimi K3 存在事实性幻觉,推理内容中曾出现"Claude says this..."等跨模型混淆表述,可能污染轨迹中的推理逻辑
- 数据集仅包含 3 条任务,且全部为 x86-64 汇编编码,领域覆盖极窄,无法泛化到其他编程语言或任务类型
- Kimi K3 的基准评测方法存在争议——官方评测表混合了不同工具和 agent 的结果,且模型对保留的思考历史敏感,基于该数据集做评测需谨慎对待方法论差异
来源
I tried Kimi K3 on a task I've done with every other model I use regularly (http... | Hacker NewsUmmm just tried kimi k3 and, it is performing way worse than 2.6?greghavens/kimi-k3-coding-and-debugging-traces · Datasets at Hugging FaceKimi K3 Benchmarks Explained: A Coding-Agent ...
截至 2026-07-22