SummFlow 2026-06-23 Hugging Face

🧭AlexWortega / same-data-different-losses

基于Qwen3-4B(attention-only LoRA)的六种离线推理损失(SFT、RFT、DFT、RIFT、Offline GRPO、DPO)在相同数学rollouts上训练的交互式权重空间几何可视化,支持浏览36层transformer并观察几何响应。

收藏 25 · 29天前更新
  • static
  • 运行中
详情