🧭AlexWortega / same-data-different-losses
基于Qwen3-4B(attention-only LoRA)的六种离线推理损失(SFT、RFT、DFT、RIFT、Offline GRPO、DPO)在相同数学rollouts上训练的交互式权重空间几何可视化,支持浏览36层transformer并观察几何响应。
收藏 25 · 29天前更新 详情
2026-06-23
基于Qwen3-4B(attention-only LoRA)的六种离线推理损失(SFT、RFT、DFT、RIFT、Offline GRPO、DPO)在相同数学rollouts上训练的交互式权重空间几何可视化,支持浏览36层transformer并观察几何响应。