🎞️microsoft / mage-vl-demo
Mage-VL 4B编解码器原生视觉语言模型,用于视频与图像理解,通过仅保留关键帧和运动区域补丁减少75%以上视觉token。
运行中 状态观测于 2026-09-04
用途与交互
- 用途
- 模型演示与研究
- 输入
- 图像 · 视频
- 输出
- 文本
空间 / microsoft / mage-vl-demo
Mage-VL 4B编解码器原生视觉语言模型,用于视频与图像理解,通过仅保留关键帧和运动区域补丁减少75%以上视觉token。
运行中 状态观测于 2026-09-04
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索