AI 情报 · 每日更新
提出 MARS,一个面向推理时模态缺失的混合专家(MoE)框架。核心思路是用完整模态与缺失模态的表示残差作为特权信号,训练残差路由器将样本分配给擅长对应偏差模式的专家;推理时通过一个特征路由器模仿残差路由器的行为,无需完整模态即可部署。配合 discrepancy-aware 噪声正则化缩小训练-推理路由差距,以及 discrepancy-guided 采样动态关注路由分歧大的模态组合。在活体检测(CASIA-SURF)、材料分割(MCubeS)、情绪识别(CREMA-D)、食物分类(UPMC Food-101)四个跨模态任务上一致超越已有方法。适合任何推理时可能丢模态的多模态系统——人脸识别、自动驾驶感知、医疗影像——可作为分类/分割头前的即插即用层,训练需完整模态,部署时容缺失。
CASIA-SURF 活体检测:7 种模态组合平均 ACER 2.43,比最强基线 DMRNet(3.58)降低 1.15 个百分点;IR 单模态下 ACER 3.96,DMRNet 为 8.98,错误率降幅过半。ResNet-18 骨干,统一设置(Table 1)。 MCubeS 材料分割:8 种 RGB 组合平均 mIoU 0.4773,优于 DMRNet(0.4683)和 DeepLab v3+ 原版(0.4257)。DeepLab v3+ 骨干,20 类像素级标注(Table 2)。 CREMA-D 情绪识别:三模态组合平均准确率 65.52,DMRNet 为 61.35;全模态下准确率 76.10 vs 70.10(Table 3)。 UPMC Food-101 分类:三模态组合平均准确率 91.59,SimMLM 为 84.81;图像单模态准确率 91.86,SimMLM 为 72.20(Table 4)。 Oracle 路由(测试时也提供完整模态给残差路由器)在 CASIA-SURF 上达到 ACER 0.94,验证了专家已充分学到模态缺失偏差模式(Table 5 消融)。 Cisco 提出的三层架构,把多 agent 系统的开发拆成声明式规约(Spec)、合约驱动的运行时(MAS-OS)和可复现实验环境(Labs)三层,让 agent 逻辑、治理策略、基础设施彼此解耦。核心机制是用有限 Mealy 机组合做 per-agent 内核,所有外部交互(工具调用、LLM 请求、agent 间委托)必须过 governance → record → execute → record 的合约边界,治理决策(预算控制、内容过滤、人工审批)先于执行生效且全程可追溯。同一份 YAML 规约只需改 overlay 就能比较不同推理模式、拓扑结构、上下文来源的效果——从原型到生产的生命周期保持一致。适用场景:需要把多 agent 系统从 demo 推进到生产级部署的团队,特别是治理合规、可观测性和实验复现性有硬性要求的场景,可替代现有 ad-hoc 脚本式的 MAS 开发流程。
Lab 1(100 条推理数据集 + 行程规划任务):Plan-and-Execute 模式文本质量 AR=0.999 但目标成功率 GSR=0.030,两者解耦——只靠单一指标会漏掉这种 dissociation。数据量和领域不同时数值不可直接外推。 Lab 2:全套治理插件(可观测 + 预算上限 + 内容过滤 + 熔断器)合计仅占单次查询时间的 0.12%,单次检查耗时稳定在 ~1.4ms。6 条正常查询零干预,执行轨迹与基线完全一致;注入故障查询时内容过滤拦截目标工具调用,3/4 agent 轨迹不受影响。 Lab 3(100 条个人事实 + 10 条查询的 smoke run,n=1):多事实查询 k3_q06 上 RAG-decomposed 召回率 R=1.0,RAG-direct 和 RAG-wide 仅 R=0.67——单次联合查询会把第三条事实挤出 top-K;跨域双事实查询 k2_q06 上 RAG-direct 和 RAG-wide 召回率均为 0.0,RAG-decomposed 恢复到 0.5。Letta-core 全量注入作为上界 R=1.0(精度为代价)。 ANTAP 是一种评估驱动的多智能体路由架构,用几何投影替代文本描述来选 agent。离线阶段在每个候选 agent 上跑可信 benchmark,把成功/失败二值信号拟合成固定线性算子;在线路由仅做单次矩阵-向量乘 W*z,完全不接触 agent 的文本描述,从结构上切断 description-based prompt injection 的攻击面——恶意 agent 的描述里嵌入再巧妙的指令也影响不了路由决策。同时,离线 benchmark 中包含含 trigger 的查询,sleep agent 在 calibration 时触发后门会被标为失败,其算子自动学到安全子空间的负关联。适合接入 AutoGen/CrewAI 等现有多智能体框架,替换基于 LLM 读描述的 router,在需要对抗恶意 agent 注册或供应链投毒的安全敏感场景中消除整个攻击面。
描述注入攻击:ANTAP 在 MMLU 上 ASR 0.2%(95% CI ±0.2),AutoGen 为 75.3%(±2.2);BBH 上 ASR 0.4%(±0.3),AutoGen 为 67.3%(±2.5)。Table 1,Description 行。 Sleeper agent 后门攻击(数据投毒):Sleeper 变体在 MMLU 上 ANTAP ASR 0.9%(±0.6),AutoGen 为 73.5%(±3.3);BadNet 变体 ANTAP ASR 2.4%(±1.1),AutoGen 为 73.2%(±3.3)。Table 1,Sleeper/BadNet 行。ASR 仅统计含 trigger 的查询。 自适应 embedding 攻击:ANTAP 的 ASR 比 EmbedLLM 基线低约 20%(绝对值),且不受描述操纵影响。摘要与 Section 4.4。 路由延迟:ANTAP 在线路由约 27ms(含 embedding),AutoGen 约 428ms,在 5-agent 异构配置下。Table 2,Default Config. 行。 从单张图片或一句话生成完整可交互铰接 3D 物体的 zero-shot 管线,输出包含零件网格、关节参数、运动学树和被遮挡内部几何的 URDF。核心是用三个分层 agent(Decomposer/Grounder/Articulator)进行两轮结构化辩论——第一轮利用全局-局部视角分歧修正关节参数,第二轮用冻结的 WAN-VACE 视频先验作为外部运动证据——全程不需要任何铰接标注数据。确定关节后,再用关节条件化的视频驱动零件运动,通过 3D 隐空间 inpainting 暴露并重建被遮挡的内部结构。适合 embodied AI、机器人仿真、VR 场景中需要从单张照片快速产出可交互资产的场景,替代逐物体多视角采集或模板库检索。
Objaverse-OOD(10 类:直升机、机械臂、人形等):轴误差 25.5°,对比 FreeArt3D 85.0°、Articulate-Anything 67.0°;关节类型准确率 64.2%。FreeArt3D 获得了来自本方法视频合成步骤的多状态输入,属有利条件而非降级回退。 PartNet-Mobility(7 类、77 物体):关节类型准确率 77.5%,为所有方法中最高——包括有监督的 Singapo(50.6%)和 PhysX-Anything(34.7%),这两个基线在 PartNet-Mobility 上训练,属其域内设定。轴误差 8.0°。 Objaverse-Household(12 类、53 物体):轴误差 17.3°,对比 FreeArt3D 25.0°;轴心误差 0.17,对比 FreeArt3D 0.34。 消融(PartNet-Mobility):用关节条件化视频 + 3D 隐空间 inpainting 重建内部几何,rest-state Chamfer 距离 0.03,对比 probe video + SegViGen 表面分割的 0.06。 扩展 Horizon 而非参数量:35B Agent 达到万亿参数级性能
上海 AI 实验室基于 Qwen3.5-35B-A3B 基座,通过三阶段训练(全领域 SFT → 各领域教师模型专项 RL → 多教师 on-policy 蒸馏)做出 35B MoE agent 模型,在长 horizon agent 任务上匹敌甚至超过 Kimi-K2.6、DeepSeek-V4-Pro 等 1T 级模型。核心思路不是堆参数而是堆「agent horizon」:构建 Knowledge-Action Graph 基础设施产出平均 45K token 的 agentic 轨迹,再通过领域路由 + 显著词汇对齐的 on-policy 蒸馏把六个异构领域(搜索、ML 工程、科研推理、指令遵循、工具调用、通用 agent)能力统一到一个可部署模型里。适用场景:需要工具调用、长上下文推理、多步科学/工程问题求解的 agent 系统,可作为 1T 级模型在长 horizon agent 任务上的轻量替代。
SEAL-0 56.4,超过 Kimi-K2.6 (50.5) 和 DeepSeek-V4-Pro (55.0);GAIA 96.0,接近 DeepSeek-V4-Pro (98.1) IFBench 80.6,超过 GPT-5.5 (75.9) 和 DeepSeek-V4-Pro (73.5);IFEval 94.8 HiPhO 46.4,超过全部 >1T 基线(GPT-5.5 43.3 / Kimi-K2.6 41.1);FrontierScience-Olympiad 79.0 vs GPT-5.5 78.0;FrontierScience-Research 40.0,超过 GPT-5.5 (26.7) 一倍以上 BrowseComp 75.5,XBench-DS-2510 86.0,均领先所有同量级 35B 模型 SciCode 44.3 领先同量级模型,但显著低于 GPT-5.5 (56.1);MLE-Bench-Lite 43.9% 奖牌率,低于 GPT-5.5 (72.7%) 用诊断条件化的 Neural ODE 对每个历史观测事件独立建模连续轨迹,再用目标时间与模态条件化的注意力加权聚合,绕开了传统序列模型把多模态历史压进单一隐状态的瓶颈。在 ADNI 数据集上预测三种 PET 生物标志物(FDG/TAU/AMY)的演化,多模态设定下全面优于 RNN、Transformer、Neural ODE、Mamba 等 7 个基线。通过将多条 ODE 轨迹并行求解,训练每 epoch 耗时从 25.66s 降到 10.47s。适合不规则采样的多模态时序预测场景——比如电子病历、工业传感器、金融风控——可直接替代现有序列模型,同时保留事件级的可解释性。
多模态设定下 FDG 预测 RMSE 0.0760,比最强基线 Mamba(0.0959)低 19.2%;R² 0.8802(Mamba 0.8091)。5 次独立运行均值,ADNI 数据集。 TAU 预测 RMSE 0.1397,Mamba 为 0.2016,降幅 30.7%;R² 从 0.6752 提升到 0.8442。TAU 观测仅占全部记录的 8.9%,注意力机制在稀疏模态上收益最大。 AMY 预测 RMSE 0.1781,最强基线 Transformer 为 0.1995,降幅 10.7%;R² 0.7964 vs 0.7444。 并行 ODE 求解(Eq.4)将每 epoch 训练时间从 25.66s 压缩到 10.47s,降幅 59.2%。 提出 Reference Sliding Window Attention (R-SWA),一种面向长序列解析任务的注意力机制:每个 token 关注全部视觉/参考 token + 最近 128 个输出 token,使 KV cache 在解码全程保持恒定,不再随输出长度线性增长。以 DeepSeek OCR 为基线,将其 decoder 中所有 attention 层替换为 R-SWA 后,单次前向即可解析数十页文档(32K 上下文内),且推理速度不随输出长度衰减。R-SWA 是通用解析注意力,除 OCR 外同样适用于 ASR、翻译等需要长程参考建模的任务。代码与模型权重已开源(GitHub 10.7k stars,HF 21 万下载)。
OmniDocBench v1.5 综合得分 93.23%,比 DeepSeek OCR 基线(87.01%)高 6.22 个百分点;v1.6 综合得分 93.92%,与同期 SOTA 持平。 OmniDocBench v1.5 上文本编辑距离 0.038(基线 0.073),表格 TEDS 90.93%(基线 84.97%),阅读顺序编辑距离 0.045(基线 0.086)。 512 并发下 TPS 5580,比 DeepSeek OCR(4951)高 12.7%;输出 6000 token 时领先 35%,且 TPS 不随输出长度衰减。 长程 OCR 测试:一次输入 40+ 页,编辑距离 0.1069,Distinct-35 仍保持 96.90%。 用表征自编码器替代 VAE 的扩散 Transformer
用冻结的预训练表征编码器(DINOv2、SigLIP、MAE)替代传统 VAE 编码器,配一个可训练的 ViT 解码器,构成 Representation Autoencoder(RAE)。RAE 的潜在空间语义更丰富、维度更高,但标准 DiT 无法直接在上面训练——作者提出三个修复:让 DiT 宽度匹配 token 维度、按有效数据维度调整噪声调度、在解码器训练时加噪声增强以容忍扩散输出的分布偏移。此外引入 DiTDH(一个浅而宽的扩散头),在不增加二次计算开销的前提下扩展模型宽度。工程上可以直接把 RAE 当作 SD-VAE 的替代品接入现有 DiT 训练管线,预训练编码器(DINOv2 等)是现成的,只需额外训练一个轻量解码器。
ImageNet 256×256 无条件生成 FID 1.51(DiTDH-XL + DINOv2-B,800 epochs) ImageNet 256×256 带 AutoGuidance FID 1.13(DiTDH-XL + DINOv2-B,800 epochs) ImageNet 512×512 带 AutoGuidance FID 1.13(DiTDH-XL + DINOv2-B,400 epochs) 相比 SiT-XL(VAE 潜在空间)训练收敛加速约 47×,相比 REPA-XL 加速约 16×(以同等 FID 所需计算量计) RAE 重建质量 rFID:DINOv2-B 0.49、MAE-B 0.16,均优于 SD-VAE 的 0.62(ImageNet 验证集) 作者指出 FID 评估中 class-balanced sampling 比 uniform random sampling 低约 0.1,已对 REPA、SiT 等基线重新评估并更新数字