论文

可落地的 AI 研究 · 人工策展 · 共 8 篇

Residual-Guided Expert Specialization for Incomplete Multimodal Learning

  • 2026-06-29
  • 多模态
  • mixture-of-experts
  • 推理优化
  • 训练方法

提出 MARS,一个面向推理时模态缺失的混合专家(MoE)框架。核心思路是用完整模态与缺失模态的表示残差作为特权信号,训练残差路由器将样本分配给擅长对应偏差模式的专家;推理时通过一个特征路由器模仿残差路由器的行为,无需完整模态即可部署。配合 discrepancy-aware 噪声正则化缩小训练-推理路由差距,以及 discrepancy-guided 采样动态关注路由分歧大的模态组合。在活体检测(CASIA-SURF)、材料分割(MCubeS)、情绪识别(CREMA-D)、食物分类(UPMC Food-101)四个跨模态任务上一致超越已有方法。适合任何推理时可能丢模态的多模态系统——人脸识别、自动驾驶感知、医疗影像——可作为分类/分割头前的即插即用层,训练需完整模态,部署时容缺失。

MAS-Lab: A Specification-Driven Validation Framework for Reliable Multi-Agent Systems

  • 2026-06-29
  • agent
  • benchmark

Cisco 提出的三层架构,把多 agent 系统的开发拆成声明式规约(Spec)、合约驱动的运行时(MAS-OS)和可复现实验环境(Labs)三层,让 agent 逻辑、治理策略、基础设施彼此解耦。核心机制是用有限 Mealy 机组合做 per-agent 内核,所有外部交互(工具调用、LLM 请求、agent 间委托)必须过 governance → record → execute → record 的合约边界,治理决策(预算控制、内容过滤、人工审批)先于执行生效且全程可追溯。同一份 YAML 规约只需改 overlay 就能比较不同推理模式、拓扑结构、上下文来源的效果——从原型到生产的生命周期保持一致。适用场景:需要把多 agent 系统从 demo 推进到生产级部署的团队,特别是治理合规、可观测性和实验复现性有硬性要求的场景,可替代现有 ad-hoc 脚本式的 MAS 开发流程。

Linguistic Firewall: Geometry as Defense in Multi-Agent Systems Routing

  • 2026-06-29
  • agent
  • multi-agent routing
  • prompt injection
  • router security

ANTAP 是一种评估驱动的多智能体路由架构,用几何投影替代文本描述来选 agent。离线阶段在每个候选 agent 上跑可信 benchmark,把成功/失败二值信号拟合成固定线性算子;在线路由仅做单次矩阵-向量乘 W*z,完全不接触 agent 的文本描述,从结构上切断 description-based prompt injection 的攻击面——恶意 agent 的描述里嵌入再巧妙的指令也影响不了路由决策。同时,离线 benchmark 中包含含 trigger 的查询,sleep agent 在 calibration 时触发后门会被标为失败,其算子自动学到安全子空间的负关联。适合接入 AutoGen/CrewAI 等现有多智能体框架,替换基于 LLM 读描述的 router,在需要对抗恶意 agent 注册或供应链投毒的安全敏感场景中消除整个攻击面。

UnfoldArt: Zero-Shot Recovery of Full Articulated 3D Objects from Text or Image

  • 2026-06-29
  • agent
  • 多模态
  • 3D重建

从单张图片或一句话生成完整可交互铰接 3D 物体的 zero-shot 管线,输出包含零件网格、关节参数、运动学树和被遮挡内部几何的 URDF。核心是用三个分层 agent(Decomposer/Grounder/Articulator)进行两轮结构化辩论——第一轮利用全局-局部视角分歧修正关节参数,第二轮用冻结的 WAN-VACE 视频先验作为外部运动证据——全程不需要任何铰接标注数据。确定关节后,再用关节条件化的视频驱动零件运动,通过 3D 隐空间 inpainting 暴露并重建被遮挡的内部结构。适合 embodied AI、机器人仿真、VR 场景中需要从单张照片快速产出可交互资产的场景,替代逐物体多视角采集或模板库检索。

Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent

扩展 Horizon 而非参数量:35B Agent 达到万亿参数级性能

  • 2026-06-29
  • agent
  • 训练方法
  • 推理优化
  • 多模态

上海 AI 实验室基于 Qwen3.5-35B-A3B 基座,通过三阶段训练(全领域 SFT → 各领域教师模型专项 RL → 多教师 on-policy 蒸馏)做出 35B MoE agent 模型,在长 horizon agent 任务上匹敌甚至超过 Kimi-K2.6、DeepSeek-V4-Pro 等 1T 级模型。核心思路不是堆参数而是堆「agent horizon」:构建 Knowledge-Action Graph 基础设施产出平均 45K token 的 agentic 轨迹,再通过领域路由 + 显著词汇对齐的 on-policy 蒸馏把六个异构领域(搜索、ML 工程、科研推理、指令遵循、工具调用、通用 agent)能力统一到一个可部署模型里。适用场景:需要工具调用、长上下文推理、多步科学/工程问题求解的 agent 系统,可作为 1T 级模型在长 horizon agent 任务上的轻量替代。

ENC-ODE: Event-level Neurodegenerative Modeling in Continuous Time with Neural ODEs

  • 2026-06-29
  • attention
  • 多模态
  • 时序建模

用诊断条件化的 Neural ODE 对每个历史观测事件独立建模连续轨迹,再用目标时间与模态条件化的注意力加权聚合,绕开了传统序列模型把多模态历史压进单一隐状态的瓶颈。在 ADNI 数据集上预测三种 PET 生物标志物(FDG/TAU/AMY)的演化,多模态设定下全面优于 RNN、Transformer、Neural ODE、Mamba 等 7 个基线。通过将多条 ODE 轨迹并行求解,训练每 epoch 耗时从 25.66s 降到 10.47s。适合不规则采样的多模态时序预测场景——比如电子病历、工业传感器、金融风控——可直接替代现有序列模型,同时保留事件级的可解释性。

Unlimited OCR Works

  • 2026-06-22
  • OCR
  • attention
  • 推理优化
  • 多模态

提出 Reference Sliding Window Attention (R-SWA),一种面向长序列解析任务的注意力机制:每个 token 关注全部视觉/参考 token + 最近 128 个输出 token,使 KV cache 在解码全程保持恒定,不再随输出长度线性增长。以 DeepSeek OCR 为基线,将其 decoder 中所有 attention 层替换为 R-SWA 后,单次前向即可解析数十页文档(32K 上下文内),且推理速度不随输出长度衰减。R-SWA 是通用解析注意力,除 OCR 外同样适用于 ASR、翻译等需要长程参考建模的任务。代码与模型权重已开源(GitHub 10.7k stars,HF 21 万下载)。

Diffusion Transformers with Representation Autoencoders

用表征自编码器替代 VAE 的扩散 Transformer

  • 2025-10-13
  • 训练方法
  • 生成模型

用冻结的预训练表征编码器(DINOv2、SigLIP、MAE)替代传统 VAE 编码器,配一个可训练的 ViT 解码器,构成 Representation Autoencoder(RAE)。RAE 的潜在空间语义更丰富、维度更高,但标准 DiT 无法直接在上面训练——作者提出三个修复:让 DiT 宽度匹配 token 维度、按有效数据维度调整噪声调度、在解码器训练时加噪声增强以容忍扩散输出的分布偏移。此外引入 DiTDH(一个浅而宽的扩散头),在不增加二次计算开销的前提下扩展模型宽度。工程上可以直接把 RAE 当作 SD-VAE 的替代品接入现有 DiT 训练管线,预训练编码器(DINOv2 等)是现成的,只需额外训练一个轻量解码器。