MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities
MODUS:仅解码器的多模态任意到任意建模
AI总结 研究任意到任意多模态建模,提出仅解码器的对称多模态建模方法Modus,无需特定模态组件,支持多种应用,在各基准测试中用单模型展现强大性能且与基线竞争,材料开源。
Comments Accepted at ICML 2026. Project page: https://modus-multimodal.epfl.ch
期刊&会议
International Conference on Machine Learning · 会议 · Machine Learning
MODUS:仅解码器的多模态任意到任意建模
AI总结 研究任意到任意多模态建模,提出仅解码器的对称多模态建模方法Modus,无需特定模态组件,支持多种应用,在各基准测试中用单模型展现强大性能且与基线竞争,材料开源。
Comments Accepted at ICML 2026. Project page: https://modus-multimodal.epfl.ch
显著知识路径:用于高效知识密集型多模态问答的稀疏跨模态路由
AI总结 研究知识密集型多模态问答,提出SKIP架构,通过问题引导视觉令牌修剪等方法,沿稀疏路径计算路由,结合自适应预算控制器,在五个基准测试中,以更少计算量和更低延迟达到或超越密集基线准确性。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026) Workshop on Efficient Multimodal Question Answering (EMM-QA), Seoul, South Korea. Copyright 2026 by the author(s). (Archival)
MedJudgeRAG:用于医学多项选择题问答的基于动态知识图谱的选项级证据判断
AI总结 针对医学MCQA中普通RAG降低LM性能的问题,提出MedJudgeRAG框架,将检索文档表示为动态知识图谱,为选项判断证据裁决并确定知识利用策略,经监督微调训练,实验证明其性能优于基线,且动态知识图谱在训练时作用更有效。
Comments 16 pages, 2 figures, Accepted at The Workshop on Graph Foundation Models at the 43 rd International Conference on Machine Learning (ICML 2026)
当检索前思考有害时:用于自适应知识图谱检索的TraceBound诊断
AI总结 研究知识图谱自适应检索中“检索前思考”有害问题,引入TraceBound诊断协议,它能暴露查询配置文件等。实验表明虽改善可检查性,但降低检索质量,通过分析定位退化原因,指出应将其作为动作选择控制问题评估。
Comments 11 pages, 4 figures, 15 tables. Accepted at the Failure Modes in Agentic AI (FAGEN) Workshop at ICML 2026
当记忆成为媒介时会失去什么?评估人工智能生成的口述历史可视化
AI总结 研究散居海外者口述历史可视化中记忆变媒介时的问题,基于口述历史理论设计指标,比较两种管道,发现场景规划与叙事保留冲突,提出基于失败模式的评估框架、冲突分析及系统选择路由协议。
Comments Accepted at ICML 2026 Workshop on Culture x AI: Evaluating AI as a Cultural Technology