C3Po: Cross-View Cross-Modality Correspondence by Pointmap Prediction
C3Po:通过点图预测实现跨视角跨模态对应
专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV
AI总结 C3Po通过点图预测实现跨视角和跨模态的对应关系,提升了几何推理的性能和准确性。
Comments NeurIPS 2025
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
C3Po:通过点图预测实现跨视角跨模态对应
专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV
AI总结 C3Po通过点图预测实现跨视角和跨模态的对应关系,提升了几何推理的性能和准确性。
Comments NeurIPS 2025
面向深度伪造和文档欺诈检测的代理AI微服务框架用于KYC流程
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 本文提出一种代理AI微服务框架,用于提升KYC流程中深度伪造和文档欺诈检测的准确性与实时性,同时增强对抗性输入的抵御能力。
Comments Journal of Information Systems Engineering and Management, 2024
印度是如何烹饪饭团的?
机构 * IIIT Hyderabad
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 本文提出首个大规模饭团制作视频数据集及多阶段框架,用于研究烹饪视频中细粒度步骤差异及文化关联性。
基于组织病理学的计算进化空间组学:整合、映射与基础模型
专题命中 多模态评测 :multimodal(abstract)
AI总结 本文综述了基于组织病理学的计算进化空间组学,从整合、映射和基础模型三个范式出发,探讨了H&E图像在不同阶段的作用及当前研究的挑战与方向。
Comments 30 pages, 5 figures
AgriLiRa4D:一种多传感器无人机数据集,用于在具有挑战性的农业田间实现鲁棒SLAM
机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院) ; TopXGun Robotics(TopXGun机器人公司) ; School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院)
专题命中 多模态评测 :multi-modal(abstract)
AI总结 AgriLiRa4D提供多传感器数据集,用于在农业环境中实现鲁棒SLAM,支持多种SLAM研究和评估
基于Copula的变分自编码器用于逆问题中的不确定性量化:应用于海上风电涡轮机的损伤识别
专题命中 多模态评测 :multimodal(abstract)
AI总结 本文提出基于Copula的变分自编码器,用于高维空间中逆问题的不确定性量化,应用于海上风电涡轮机的损伤识别。
物理指导的树搜索用于高维计算设计
机构 * Department of Mechanical and Industrial Engineering, University of Illinois, Chicago(机械与工业工程系,伊利诺伊大学芝加哥分校) ; Center for Nanoscale Materials, Argonne National Laboratory(纳米材料中心,阿贡国家实验室) ; Mathematics and Computer Science Division, Argonne National Laboratory(数学与计算机科学部,阿贡国家实验室)
专题命中 多模态评测 :multimodal(abstract)
AI总结 本文提出了一种物理指导的树搜索方法,用于高维计算设计,结合决策树、代理引导采样和奖励塑造,实现高效优化并保持物理约束。
MEDVISTAGYM:一种通过工具集成强化学习进行医学图像思考的可扩展训练环境
机构 * Virginia Tech(弗吉尼亚理工大学) ; UT Southwestern Medical Center(德克萨斯大学西南医学中心) ; Georgia Institute of Technology(佐治亚理工学院) ; Cisco(思科公司)
专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 MedVistaGym通过工具集成强化学习提升医学图像分析的代理训练效果。
OS-Symphony: 一个用于鲁棒且通用计算机使用代理的综合框架
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; National University of Singapore(新加坡国立大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; The University of Hong Kong(香港大学) ; CUHK MMLab(香港中文大学MMLab) ; Xi’an Jiaotong University(西安交通大学) ; Nanjing University(南京大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 OS-Symphony通过反思记忆代理和多功能工具代理,提升计算机使用代理在长周期任务和新领域中的鲁棒性和泛化能力。
Comments 31 pages, 11 figures, 12 tables
BackdoorAgent: 一个统一框架用于针对基于LLM的代理的后门攻击
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Singapore Management University(新加坡管理大学) ; Alibaba Group(阿里巴巴集团) ; Deakin University(德肯大学) ; Hunan Institute of Advanced Technology(湖南高级技术研究所)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 BackdoorAgent提出一个统一框架,分析LLM代理中后门攻击的跨阶段传播和触发器持续性,揭示代理工作流的脆弱性。
显式世界模型以实现可靠的人机协作
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 本文提出通过构建显式世界模型来实现可靠的显式人机协作,强调动态模糊的人机交互需求。
Comments Accepted to AAAI-26 Bridge Program B10: Making Embodied AI Reliable with Testing and Formal Verification
A3: 用于移动GUI代理的Android代理竞技场:基于本质状态的程序评估
机构 * Nankai University(南开大学) ; vivo AI Lab(vivo 人工智能实验室) ; SJTU(上海交通大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 A3提出了一种基于本质状态的程序评估系统,通过动态在线应用的100个任务基准和工具包,提升移动GUI代理的评估能力。
基于大语言模型代理的终身学习:路线图
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 本文提出了一种基于大语言模型代理的终身学习框架,通过三个模块整合多模态输入、知识存储与动态环境交互,以实现持续适应和长期性能提升。
Comments Accepted to IEEE TPAMI
SwarmFoam: 基于多种大语言模型的开放FOAM多智能体系统
专题命中 多模态Agent :multi-modal(abstract)
AI总结 SwarmFoam通过整合多模态感知与智能校正技术,提升复杂CFD模拟的适应性与准确性。
Comments 26 pages, 15 figures
基于可预训练的自动后验变换的代理基于金融市场模拟器校准
专题命中 多模态Agent :multi-modal(abstract)
AI总结 本文提出ANTR方法,通过可预训练的神经密度估计器和自适应信任区域策略,提升代理基于金融市场模拟器的校准精度和效率。
Comments 32 pages, 4 figures
DIVER: 动态迭代视觉证据推理用于多模态虚假新闻检测
机构 * Xinjiang University(新疆大学) ; AI Security Lab(360人工智能安全实验室) ; Beihang University(北航) ; Fudan University(复旦大学) ; Central South University(中南大学) ; Nanjing University(南京大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 DIVER通过动态迭代视觉证据推理提升多模态虚假新闻检测性能,利用文本和视觉证据融合优化检测效果。
Comments 13 pages
OpenSocInt: 一种多模态训练环境用于人感知的社会导航
机构 * Inria at Univ. Grenoble Alpes, LJK, CNRS(Inria与格勒诺布尔阿尔卑斯大学、LJK、CNRS)
专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI
AI总结 OpenSocInt是一个开源多模态训练环境,用于研究人感知的社会导航,支持不同感知特征的编码与融合以及多种代理的训练。
Rep3Net:一种利用多模态表示进行分子生物活性预测的方法
机构 * Computer Science and Engineering, Islamic University of Technology, Bangladesh(计算机科学与工程,伊斯兰技术大学,孟加拉国)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL
AI总结 Rep3Net通过融合分子描述符、图特征和SMILES嵌入,提升了PARP1生物活性预测的准确性,并在药物发现中展示了高效能的多模态方法。
可解释的多模态基于方面的情感分析与依赖引导的大语言模型
机构 * Harbin Institute of Technology(哈尔滨工程大学) ; Zhongguancun Academy(中关村学院) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) ; University of Science and Technology of China(中国科学技术大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL
AI总结 本文提出了一种基于依赖引导的大语言模型的多模态情感分析方法,通过生成可解释的自然语言解释来提升情感分类的准确性。
Comments 9 pages, 3 figures
浏览与聚焦:通过先验LLM上下文融合理解多模态内容
机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) ; Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) ; Institute of Intelligent Computing, Alibaba Group(智能计算研究院,阿里巴巴集团) ; Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) ; Jiangsu Collaborative Innovation Center for Language Competence, Jiangsu, China(江苏省语言能力协同创新中心,江苏,中国)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL
AI总结 本文提出浏览与聚焦两阶段范式,通过融合先验LLM上下文提升多模态内容理解,显著提升多图像场景的性能。
Comments 17 pages, 5 figures
Journal ref ACL 2024
因果与联邦多模态学习用于异质人群中的心血管风险预测
机构 * Hanson Professional Services(Hanson专业服务) ; University of Tennessee, Knoxville(田纳西大学 Knoxville分校) ; Oak Ridge National Laboratory(橡树岭国家实验室)
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 本文提出一种融合因果学习与联邦学习的多模态框架,用于在异质人群中预测心血管风险,通过整合多种生物医学数据并确保隐私和可解释性,提升预测的鲁棒性和公平性。
Comments 9 pages, 5 figures
通过分层双阶段优化学习通用且高效的图像水印技术
机构 * Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(深圳先进研究院,电子科学与技术大学) ; School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.MM
AI总结 本文提出分层双阶段优化框架,通过学习通用且高效的图像水印技术,提升水印提取准确率并保持低延迟。
OSCAR:面向随机细化的语义控制光学感知SAR到光学翻译
机构 * Kyungpook National University(庆北国立大学) ; Korea Aerospace Research Institute(韩国航空航天研究机构)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 OSCAR通过跨模态语义对齐、语义引导生成指导和不确定性感知目标,提升SAR到光学图像翻译的语义一致性和感知质量。
Comments main 15 pages, supplementary 5 pages
PlaM: 无需训练的高原引导模型融合以提升多模态大语言模型的视觉语义
机构 * Northeastern University, China(东北大学) ; CIS, LMU Munich, Germany(慕尼黑大学计算机学院) ; Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL
AI总结 PlaM通过无需训练的高原引导模型融合方法,提升多模态大语言模型的视觉语义表现。
Comments under review
混合LSTM-UKF框架:踝角和地面反作用力估计
机构 * Department of Computer Science Engineering SRMIST University(计算机科学工程系 SRMIST 大学)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 本文提出混合LSTM-UKF框架,用于在不同行走速度下准确估计踝角和地面反作用力,通过多模态传感器融合提升生物力学分析的可靠性。
Comments 8
面向6G自主通信的大型多模态模型辅助调度
专题命中 其他多模态 :multimodal(title,abstract)
AI总结 本文提出基于大型多模态模型的调度技术,通过预测信道参数提升6G自主通信的吞吐量性能。
Comments 16 pages
Journal ref IEEE Transactions on Cognitive Communications and Networking, vol. 12, pp. 3732-3747, 2026
LLM性能预测器:在混合人机审核系统中学习何时升级
机构 * Reichman University(雷赫曼大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文提出了一种基于LLM性能预测器的框架,用于在混合人机审核系统中学习何时升级,通过提升准确性与成本权衡实现更高效的内容审核。
Comments Accepted as a full paper at the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)
通过delta思考:通过微分视觉推理策略激励强化学习
机构 * Fudan University(复旦大学) ; Zhejiang University(浙江大学) ; Wuhan University(武汉大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 通过微分视觉推理策略增强强化学习的视觉理解能力,提升多模态任务性能。
Comments 24 pages, 10 tables, 4 figures
学习分析研究十五年:主题、趋势与挑战
专题命中 其他多模态 :multimodal(abstract)
AI总结 本研究分析了学习分析领域15年来的发展趋势,揭示了六个持续存在的主题中心,并指出未来需解决参与度、资金依赖性和研究与实践结合的问题。
Comments Full research paper accepted for publication in the Learning Analytics and Knowledge (LAK) 2026 conference proceedings, see https://doi.org/10.1145/3785022.3785131
利用双中子星并合的引力波频谱学揭示致密物质的相变
专题命中 其他多模态 :multimodal(abstract)
AI总结 通过双中子星并合引力波频谱学探测高密度去束缚相变,利用引力波模式信噪比约束能量密度间隙。