Digital Cultural Heritage imaging via osmosis filtering
通过渗透过滤进行数字文化遗址成像
专题命中 多模态评测 :multi-modal(abstract)
AI总结 本文提出利用渗透过滤模型解决文化遗址成像中因不同光谱区域数据获取导致的强度不均匀问题,通过多模态成像整合信息,提升文物修复的物理特性辨识能力。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
通过渗透过滤进行数字文化遗址成像
专题命中 多模态评测 :multi-modal(abstract)
AI总结 本文提出利用渗透过滤模型解决文化遗址成像中因不同光谱区域数据获取导致的强度不均匀问题,通过多模态成像整合信息,提升文物修复的物理特性辨识能力。
配置器用户界面的可用性分析:基于多模态大语言模型
专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn)
AI总结 本文通过合成18个配置器特定可用性标准,利用多模态大语言模型对16个实际配置器进行半自动化可用性分析,验证了MLLMs能可靠识别问题并提供领域感知改进建议。
Comments Accepted for publication at the International Conference on Software and Systems Reuse, Product Lines, and Configuration (VARIABILITY 2026)
BreastGPT: 面向乳腺癌临床全流程的多模态大语言模型
机构 * DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院) ; Zhejiang University(浙江大学) ; Hupan Lab(华潘实验室) ; West China Hospital(西京医院) ; China Medical University(中国医科大学)
专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL
AI总结 提出BreastGPT多模态大语言模型,通过构建工作流对齐的指令语料库BreastStage和双分支视觉编码器,实现乳腺癌筛查、诊断和治疗规划全流程的多模态推理,在BreastStage-Bench上取得75.66%封闭式准确率和89.92%开放式得分。
迈向可验证的多模态深度研究:用于交错报告生成的多智能体框架
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)
专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI
AI总结 提出多智能体框架Ptah,通过规划、研究和写作阶段生成交错文本与视觉证据的多模态报告,并引入验证器确保事实准确性和跨模态一致性。
Comments In progress
捕捉异常分布式光伏:基于边缘的多模态异常检测
机构 * University of California, Riverside, California, 92507(加州大学河滨分校) ; Illinois Institute of Technology, Chicago, Illinois 60616(伊利诺伊理工学院)
专题命中 多模态Agent :multi-modal(title,abstract)
AI总结 本文提出基于边缘的多模态异常检测方法,用于识别分布式光伏等设备的异常行为,通过融合多源时间序列数据,提升对电网安全的检测能力。
基于Transformer的自动驾驶模型与面向部署的压缩:综述
机构 * Renmin University of China(中国人民大学) ; Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院) ; Shanghai Academy of AI for Science(上海人工智能科学研究院) ; Department of houmo.ai(houmo.ai部门)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文综述了基于Transformer的自动驾驶模型,并从部署角度分析了压缩与加速策略(如量化、剪枝、知识蒸馏等)如何影响模型设计、部署性、鲁棒性和安全性。
AutoMedBench: 迈向基于智能体AI模型的医学自动研究
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) ; NVIDIA
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 提出AutoMedBench,一个工作流感知的基准,通过五阶段工作流(计划、设置、验证、推理、提交)评估自主智能体在医学AI研究中的行为,发现验证阶段最弱而设置阶段最强,验证和提交失败占主导。
UModel: 一种面向智能体的可观测性数据规模化建模方法
专题命中 多模态Agent :multimodal(abstract)
AI总结 针对现有可观测性框架数据孤岛、模式不兼容及语义元数据不足导致根因分析困难的问题,提出UModel统一本体框架,通过对象中心化建模和语义图连接异构数据,并引入U-SPL管道查询接口,使智能体自主探索系统拓扑并关联多模态数据,在AIOps 2025挑战赛数据集上根因定位精度提升8%,已在阿里云部署超一年,服务数万用户,支撑每秒数百万操作和亚秒级查询延迟。
LDA-1B:通过通用具身数据摄取扩展潜动力学动作模型
机构 * Peking University(北京大学) ; Galbot ; CASIA(中国科学院自动化研究所) ; BAAI(北京人工智能研究院) ; Tsinghua University(清华大学) ; Sun Yat-sen University(中山大学) ; NVIDIA
专题命中 多模态Agent :multi-modal(abstract)
AI总结 提出LDA-1B机器人基础模型,通过统一格式的具身交互数据集EI-30k和结构化DINO潜空间中的动力学学习,联合建模动力学、策略和视觉预测,在接触丰富、灵巧和长时任务上分别提升高达21%、48%和23%。
Comments Accepted at RSS 2026, Project Page:https://pku-epic.github.io/LDA
等连通拓扑在多智能体交互中的作用
专题命中 多模态Agent :multimodal(abstract)
AI总结 本文探讨了等连通拓扑在多智能体系统动态中的作用,通过分析不同拓扑结构对信息共享能力的影响,提出了解决多智能体图结构确定问题的方法。
Comments 12 pages, 3 figures
非高斯信念空间中的全局定位运动规划
专题命中 多模态Agent :multimodal(abstract)
AI总结 本文提出了一种在不确定环境下进行运动规划的方法,用于处理模糊数据关联导致的多模态假设。通过递推方法逐步消除多模态信念,实现有限时间内精确定位。
Comments extends previous submission with updated figures, analysis and justifications. arXiv admin note: text overlap with arXiv:1506.01780
基于查询的跨模态投影器增强Mamba多模态大语言模型
机构 * Korea Advanced Institute of Science and Technology / Korea, Republic of(韩国科学技术院) ; University of Illinois in Urbana-Champaign / United States of America(伊利诺伊大学厄巴纳-香槟分校) ; Korea University / Korea, Republic of(韩国大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CL
AI总结 提出基于查询的跨模态投影器,通过交叉注意力压缩视觉令牌,消除手动设计2D扫描顺序的需求,提升Mamba多模态LLM的性能和吞吐量。
Comments Accepted to EMNLP 2024 Findings
连接短视频与直播:推理引导的多模态大语言模型用于跨域表示学习
专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn)
AI总结 针对短视频到直播的跨域推荐冷启动问题,提出推理引导的跨域表示学习框架RGCD-Rep,利用多模态大语言模型生成结构化推理知识并蒸馏到轻量模型,通过两阶段训练学习可迁移的物品表示,在快手部署后显著提升核心业务指标。
Comments 9 pages
Hyper-ICL:基于双曲锚点蒸馏的注意力校准用于多模态上下文学习
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 多模态训练与对齐 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
AI总结 提出Hyper-ICL,一种轻量级训练框架,通过低秩logit适配器和双曲锚点蒸馏损失校准注意力分布,无需推理时提供上下文示例即可重建演示效果,提升多模态上下文学习的准确性和稳定性。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)
ProtoAda: 原型引导的自适应适配器扩展与几何整合用于多模态持续指令微调
机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) ; State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室)
专题命中 多模态训练与对齐 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
AI总结 提出ProtoAda框架,通过格式感知任务原型和几何感知参数整合,解决多模态持续指令微调中任务路由错误和梯度干扰问题。
张量分析与多模态脑图像融合
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 本文提出利用张量结构分析多模态神经影像数据,引入马尔可夫-彭罗斯图进行建模,首次将Granger因果分析视为张量回归问题,展示其在脑网络分解中的潜力。
Comments 23 pages, 15 figures, submitted to Proceedings of the IEEE
CR-Seg:注意力引导与CoT增强的由粗到精推理分割
机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出CR-Seg两阶段框架,通过注意力图提取和全局到局部思维链,实现由粗到精的推理分割,解决跨模态对齐和推理-答案不一致问题。
RePercENT:将解耦表示学习扩展到两种模态之外
机构 * EPFL(瑞士联邦理工学院)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)
AI总结 提出RePercENT框架,通过多模态即插即用架构和联合优化目标,实现超过两种模态的可扩展成对解耦,无需联合预训练并降低计算复杂度。
LaVIDE: 通过地图-图像对齐的语言提示卫星变化检测
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) ; Technology and Engineering Center for Space Utilization and the Key Laboratory of Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与重点实验室) ; School of Aeronautics and Astronautics, University of Chinese Academy of Sciences(中国科学院大学航空宇航学院) ; School of Electronic Information, Wuhan University(武汉大学电子信息学院) ; College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出LaVIDE框架,利用受限提示学习和对象感知嵌入增强,通过语言弥合高层地图类别与低层图像细节之间的语义鸿沟,实现跨模态对齐,在多类与单类变化检测任务上分别提升IoU 18.4%和5.2%。
熵是不够的:通过视觉锚定令牌选择解锁视觉推理的有效强化学习
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 针对视觉推理中基于熵的信用分配机制失效问题,提出VEPO框架,通过视觉敏感性与令牌熵的乘法耦合实现梯度信用重定向,显著提升多模态强化学习性能。
反事实行为的几何视角:边界接近度与局部支持的交互作用
机构 * Brown University(布朗大学)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 本文通过几何视角研究反事实行为,发现决策边界接近度与局部数据支持的交互作用决定了反事实的可行性,且反事实行为是独立于预测性能的维度,可在不改变准确率的情况下被改变。
KODA: 视觉-语言基础模型的对比表示比较与对齐
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 提出KODA框架,通过核优化方法对比分析视觉-语言基础模型的表示差异,并识别弱聚类与强聚类的样本子集,实现表示对齐。
从样本到知识:面向神经科学发现的综合方法
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 本文提出从样本到知识的整合方法,旨在通过反馈循环优化神经科学数据采集与处理流程,提升知识提取效率。
Comments first two authors contributed equally. 8 pages, 2 figures. v2: added acknowledgments
线性动态系统中高斯混合噪声统计的解析MMSE界限
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 本文研究线性动态系统在高斯混合噪声下的MMSE估计,提出解析上界和下界,通过高斯混合分布形状选择紧致上界,并验证在高多模噪声下MMSE收敛。
在校准不确定性下利用参数水平集方法进行多模态3D形状重建
机构 * Computer Science Department, Ben-Gurion University of the Negev(本古里安大学计算机科学系)
专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.CV
AI总结 本文提出了一种参数化水平集方法,用于在存在校准不确定性时从多模态数据中重建3D形状,该方法能够有效处理不同数据模态,如稀疏点集、体素切片、2D照片等,并在复杂对象的紧凑表示和校准噪声鲁棒性方面取得了显著贡献。
LMM-IR:面向静态IR压降预测的大规模网表感知多模态框架
机构 * Tsinghua University(清华大学)
专题命中 其他多模态 :multimodal(title,abstract)
AI总结 提出一种基于大规模网表变换器和3D点云表示的多模态框架,用于快速准确地预测芯片静态IR压降,在ICCAD 2023竞赛中取得最佳F1分数和最低MAE。
Comments Accepted by DAC2025
多模态分布的重构用于混合矩基化学动力学,补充信息
专题命中 其他多模态 :multimodal(title,abstract)
AI总结 本文比较了两种矩基分析方法(矩法和条件矩法)在重构多模态分布时的性能,发现条件矩法更适用于描述多模态分布并提高重构精度。
Comments 10 pages, 5 figures, supplementary information
多模态过滤用于非线性估计
专题命中 其他多模态 :multi-modal(title,abstract)
AI总结 本文提出一种非线性滤波算法,利用高斯混合模型表示多模态密度,通过闭式估计参数提升时间序列和实际应用中的跟踪性能。
BiNSGPS: 通过双向神经符号交互解决几何问题
机构 * MAIS, Institute of Automation of Chinese Academy of Sciences(自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 其他多模态 :MLLM(abstract);分类 cs.AI
AI总结 提出BiNSGPS框架,通过多模态大语言模型顾问与符号求解器之间的双向神经符号交互,动态纠正不一致的形式表示或提出辅助假设,以解决几何问题中的早期错误和符号冲突。
一种用于减少乘客汽车中用户交互的监督学习概念
专题命中 其他多模态 :multi-modal(abstract);分类 cs.AI
AI总结 本文提出了一种基于监督学习的自动化系统,用于减少人机交互界面中的交互复杂性,适用于汽车多模态热调节系统的设定点选择。
Comments 4 pages, 9 figures, concept only