GEAR: Reconstruction of Classical Paintings via Geometry Grounding and Appearance Restitution
GEAR:通过几何定位和外观还原重建古典绘画
AI总结 研究旨在解决从单幅古典绘画重建3D场景的难题,提出免训练的GEAR框架,先通过几何定位增强3D高斯重建稳定性,再在空间约束下恢复外观,经实验验证其在多方面优于基线,还构建了相关基准。
Comments Accepted by ACM MM 2026
期刊&会议
ACM International Conference on Multimedia · 会议 · Multimedia
GEAR:通过几何定位和外观还原重建古典绘画
AI总结 研究旨在解决从单幅古典绘画重建3D场景的难题,提出免训练的GEAR框架,先通过几何定位增强3D高斯重建稳定性,再在空间约束下恢复外观,经实验验证其在多方面优于基线,还构建了相关基准。
Comments Accepted by ACM MM 2026
UAV-ON:用于空中智能体的开放世界目标导航基准测试
机构 * Harbin Institute of Technology(哈尔滨工业大学)
AI总结 介绍用于空中智能体开放世界目标导航的UAV-ON基准测试,含14个环境及1270个目标对象,通过实例级指令编码。实现多种基线方法评估,结果凸显空中导航和语义目标基础的复合挑战,推动复杂环境下无人机可扩展自主性研究。
Comments Accepted to ACM MM 2025
CARA:用于可解释碰撞预测的概念感知风险注意力
机构 * Shanghai Jiao Tong University(上海交通大学) ; The University of Hong Kong(香港大学) ; Fudan University(复旦大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; University of Pennsylvania(宾夕法尼亚大学) ; Renmin University of China(中国人民大学)
AI总结 研究自动驾驶碰撞预测问题,提出CARA框架,从事故叙述中获取风险概念并与视频帧对齐成轨迹,将语义风险因素作为动态证据,结合可解释性与预测过程,实验证明其能提高预测准确性和预警及时性。
Comments Accepted to ACM Multimedia 2026(Oral)
重新思考视觉基础模型适应中的逐层信息分配
机构 * City College of New York, CUNY(纽约市立大学城市学院) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) ; Tulane University(杜兰大学) ; Northeastern University(东北大学) ; George Washington University(乔治华盛顿大学) ; Capital One(第一资本金融公司) ; Harvard University(哈佛大学)
AI总结 研究视觉基础模型适应中的逐层信息分配问题,提出基于信息瓶颈原理的PIB框架,规范逐层压缩与充分性权衡,促进跨层信息连贯,实验表明该方法在多数据集上表现出色,能解释提示容量缩放行为等。
Comments Accepted by ACM MM 2026
通过MLLM引导的概念生成和语义传播进行无监督多模态意图发现
AI总结 该研究针对无监督多模态意图发现缺乏语义监督及可解释性差的问题,提出MCSP方法,通过MLLM引导的对比推理获取语义概念,再经语义传播生成伪标签,实验证明其性能优于现有方法且能产生可解释的簇。
Comments Accepted at ACM Multimedia 2026 (MM '26)
ISPCloak:利用互联网服务提供商实现针对深度伪造检测器的无优化物理伪装
机构 * Guangdong University of Technology(广东工业大学) ; Guizhou Provincial Laboratory of Big Data, State Key Laboratory of Public Big Data, Guizhou University(贵州大学大数据省级重点实验室、公共大数据国家重点实验室)
AI总结 研究针对深度伪造检测器的对抗攻击,提出ISPCloak框架,利用ISP管道,通过投影到RAW域、注入噪声和前向ISP重建等,将真实相机统计先验印在生成图像上,快速生成对抗样本,扰乱检测机制。
Comments Accpted by ACM MM 2026
正确为我上色:弥合感知颜色空间与文本嵌入以改进扩散生成
机构 * National Yang Ming Chiao Tung University
AI总结 研究文本到图像生成中颜色对齐问题,提出利用大语言模型消除颜色提示歧义、在文本嵌入空间指导颜色混合操作的无需训练框架,提高了颜色准确性且不影响图像质量,弥合文本语义与视觉生成差距。
Comments Accepted to ACM Multimedia 2025 (MM '25)
高质量文本,稳健视觉:语言在增强视觉语言模型视觉稳健性中的作用
机构 * The University of Tokyo(东京大学) ; National Institute of Informatics(日本信息处理研究所) ; The University of Tokyo, National Institute of Informatics(东京大学、日本信息处理研究所)
AI总结 研究针对视觉语言模型对抗攻击问题,提出质量文本引导的对抗微调方法QT-AFT,利用高质量字幕提升视觉编码器对抗鲁棒性,在多个零样本数据集上实现了最先进的零样本对抗鲁棒性和纯净准确率,并揭示了语言增强视觉鲁棒性的关键见解。
Comments ACMMM 2025 Accepted. Codes are available at: https://github.com/futakw/QTAFT
面向数据异构性下的隐私保护联邦提示调优:一种子空间分解专家方法
机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; Center for the Applied Statistics, School of Statistics, Renmin University of China(中国人民大学统计学院应用统计中心) ; School of Computer Science & Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) ; School of Software, Beihang University(北京航空航天大学软件学院) ; School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)
AI总结 研究针对数据异构性下的隐私保护联邦提示调优问题,提出FedSEPT方法,采用子空间分解专家建模及实例感知专家融合技术,在11个异构基准实验中,于相同隐私约束下,该方法在局部适配和全局泛化间实现更好权衡。
Comments Accepted by ACM MM 2026
解耦跨模态流形差异:利用可见光扩散先验实现红外超分辨率
机构 * University of Science and Technology Beijing(北京科技大学)
AI总结 针对红外图像超分辨率问题,提出双路径基于扩散的Shift-IISR框架,通过开发GRM模块提取特定模态信息、引入LSR模块关注结构信息,有效提高了分布和结构一致性,保持了超分辨率性能。
Comments Accepted to ACM Multimedia 2026 (ACM MM 2026). Code: https://github.com/Assassink8/Shift-IISR
Geo3R:减轻多模态大语言模型中的空间推理幻觉
机构 * Peking University(北京大学) ; Joy Future Academy(京东探索研究院)
AI总结 多模态大语言模型推理空间关系易产生幻觉,现有方法效果有限。本文定义空间推理幻觉及常见场景,提出无训练的Geo3R框架,结合几何证据和结构化3D推理减轻幻觉,实验证明该框架显著减少幻觉,优于现有模型和方法。
Comments Accepted by ACM MM 2026. This is the arXiv preprint version, not the camera-ready
TransBiolab:一个杂乱透明生物医学物体的真实世界多视图数据集
机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) ; College of Design and Innovation, Tongji University(同济大学设计创意学院) ; Shanghai Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海智能无人系统研究院) ; School of Software and Engineering, Huazhong University of Science and Technology(华中科技大学软件学院)
AI总结 针对自主生物医学实验室透明物体视觉感知数据稀缺问题,提出TrainsBiolab真实世界多视图数据集,含多物体杂乱、遮挡场景数据及多种注释,定义相关基准并评估,为自主实验室操作视觉任务提供资源。
Comments 9 pages, 10 figures, accepted by ACM Multimedia 2026
Uni-XAS:用于X射线吸收光谱的对齐驱动双向多模态学习
AI总结 研究针对X射线吸收光谱建模中异构模态学习难题,提出Uni-XAS框架。通过XASLip解决元素内配位变化,用检索增强解码防尺度崩溃等,还引入排列校正流匹配解决逆问题,在多方面表现出色,为多模态学习和评估奠定基础。
Comments 48 pages, 7 figures, 11 tables. Accepted by ACMMM 2026
LaDA-Band:语言扩散模型用于人声到伴奏生成
机构 * State Key Lab of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院计算技术研究所人工智能安全国家重点实验室) ; Lyra Lab, Tencent Music Entertainment(腾讯音乐娱乐集团Lyra实验室) ; Pengcheng Laboratory(鹏城实验室)
AI总结 LaDA-Band通过引入离散掩码扩散模型,解决了人声到伴奏生成中保持音质真实、维持全局连贯性和产生动态编曲的三重挑战,提升了长距离结构一致性和时间同步性。
Comments Accepted by ACMMM 2026
GhostPrompt:视觉语言模型的跨图像对抗性提示
AI总结 研究视觉语言模型对抗攻击问题,提出GhostPrompt方法,通过联合优化提炼图像不变对抗特征,跨图像引导模型输出,相比现有基线攻击成功率显著提高且计算时间大幅减少。
Comments Accepted to ACM MM 2026. Code: this https://github.com/Ye-ze-yu/GhostPrompt
开放词汇注视对象预测:基准与方法
机构 * Xi’an University of Architecture and Technology(西安建筑科技大学) ; DAMO Academy, Alibaba Group(阿里巴巴达摩院) ; Zhejiang University(浙江大学)
AI总结 研究注视对象预测问题,提出基于文本驱动对象发现和注视引导选择模块的框架,并引入梯度信息选择调整,构建含86个自然类别的基准,所提模型在开放和封闭词汇设置中均表现出色。
Comments Accepted at ACM Multimedia 2026
超越噪声信号:用于多模态序列推荐的双层去噪
AI总结 研究多模态序列推荐中的双重噪声困境,提出DDMSR框架,从特征拓扑和序列频率角度净化信号,设计基于图的特征去噪与频域序列去噪模块,纳入多模态对比对齐目标,实验证明该框架性能优于基线。
Comments Accepted by ACM MM 2026. 12 Pages
在不断演变的领域上进行连续视频 - MLLM 适应
机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) ; Hong Kong Polytechnic University(香港理工大学) ; The University of Southern Queensland(南昆士兰大学)
AI总结 研究视频多模态大语言模型对不断演变领域的适应问题,提出分布感知专家路由框架 DAER,通过保持领域隔离的轻量级专家、引入多种路由和优化机制,在域增量基准上评估,结果优于现有方法。
Comments Accepted to ACM MM 2026
AdvNav:视觉语言导航中基于行为引导的黑盒对抗攻击
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
AI总结 研究视觉语言导航系统对抗攻击,提出AdvNav框架,利用双粒度行为反馈构建替代目标,采用混合优化策略。在R2R数据集上评估,对两种模型取得较高攻击成功率,证明其有效性与通用性,揭示感知漏洞并为VLN模型设计提供见解。
Comments ACM International Conference on Multimedia 2026
SEE:用于长视野GUI代理轨迹合成的结构感知探索与利用
机构 * Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) ; Harbin Institute of Technology (Weihai) Qingdao Research Institute(哈尔滨工业大学(威海)青岛研究院)
AI总结 针对GUI代理轨迹合成中缺乏高覆盖率长视野轨迹的问题,提出SEE两阶段数据合成框架,通过高效探索和基于图的合成,产生可重复可解释数据,避免虚假循环,提升代理任务成功率和泛化能力,还将发布代码和数据集。
Comments Accepted by ACM International Conference on Multimedia 2026 (ACM MM 2026)
用于高效基于高斯的图像表示的局部感知密度控制
机构 * Shenzhen University(深圳大学) ; Pengcheng Laboratory(鹏城实验室) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
AI总结 研究二维高斯喷溅图像表示中高斯容量分配低效问题,提出局部感知密度控制框架LocoADC,通过区域高斯致密化和相似性驱动高斯合并策略及局部颜色一致性约束,有效提升高斯容量利用率,改进图像表示。
Comments Accepted by ACMMM 2026
为了融入,首先解耦:通过上下文解耦表示重新思考伪装图像生成
机构 * Beihang University(北京航空航天大学) ; Geely Automobile Research Institute (Ningbo) Co., Ltd(吉利汽车研究院(宁波)有限公司)
AI总结 研究伪装图像生成问题,提出上下文解耦生成范式CamoDreamer,通过设计对比感知上下文桥等方法,将潜在伪装特征解耦为物体和背景控制流,实验证明其显著优于现有方法且设计轻量。
Comments 14 pages, 11 figures, ACMMM 2026
迈向基于位置感知的混合现实艺术展览:一种基于同步定位与地图构建的用于空间连贯性和展览体验的部署流程
AI总结 本文针对现有MR展览系统在大规模实际实施方面指导有限的问题,提出基于SLAM技术的实用部署流程,先试点比较方法,再开发并评估流程,发现空间对齐对多方面有影响,为MR艺术展览部署提供实证参考。
Comments Proceedings of the 34th ACM International Conference on Multimedia
DepthART:将基础单目深度模型扩展到小型模型
机构 * University of Trento(特伦托大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Tsinghua University(清华大学)
AI总结 研究旨在将基础单目深度模型扩展到小型模型,核心方法是结合抗偏差数据采样与相机条件微调策略的DepthART,主要贡献是在多数据集上取得更好的零样本泛化和度量精度,还提供了可扩展模型家族。
Comments Accepted in ACM Multimedia 2026 ; Code: https://github.com/xuefeng-cvr/DepthART ; Project page: https://xuefeng-cvr.github.io/DepthART ;
当物理偏好遇到语义约束:用于文本到视频生成的物理和语义直接偏好优化
机构 * University of Nevada, Reno(内华达大学雷诺分校) ; Zhejiang University(浙江大学)
AI总结 文本到视频生成模型存在物理合理性与语义一致性的矛盾,提出物理和语义直接偏好优化方法(PSDPO),通过调节偏好对贡献,限制语义漂移,实现更可靠平衡,实验验证其在提高物理合理性和保持语义一致性上优于基线和现有方法。
Comments This work is accepted by ACM MM 2026
回答前看清楚:通过显著性驱动的感知重新对齐减轻LVLMs中的幻觉
机构 * Xidian University(西安电子科技大学) ; Tsinghua University(清华大学) ; Shanghai Road Transport Development Center(上海市道路运输发展中心) ; Hunan Institute of Advanced Technology(湖南先进技术研究院)
AI总结 研究针对LVLMs易产生幻觉问题,提出无需训练的SDPR框架,通过显著性驱动注意力重新分配、缓存对齐及先验约束对比解码,整体对齐视觉意识,在多基准测试中优于现有方法,无需额外训练且开销小。
Comments Accepted by ACM Multimedia 2026
约束锚定推理轨迹
机构 * University of Oxford(牛津大学)
AI总结 研究自回归多模态大语言模型错误滚雪球问题,提出神经符号框架CART,将自然语言推理与符号约束断言交织,经双管齐下的模块验证约束,防止错误传播,在多基准测试中降低滚雪球率、提高准确率并控制推理开销。
Comments 15 pages, ACM MM 2026
DORS:用于密集场景中基于扩散的目标移除的动态注意力路由
机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院)
AI总结 针对密集场景目标移除中因语义干扰致移除不完整的问题,提出基于动态注意力路由机制的DORS框架,含实例过滤注意力和上下文引导路由组件,经实验验证其性能优于现有方法。
Comments 16 pages, 10 figures, to appear in ACM Multimedia 2026
执行前澄清:用于解决3D工具编排中意图不对称的自进化智能体
AI总结 研究3D资产创建中用户指令模糊与工具要求精确的意图不对称问题,提出自进化智能体CLARE,通过解耦生成管道、模拟多轮交互自我进化澄清策略,在新基准测试中取得领先性能,证明主动澄清对3D执行的关键作用。
Comments Accepted to ACM Multimedia 2026 (ACM MM 2026). 26 pages including appendix, 8 figures. Code: https://github.com/xyzhu1225/CLARE
GMoT:用于基于多模态大语言模型的细粒度微手势视频推理的门控运动感知令牌化
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Great Bay University(大湾区大学) ; Dongguan Key Laboratory for Intelligence and Information Technology(东莞市智能信息技术重点实验室)
AI总结 研究针对微手势识别中运动易被掩盖及MLLMs处理运动学困难的问题,提出GMoT模块,通过空间加权池等提取运动线索并融合,引入渐进奖励引导策略优化范式,在多数据集上表现出色,还提出BRG召回及跨域转移协议。
Comments Accepted to ACM MM 2026