arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

2026-07-31 至 2026-07-31 共收录 9
2607.28580 2026-07-31 cs.AI 新提交

DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation

DualG-MRAG:面向多模态检索增强生成的宏观推理与微观匹配解耦框架

Jiacheng Tao, Qingyun Sun, Haonan Yuan, Ziwei Zhang, Jianxin Li

机构 * Beihang University(北京航空航天大学) SKLCCSE

AI总结 针对多模态RAG在复杂多跳推理中存在的问题,本文提出DualG-MRAG框架,通过解耦宏观推理与微观匹配抑制检索噪声,经实验验证其在证据召回和问答准确率上优于基线。

Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026). 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28285 2026-07-31 cs.CV 新提交

Beyond Visual Ambiguity: Guiding Robust Monocular Depth Estimation in Challenging Scenarios via Detailed Long Captions

超越视觉歧义:通过详细长文本引导具有挑战性场景下的鲁棒单目深度估计

Junrui Zhang, Jiaqi Li, Yiran Wang, Liao Shen, Zhiguo Cao

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

AI总结 该研究针对单目深度估计的视觉歧义问题,提出CapDepth框架,通过详细长文本引导,在非朗伯表面和恶劣天气下的深度误差较现有最优方法分别降低25.0%和22.0%。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27761 2026-07-31 cs.LG cs.CV 新提交

DAS-PMVC: A Framework for Partial Multi-View Clustering via Dual Alignment and Structure Enhancement

DAS-PMVC:一种通过双对齐与结构增强实现的部分多视图聚类框架

Shubin Ma, Liang Zhao, Chuanye He, Zhenjiao Liu, Liang Zou, Lin Yuanbo Wu, Yu Shao

机构 * Dalian University of Technology(大连理工大学) Inspur Group Co., Ltd.(浪潮集团有限公司) China University of Mining and Technology(中国矿业大学) The University of Warwick(华威大学)

AI总结 该研究针对多视图聚类中的部分视图对齐问题,提出DAS-PMVC框架,通过锚点图结构对齐、结构增强特征学习与双对齐策略提升性能,在多数据集上优于现有最先进方法。

Comments 8 pages, 4 figures. Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27699 2026-07-31 cs.CV cs.AI 新提交

RefineSVG: Visual Feedback-Driven Reinforcement Learning for Image-to-SVG Generation

RefineSVG:视觉反馈驱动的图像转SVG生成强化学习

Shaobo Liu, Feiqiao Mao, Shuaishuai Zhou, Yan Zhan, Weiqi Tan, Zhiqiong Lu, Zhengping Liang

机构 * Shenzhen University(深圳大学) Peking University(北京大学)

AI总结 RefineSVG是一种视觉反馈驱动的闭环框架,通过引入SVG语义词汇表和渐进式训练,使MLLM实现高保真图像转SVG生成,性能优于现有基线。

Comments 17 pages, 5 main-paper figures. Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026). Includes the complete supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27620 2026-07-31 cs.CV 新提交

MedXplore: Towards Reliable and Unbiased Generalized Category Discovery in Medical Imaging

MedXplore:面向医学成像中可靠且无偏的广义类别发现

Jianwei He, Kailin Lyu, Junhao Dong, Long Xiao, Wenjie Hou, Jingze Lu, Di Wu, Lin Shu, Jie Hao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanyang Technological University(南洋理工大学)

AI总结 针对医学成像中广义类别发现存在的旧类偏差问题,提出MedXplore框架,通过FAAC与ACAM模块优化表征学习,在多基准上实现准确率提升且旧类误报率显著降低。

Comments accepted by ACM MM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20290 2026-07-31 cs.GR cs.CV 版本更新

PhysOmni: Physics-Grounded Multi-Object Scene Generation from a Single Image with Real-Time Interaction

TelePhysics: 从单张图像生成物理一致的多物体场景 with 实时交互

Xin Zhang, Yabo Chen, Yijie Fang, Wanying Qu, Haibin Huang, Chi Zhang, Feng Xu, Xuelong Li

机构 * Fudan University(复旦大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI))

AI总结 本文提出TelePhysics,一种无需训练的框架,通过整体场景级3D重建将单张图像转换为物理一致且可控的视频。该方法通过统一的空间坐标系统表示完整场景几何,解决物体穿透和对齐模糊问题,实现准确的多物体交互和更丰富的复杂控制类型,从而在保持逼真视觉保真度的同时实现实时物理交互预览。

Comments ACMMM 2026. Project page: https://physomni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14534 2026-07-31 cs.CV cs.AI cs.MM 版本更新

PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media

PROVE:一种用于视觉媒体的感知移除一致性基准

Fuhao Li, Shaofeng You, Jiagao Hu, Yu Liu, Yuxuan Chen, Zepeng Wang, Fei Wang, Daiguo Zhou, Jian Luan

机构 * MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

AI总结 本文提出RC指标和PROVE-Bench基准,通过滑动窗口特征比较和分布跟踪提升图像和视频移除任务的评估精度,实现更符合人类感知的一致性衡量。

Comments Accepted by ACMMM 2026. Project Page: https://xiaomi-research.github.io/prove/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09454 2026-07-31 cs.CR

ShapeMark: Robust and Diversity-Preserving Watermarking for Diffusion Models

ShapeMark: 用于扩散模型的鲁棒且保持多样性水印技术

Yuqi Qian, Yun Cao, Haocheng Fu, Meiyang Lv, Meineng Zhu

AI总结 ShapeMark通过将水印编码到结构化噪声模式中,提高了扩散模型的鲁棒性和生成多样性,实现了在多种有损场景下的高质量生成。

Journal ref In Proceedings of the 34th ACM International Conference on Multimedia (MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05113 2026-07-31 cs.MM cs.CR cs.LG 版本更新

CLIP-Guided Backdoor Defense through Entropy-Based Poisoned Dataset Separation

基于CLIP的后门防御:通过基于熵的中毒数据集分离

Binyan Xu, Fan Yang, Xilin Dai, Di Tang, Kehuan Zhang

机构 * The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Sun Yat-sen University(中山大学)

AI总结 该研究提出CLIP引导后门防御(CGD),用CLIP分离干净与中毒输入,重训练模型中和后门,在4个数据集11种攻击上ASR降至1%以下,CA降幅仅0.3%,适配性与鲁棒性优异。

Comments 15 pages, 9 figures, 15 tables. To appear in the Proceedings of the 32nd ACM International Conference on Multimedia (MM '25)

详情

展开后加载摘要…

URL PDF HTML 收藏