arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

2026-08-11 至 2026-08-11 收录 26
2608.09564 2026-08-11 cs.CV cs.AI 新提交

From Semantic Grounding to Decision Optimization: A Unified Framework for Long-Horizon UAV Vision-Language Navigation

从语义接地到决策优化:面向长 horizon 无人机视觉语言导航的统一框架

Zeyuan Ma, Jiaxin Chen, Di Huang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

AI总结 本文针对无人机视觉语言导航的现有问题,提出统一语义到决策框架,经实验在AerialVLN和OpenFly基准上达到SOTA性能。

Comments 10 pages, 5 figures. Accepted at ACM Multimedia 2026 (MM '26)

URL PDF HTML 收藏
2608.09373 2026-08-11 cs.CV 新提交

Preserve More Details: Mitigating Content Drift in Real-World Image Super-Resolution

保留更多细节:缓解真实世界图像超分辨率中的内容漂移

Chunxiao Liu, Wei Liu, Anbin Xiong, Erli Meng

机构 * Xiaomi Corporation(小米公司)

AI总结 针对真实世界图像超分辨率中因低质量输入导致的内容漂移问题,提出双路径架构的新型单步扩散模型FSP-Diff,在标准基准上优于现有单步扩散方法。

Comments Accepted to ACM MM 2026. This is the author's accepted version. The definitive version is published in the Proceedings of ACM MM 2026

URL PDF HTML 收藏
2608.09322 2026-08-11 cs.CV 新提交

Diffusion Image Editing via Asynchronous Token Decoding

基于异步令牌解码的扩散图像编辑

Yang Shi, Liangsi Lu, Minzhe Guo, Yifeng Xie, Yanhui Chen, Jingchao Wang, Xuhang Chen

机构 * Guangdong University of Technology(广东工业大学) Hong Kong Baptist University(香港浸会大学) Peking University(北京大学) Huizhou University(惠州学院)

AI总结 针对文本引导扩散图像编辑的全局漂移问题,提出推理时框架ATDEdit,通过逐令牌条件意外度估计可编辑位置,在PIE-Bench上实现最优保留指标且语义对齐性具竞争力。

Comments Accepted by ACMMM 2026

URL PDF HTML 收藏
2608.09270 2026-08-11 cs.CV cs.AI cs.IR cs.MM 新提交

GRASP: Granularity-Aware Region Alignment and Semantic Prototype Learning for Fine-Grained Cross-Modal Understanding in Drone Views

GRASP:面向无人机视角细粒度跨模态理解的粒度感知区域对齐与语义原型学习

Jiahui Cui, Yan Zhao, Kan Wei, Enze Zhu, Peirong Zhang, Lei Wang, Yiru Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)

AI总结 针对无人机视角细粒度跨模态理解的背景杂波干扰与视觉同构歧义问题,提出GRASP框架,通过RFA和SPEM策略提升性能,在相关基准数据集上验证了有效性。

Comments Accepted at the 34th ACM International Conference on Multimedia (ACM Multimedia 2026, MM '26). 10 pages, 6 figures

URL PDF HTML 收藏
2608.09189 2026-08-11 cs.CL 新提交

EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models

EmoS:用于评估和对齐口语语言模型中情商的基于理论的框架

Junyu Wang, Siyuan Zhang, Peiyuan Jiang, Jian Zong, Jingyu Zhang, Tianrui Wang, Yuqin Lin, Zhenghui Chen, Shuqing Xie, Ziyang Ma, Meng Ge, Xiaobao Wang, Longbiao Wang, Jianwu Dang

AI总结 本研究针对口语语言模型情商评估缺乏理论框架的问题,构建了EmoSBench基准,开发了基于SFT和GRPO优化的EmoS评估模型,其在EmoSBench上准确率达83.8%,接近人类水平。

Comments Accepted at ACM Multimedia 2026 (MM '26)

URL PDF HTML 收藏
2608.09152 2026-08-11 cs.CV 新提交

LightAIR: Lightweight Action Inversion and Riemannian Rectification for Text-based Person Anomaly Search

LightAIR:用于基于文本的行人异常搜索的轻量型动作逆转换与黎曼校正

Yulun Zhang, Zixu Li, Zhiwei Chen, Zhiheng Fu, Wenbo Wang, Zihang Qiu, Zhilin Wang, Ruxin Wang, Yupeng Hu

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Shandong University(山东大学)

AI总结 针对现有基于文本的行人异常搜索方法的缺陷,提出LightAIR网络,通过动作逆转换、正交零空间投影与黎曼梯度校正实现外观与动作特征解耦,在TPAS和TIPR数据集上性能优于现有SOTA方法

Comments Accepted by ACM MM 2026

URL PDF HTML 收藏
2608.09098 2026-08-11 cs.RO 新提交

UnsDrive: Towards Robust End-to-End Autonomous Driving in Unstructured Scenes

UnsDrive:面向非结构化场景的鲁棒端到端自动驾驶

Nanxin Zeng, Ruiqi Song, Xiangyu Guo, Baiyong Ding, Yunfeng Ai

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Waytous Inc.(文远知行公司)

AI总结 针对非结构化采矿环境自动驾驶泛化差的问题,提出UnsDrive规划器,结合未知感知占用表示与流匹配规划器,引入专用损失和评分器,辅以MineLoop模拟器验证,性能优于基线。

Comments 9 pages, 4 figures, conference

Journal ref the 34th ACM International Conference on Multimedia, 2026

URL PDF HTML 收藏
2608.09097 2026-08-11 cs.CV 新提交

SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision

SI-Edit:面向草图-指令引导的像素级精度局部图像编辑

Weixin Ye, Wei Wang, Hongguang Zhu, Xuecheng Nie

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所) City University of Macau(澳门城市大学) Meitu Inc(美图公司)

AI总结 针对基于草图的图像编辑缺乏像素级精度及对应数据集、评估指标的问题,提出SI-Edit框架,构建SI-Data数据集并建立评估指标,实现更可靠的结构控制与像素级局部编辑效果。

Comments accepted by ACM MM 2026

URL PDF HTML 收藏
2608.08523 2026-08-11 cs.AI 新提交

Discovering Diverse Planning Policies for Multimodal Embodied Agents with Quality-Diversity Optimization

用质量多样性优化发现多模态具身智能体的多样化规划策略

Pengfei Xu, Yong Liu, Xiaoya Nan, Qiang Yang, Peilan Xu

机构 * School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院)

AI总结 针对多模态具身智能体现有规划器易因单一规划风格失效导致停滞的问题,提出质量多样性框架,通过进化策略模板构建多样化策略库,实现自适应规划与故障恢复,在ThreeDWorld基准上提升了任务成功率与交互效率。

Comments To appear in ACM MM (MM '26)

URL PDF HTML 收藏
2608.08508 2026-08-11 cs.CV 新提交

Towards Adaptive Super-Resolution and Quality Assessment via Test-Time Adaptation

面向自适应超分辨率与质量评估的测试时适应方法

Ajeet Kumar Verma

机构 * Indian Institute of Technology Jammu(贾姆穆印度理工学院)

AI总结 该研究针对真实场景下VSR泛化不足的问题,提出基于TTA的无参考VQA框架、Transformer屏幕内容超分辨率架构及区域感知TTA策略,在多基准上实现感知质量与可读性的提升。

Comments 5 pages, 5 figures, 4 tables, 34th ACM International Conference on Multimedia, Accepted as Doctoral Symposium Track

URL PDF HTML 收藏
2608.08219 2026-08-11 cs.CV cs.AI 新提交

VTO: Visual Tool Orchestration for Video Anomaly Detection

VTO:面向视频异常检测的可视化工具编排

Rui Wang, Yeteng Wu, Xianling Zhang, Mengshi Qi

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学) School of Digital Media & Design Art(数字媒体与设计艺术学院)

AI总结 针对视频异常检测中传统方法泛化差、多模态智能体工具编排难的问题,提出过程监督强化学习框架VTO,结合VAD-Tool工具集,在工具调度上较基线提升10.2%。

Comments Accepted by ACM MM 2026

URL PDF HTML 收藏
2608.08147 2026-08-11 cs.MM 新提交

SAMOT: State-Aware Step Modulation and Optimal Transport Matching for Audio-Visual Instance Segmentation

SAMOT:面向视听实例分割的状态感知步长调制与最优传输匹配

Kai Peng, Yunzhe Shen, Miao Zhang, Leiye Liu, Wei Ji, Jingjing Li, Yongri Piao, Huchuan Lu

AI总结 针对AVIS的模态状态变化干扰与跨模态分布差异问题,提出含ADSM与OT-MM的SAMOT框架,在AVIS基准取得最优性能。

Comments Accepted by ACM MM 2026

URL PDF HTML 收藏
2608.08066 2026-08-11 cs.CV eess.IV 新提交

EvBS: Event-guided Blur Synthesis for Domain-adaptive Motion Deblurring

EvBS:用于域自适应运动去模糊的事件引导模糊合成

Junsik Jung, Seokryun Choi, Yoonki Cho, Woo Jae Kim, Andrew Jeong, Sung-Eui Yoon

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 本文提出事件引导模糊合成框架EvBS,通过解耦运动与内容生成多样训练对,提升预训练去模糊模型的域自适应性能,经多基准实验验证其可增强模型在未见测试集上的鲁棒性。

Comments Accepted to ACM Multimedia 2026 (ACM MM 2026)

URL PDF HTML 收藏
2608.08009 2026-08-11 cs.CV cs.AI 新提交

Evidence-Grounded Forensic Reasoning for Detecting and Grounding Multi-Modal Media Manipulation

基于证据的取证推理:检测与定位多模态媒体篡改

Yichun Yeh, Yiheng Li, Xiaobo Hu, Zhen Lei, Yang Yang

AI总结 本文针对多模态媒体篡改检测与定位问题,提出基于证据的取证推理框架,结合锚定-验证推理链、可验证奖励系统与模态解耦优势路由机制,实现最优性能与可解释性的统一。

Comments accepted by ACM MM 2026

URL PDF HTML 收藏
2608.07959 2026-08-11 cs.AI 新提交

SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning

SCOUT:面向超长时长自我中心视频推理的自检查与恢复感知工具思维智能体

Keyang Zhong, Kuo Wang, Peng Liu, Quanlong Zheng, Junlin Xie, Zhijia Liang, Yanhao Zhang, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Shenzhen Loop Area Institute(深圳河套学院) Guangdong OPPO Mobile Telecommunications Corp., Ltd.(广东欧珀移动通信有限公司) OPPO AI Center(OPPO人工智能中心) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本研究提出SCOUT智能体框架,结合自适应策略与UPS-GRPO方法,解决超长自我中心视频推理的错误传播及信用分配问题,在对应基准上达最优性能且短时长场景仍具竞争力。

Comments Accepted by ACM Multimedia 2026 (MM '26)

URL PDF HTML 收藏
2608.07932 2026-08-11 cs.CV 新提交

SportsGrounder: Proposal-Aided Interleaved Grounding for Dense Sports Video Reasoning

SportsGrounder:用于密集体育视频推理的提案辅助交错定位框架

Yizhi Li, Jiawei Jiang, Guanhong Wang, Yingcai Wu, Gaoang Wang

机构 * Zhejiang University(浙江大学) Beijing Jiaotong University(北京交通大学)

AI总结 针对LMMs难以处理密集体育视频细粒度推理的问题,提出SportsGrounder框架,结合IGF机制与AAS模块,在SoccerNet等数据集上实现最优准确率。

Comments ACMMM 2026

URL PDF HTML 收藏
2608.05137 2026-08-11 cs.CV 版本更新

SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding

SmartMage:面向3D场景理解的动态模态编排

Yue Zhang, Yingzhao Jian, Yunqiu Xu, Xiaoxiao Sun, Hehe Fan

机构 * Zhejiang University(浙江大学) Stanford University(斯坦福大学)

AI总结 本文针对现有MLLMs采用固定模态组合的缺陷,提出SmartMage模型,通过SMART和MAGE模块动态编排模态,在5个3D场景理解基准上取得最优性能,在RGB视频理解基准上表现具竞争力。

Comments Accepted to ACM MM 2026

URL PDF HTML 收藏
2608.00536 2026-08-11 cs.CV 版本更新

DocPO: Advancing Document Policy Optimization via Tailored Step-Aware Rewards

DocPO:通过定制化的步骤感知奖励推进文档策略优化

Yunhao Wang, Binghong Wu, Zhenyu Huang, Jiacheng Shi, Shuo Huang, Tinghao Yu, Feng Zhang

机构 * Tencent Hunyuan(腾讯混元)

AI总结 本研究针对文档解析强化学习中奖励区分度不足的问题,提出 Step-Aware Annealing 机制,构建 DocPO 框架并在 OmniDocBench 等数据集上验证了其对 GRPO 式 RL 的性能提升效果。

Comments 14 pages. Accepted to the 34th ACM International Conference on Multimedia (ACM Multimedia 2026). Yunhao Wang and Binghong Wu contributed equally. Updated to the final camera-ready version with supplementary material

URL PDF HTML 收藏
2607.24721 2026-08-11 cs.CV 版本更新

DreamStyle3D: Efficient 3D Stylized Asset Generation via Dual-Attention Disentanglement

DreamStyle3D:通过双注意力解缠实现高效3D风格化资产生成

Kai Wang, Ziheng Ouyang, Xuying Zhang, Ming-Ming Cheng, Qibin Hou

机构 * VCIP, Nankai University(视觉计算与图像处理实验室,南开大学) JD Explore Academy(京东探索研究院) AAIS, Nankai University(人工智能学院,南开大学)

AI总结 针对高效生成风格化3D资产的需求,DreamStyle3D基于解耦双交叉注意力机制,明确分离几何与风格特征,采用轻量级训练策略,构建数据集和数据管道,能在10秒内生成高质量、几何一致的风格化3D资产,提升了效率并为3D创作提供新方案。

Comments ACM MM 2026; Project Page:https://nkwangk.github.io/project/DreamStyle3D/

URL PDF HTML 收藏
2604.26519 2026-08-11 cs.CV 版本更新

GIFGuard: Proactive Forensics against Deepfakes in Facial GIFs via Spatiotemporal Watermarking

GIFGuard:通过时空水印实现面向面部GIF的主动取证对抗深度伪造

Shupeng Che, Zhiqing Guo, Changtao Miao, Dan Ma, Gaobo Yang

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)

AI总结 本文提出GIFGuard,首个针对GIF中深度伪造的时空水印框架,通过STARE和DIRD实现高鲁棒性取证,构建GIFfaces基准数据集以促进研究。

Comments Accepted by ACM MM 2026

URL PDF HTML 收藏
2604.23957 2026-08-11 cs.CV 版本更新

LAVA: Layered Audio-Visual Anti-tampering Watermarking for Robust Deepfake Detection and Localization

LAVA:分层音频视觉抗篡改水印用于鲁棒深度伪造检测与定位

Bokang Zeng, Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang

机构 * School of Computer Science and Engineering(计算机科学与工程学院) UNSW Sydney(新南威尔士大学悉尼分校) School of Information and Communication Technology(信息与通信技术学院) Griffith University(格里菲斯大学)

AI总结 LAVA通过跨模态水印融合与校准感知对齐,提升深度伪造篡改检测与定位的鲁棒性,实验表明其检测性能接近完美,抗压缩与多模态错位能力强。

Comments Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026)

URL PDF HTML 收藏
2604.03919 2026-08-11 cs.CV cs.AI 版本更新

Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders

通过时空稀疏自编码器解释视频表示

Atahan Dokme, Sriram Vishwanath

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文系统研究了稀疏自编码器在视频表示中的应用,提出时空对比目标和Matryoshka分组方法,提升时间一致性并改进动作分类和文本-视频检索性能。

Comments 9 pages, 3 figures. Camera-ready version, ACM Multimedia 2026 (MM '26)

Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), 2026

URL PDF HTML 收藏
2512.11534 2026-08-11 cs.CV cs.CL cs.MM 版本更新

HFS: Holistic Query-Aware Frame Selection for Efficient Video Understanding

HFS: 为高效视频推理的全局查询感知帧选择

Yiqing Yang, Yun Li, Daiqing Qi, Lehan Yang, Tianlong Wang, Wenhao Zhang, Sheng Li, Kin-man Lam

机构 * The Hong Kong Polytechnic University(香港理工大学)

AI总结 HFS提出一种端到端可训练的帧选择框架,通过任务自适应方法提升视频推理效率。

Comments Accepted to the Main Track of ACM Multimedia 2026 (ACM MM '26)

URL PDF HTML 收藏
2510.16598 2026-08-11 cs.CV 版本更新

VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs

VisionSelector:用于高效多模态大语言模型的端到端可学习视觉令牌压缩

Jiaying Zhu, Yurui Zhu, Xin Lu, Wenrui Yan, Dong Li, Kunlin Liu, Xueyang Fu, Zheng-Jun Zha

AI总结 针对多模态大语言模型的视觉令牌压缩瓶颈,提出端到端可学习的VisionSelector框架,通过可微Top-K与课程退火策略实现高效自适应令牌选择,在压缩时保持优异性能并提升预填充速度。

Comments Accepted by ACM Multimedia 2026

URL PDF HTML 收藏
2508.04224 2026-08-11 cs.CV 版本更新

SplitGaussian: Reconstructing Dynamic Scenes via Visual Geometry Decomposition

SplitGaussian:通过视觉几何分解重建动态场景

Lechao Cheng, Jiahui Li, Jingxuan He, Shengeng Tang, Gang Huang, Tianrui Hui, Yaxiong Wang, Zhun Zhong

AI总结 SplitGaussian将场景表示分解为静态与动态分量,解耦运动建模与背景几何,提升动态场景重建的时间一致性、保真度与收敛速度,性能优于现有SOTA方法。

Comments version 2. Accepted By ACM MM 2026

URL PDF HTML 收藏
2505.18469 2026-08-11 cs.CV 版本更新

HonestFace: Towards Honest Face Restoration with One-Step Diffusion Model

HonestFace:基于单步扩散模型的诚实人脸复原方法

Jingkai Wang, Wu Miao, Jue Gong, Zheng Chen, Xing Liu, Hong Gu, Yutong Liu, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

AI总结 本研究提出基于单步扩散模型的HonestFace人脸复原方法,通过身份嵌入器、掩码人脸对齐等组件构建新数据集MultiRefCeleb-Test,其性能优于现有最优方法。

Comments Published at ACM MM 2026

URL PDF HTML 收藏