arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

2026-07-31 至 2026-07-31 共收录 3
2605.20290 2026-07-31 cs.GR cs.CV 版本更新

PhysOmni: Physics-Grounded Multi-Object Scene Generation from a Single Image with Real-Time Interaction

TelePhysics: 从单张图像生成物理一致的多物体场景 with 实时交互

Xin Zhang, Yabo Chen, Yijie Fang, Wanying Qu, Haibin Huang, Chi Zhang, Feng Xu, Xuelong Li

机构 * Fudan University(复旦大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI))

AI总结 本文提出TelePhysics,一种无需训练的框架,通过整体场景级3D重建将单张图像转换为物理一致且可控的视频。该方法通过统一的空间坐标系统表示完整场景几何,解决物体穿透和对齐模糊问题,实现准确的多物体交互和更丰富的复杂控制类型,从而在保持逼真视觉保真度的同时实现实时物理交互预览。

Comments ACMMM 2026. Project page: https://physomni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14534 2026-07-31 cs.CV cs.AI cs.MM 版本更新

PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media

PROVE:一种用于视觉媒体的感知移除一致性基准

Fuhao Li, Shaofeng You, Jiagao Hu, Yu Liu, Yuxuan Chen, Zepeng Wang, Fei Wang, Daiguo Zhou, Jian Luan

机构 * MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

AI总结 本文提出RC指标和PROVE-Bench基准,通过滑动窗口特征比较和分布跟踪提升图像和视频移除任务的评估精度,实现更符合人类感知的一致性衡量。

Comments Accepted by ACMMM 2026. Project Page: https://xiaomi-research.github.io/prove/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05113 2026-07-31 cs.MM cs.CR cs.LG 版本更新

CLIP-Guided Backdoor Defense through Entropy-Based Poisoned Dataset Separation

基于CLIP的后门防御:通过基于熵的中毒数据集分离

Binyan Xu, Fan Yang, Xilin Dai, Di Tang, Kehuan Zhang

机构 * The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Sun Yat-sen University(中山大学)

AI总结 该研究提出CLIP引导后门防御(CGD),用CLIP分离干净与中毒输入,重训练模型中和后门,在4个数据集11种攻击上ASR降至1%以下,CA降幅仅0.3%,适配性与鲁棒性优异。

Comments 15 pages, 9 figures, 15 tables. To appear in the Proceedings of the 32nd ACM International Conference on Multimedia (MM '25)

详情

展开后加载摘要…

URL PDF HTML 收藏