arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

共收录 2047
2609.11514 2026-09-11 cs.CV 新提交

Prototype Matters: Modality-unified Prototype Self-distillation for Unsupervised Visible-infrared Person Re-identification

原型至关重要:面向无监督可见光-红外行人重识别的模态统一原型自蒸馏

Menglin Wang, Xiaojin Gong

机构 * Nanjing Normal University(南京师范大学) Zhejiang University(浙江大学)

AI总结 本文提出模态统一原型自蒸馏框架,通过联合优化模态内外相似性并利用自原型蒸馏,解决无监督可见光-红外行人重识别的跨模态关联问题。

Comments ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10338 2026-09-10 cs.SD cs.HC cs.LG cs.MM 新提交

TimeCues Studio: A Workspace for Music Annotation and Algorithm Prototyping

TimeCues Studio:一个用于音乐标注与算法原型开发的工作空间

Sapir Caduri, Yoav Goldberg

机构 * Bar-Ilan University(巴伊兰大学)

AI总结 TimeCues Studio是一个开源工作空间,支持团队对音乐语料库进行歧义感知标注、比较检测算法并原型化新算法,通过统一时间线集成标注与开发,采用MIT许可并支持Docker Compose部署。

Comments 8 pages, 2 figures, to appear in Proceedings of the 34th ACM International Conference on Multimedia (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10261 2026-09-10 cs.CV 新提交

When Fusion Fails: Corruption-Aware Rebalanced Fusion for Multi-Modal Medical Image Segmentation

当融合失败时:面向多模态医学图像分割的腐败感知再平衡融合

Yuchen Pei, Xiaoyu Hu, Yixiong Zou, Dingwen Hu, Hui Chu, Yutao Ma, Shijun Qiu, Gang Li

机构 * Central China Normal University(华中师范大学) Huazhong University of Science and Technology(华中科技大学) Guangzhou University of Chinese Medicine(广州中医药大学) The First Affiliated Hospital of Guangzhou University of Chinese Medicine(广州中医药大学第一附属医院) University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 针对多模态医学图像分割中质量差异导致融合失败的问题,提出腐败感知再平衡融合框架CoReFuse-Med,抑制特征腐败并再平衡模态贡献,实验验证了其有效性。

Comments Accepted by ACM Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09909 2026-09-10 cs.CV cs.MM 新提交

Interpreting Object-Dependent Concept Brittleness in Text-to-Image Diffusion Models

解释文本到图像扩散模型中对象依赖的概念脆弱性

Yifan Yuan, Xiangyu Liu, Hongming Shan, Yu Han, Yu Jiang, Hao Tan, Junping Zhang, Linlin Shen

机构 * Shenzhen University(深圳大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学)

AI总结 针对文本到图像扩散模型中对象依赖的概念脆弱性,提出基于稀疏自编码器空间去噪轨迹分析的审计与推理时修正框架,通过原型插值显著提升概念一致性、文本保真度和修复成功率。

Comments Accepted at ACM MM 2026. 27 pages, 17 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.09728 2026-09-10 cs.LG cs.MM q-bio.NC 新提交

EEGBind: Detecting Source-Level Interictal Epileptiform Discharges via EEG-Centric Multimodal Binding

EEGBind:通过以脑电为中心的多模态绑定检测源级发作间期癫痫样放电

Muchen Li, Anglin Liu, Xuetian Gao, Ruijian Xu, Jintai Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Ringgee Smart Technologies Co., Ltd.(瑞捷智能科技有限公司)

AI总结 EEGBind提出以脑电为中心的多模态绑定框架,利用视频上下文辅助进行五类源级IED分类,在基准上取得加权F1 0.8395的领先性能。

Comments 7 pages, 5 figures. Accepted to the 34th ACM International Conference on Multimedia (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04867 2026-09-10 cs.MM cs.AI cs.SD 版本更新

PRISM-Bench: An Audio-Centric Diagnostic Benchmark for Text-to-Audio-Video Generation

PRISM-Bench:面向文本生成音视频的以音频为核心的诊断基准

Yuchen Sun, Qian Yang, Jun Wang, Detai Xin, Guoqiao Yu, Guanglu Wan, Qi Jia

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Meituan(美团)

AI总结 PRISM-Bench作为首个以音频为核心的T2AV诊断基准,通过多维度评估揭示了前沿与开源T2AV模型的性能差距,指出当前模型在复杂音频关联控制任务上的不足。

Comments 19 pages, 10 figures, 4 tables. Accepted at ACM Multimedia 2026 (MM '26). This arXiv version includes supplementary appendices not included in the conference proceedings version

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.08221 2026-09-09 cs.CV cs.MM 新提交

SoftRerank: Hierarchical Soft Fusion with Candidate-Label Reranking for Long-Tailed Micro-Action Recognition

SoftRerank:面向长尾微动作识别的候选标签重排序分层软融合方法

Yichi Zhang, Zhichao Xia, Yanjun Chi, Lingsi Zhu, Yuefeng Zou, Jun Yu, Qingsong Liu, Jianqing Sun, Shengping Liu

机构 * University of Science and Technology of China(中国科学技术大学) Unisound AI Technology Co., Ltd.(云知声人工智能科技有限公司)

AI总结 本文提出SoftRerank方法,结合InternVideo2.5全参数微调、分层软融合和候选标签重排序,解决长尾微动作识别难题,在MA-52上取得79.99%的F1均值并获ACM Multimedia 2026挑战赛第一名。

Comments 7 pages, 2 figures, 3 tables. Accepted to the 34th ACM International Conference on Multimedia (MM '26). Ranked 1st in the 3rd Micro-Action Analysis Grand Challenge at ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.07216 2026-09-09 cs.CV 新提交

The Price of Consistency: Exploiting Visual Anchors for Multimodal Jailbreaking in Video Generation

一致性的代价:利用视觉锚点实现视频生成中的多模态越狱

Peng Li, Qianqian Xu, Yangbangyan Jiang, Zhipeng Yu, Qingming Huang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Hunan University(湖南大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 本文揭示视频生成中参考图像作为视觉锚点会阻止内容偏离有害意图从而增加安全风险,提出免训练多模态越狱框架DIVA,通过解耦意图和双标准选择实现高攻击成功率,并贡献首个多条件视频生成安全基准TI2VSafetyBench。

Comments This paper has been accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.07038 2026-09-09 cs.MM cs.SD 新提交

AdoDAS: A Privacy-Preserving Multimodal Challenge for Adolescent Depression, Anxiety, and Stress Assessment

AdoDAS:面向青少年抑郁、焦虑和压力评估的隐私保护多模态挑战赛

Zhaojie Luo, Junkun Wang, Tianhua Qi, Yuxuan Wu, Xin Zhao, Tetsuya Takiguchi, Tomoko Matsui, Kun Qian, Fei Wang, Shuqiong Wu, Zhengjun Yue, Hiroshi Ishiguro, Xinyuan Qian, Haizhou Li

机构 * Southeast University(东南大学) Shenzhen Loop Area Institute(深圳河套学院) Kobe University(神户大学) Beijing Institute of Technology(北京理工大学) Nanjing Medical University(南京医科大学) The University of Osaka(大阪大学)

AI总结 AdoDAS 挑战赛在隐私保护下利用匿名视听和文本数据,提供 24,000 个青少年片段,通过两个赛道评估抑郁、焦虑和压力筛查及 DASS-21 预测,基线 F1 为 0.4604,领先达 0.5921。

Comments 5 pages, 1 figure, 3 tables. To appear in the Proceedings of the 34th ACM International Conference on Multimedia (MM '26), November 10-14, 2026, Rio de Janeiro, Brazil. Zhaojie Luo and Junkun Wang contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.06928 2026-09-09 cs.CV cs.AI 新提交

Emo-DVS: A Multimodal Benchmark for Privacy-Aware Emotion Recognition with Event Cameras

Emo-DVS:面向隐私感知情感识别的事件相机多模态基准

Jiaqi Chen, Qinfu Xu, Hao Zhuang, Liyuan Pan

机构 * Beijing Institute of Technology(北京理工大学)

AI总结 针对RGB相机隐私风险及现有事件方法数据有限、单模态局限,提出三模态基准Emo-DVS及信息引导门控融合(IGF)框架,通过预训练、自适应门控和互信息最大化实现最先进性能。

Comments 8 pages,5 figures,Accepted to ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.06004 2026-09-09 cs.CV cs.AI 新提交

Geometry-Aware Test-Time Learning for Quantitative Spatial Reasoning

几何感知的测试时学习用于定量空间推理

Gege Zhang, Shuaicheng Niu, Gang Dai, Lei Sun, Shuangping Huang

机构 * South China University of Technology(华南理工大学) Nanyang Technological University(南洋理工大学) Guangdong University of Technology(广东工业大学)

AI总结 提出TTL-SR,一种几何感知的测试时学习框架,利用几何一致性约束和未标注测试数据,通过辅助查询、自适应触发和伪标签,提升VLM在定量空间推理任务上的性能,在Q-Spatial-ScanNet上分别提升6.47%和9.41%。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05959 2026-09-09 cs.CV 新提交

FineHOI: Part-Aware Dense Representations for Zero-Shot Human-Object Interaction Detection

FineHOI:面向零样本人-物交互检测的部件感知密集表示

Francesco Tonini, Lorenzo Vaquero, Mohammad Mahdi Derakhshani, Cees Snoek, Elisa Ricci, Cigdem Beyan

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) University of Amsterdam(阿姆斯特丹大学) University of Verona(维罗纳大学)

AI总结 FineHOI提出部件感知密集表示框架,通过自适应部件级注意力与区域感知交互Transformer,提升零样本人-物交互检测性能,尤其在未见交互上表现突出。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.05506 2026-09-09 cs.GR cs.CV cs.SD 新提交

ECHO: Dyadic 3D Facial Motion Generation with Asymmetric Deterministic Articulation and Stochastic Reaction

ECHO:具有非对称确定性发音与随机反应的二元三维面部运动生成

Zhuoqiang Cai, Yujie Sun, Chaoyue Niu, Hongyun Yu, Zhiwen Chen, Chengfei Lv, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

AI总结 提出ECHO方法,通过分解确定性锚点与随机残差,在仅音频条件下生成二元三维面部运动,平衡说话侧发音与听者反应的真实性和多样性。

Comments 10 pages, 4 figures, 4 tables. Accepted to ACM Multimedia 2026 (MM '26) as a poster presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24020 2026-09-09 cs.CV cs.AI 版本更新

IterCAD: Iterative Program Repair for CAD Code Generation from Orthographic Views

IterCAD:基于正交视图的CAD代码生成的迭代程序修复方法

Yuchuan Wu, Ke Niu, Haiyang Yu, Zhuofan Chen, Xiangyang Xue, Bin Li

机构 * Fudan University(复旦大学) ByteDance Inc.(字节跳动公司)

AI总结 IterCAD是一种迭代框架,将正交视图转CAD代码任务重构为渐进式程序修复,通过三阶段训练与监督集优化,在CADExpert上显著提升了代码可执行性与几何保真度。

Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28241 2026-09-09 cs.CV 版本更新

PointQ-Bench: Benchmarking Diagnostic and Interpretable Point Cloud Quality Assessment

PointQ-Bench:诊断性和可解释的点云质量评估基准

Duanchu Wang, Cheng Li, Junjie Yang, Jing Huang, Zihang Cheng, Zhi Gao, Bohong Zhu, Di Wang

机构 * Xi’an Jiaotong University(西安交通大学) Xidian University(西安电子科技大学) University of Chinese Academy of Sciences(中国科学院大学) Ningxia University(宁夏大学)

AI总结 提出PointQ-Bench基准,通过异常感知、缺陷诊断、可用性分级和开放式质量报告任务,将点云质量评估从标量评分扩展到全面质量理解,并揭示当前模型在感知与诊断之间的差距。

Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026). Revised to match the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09395 2026-09-09 cs.AI cs.LG cs.MA cs.MM 版本更新

Empowering VLMs for Few-Shot Multimodal Time Series Classification via Tailored Agentic Reasoning

通过定制代理推理增强VLMs在少样本多模态时间序列分类中的能力

Lin Li, Jiawei Huang, Qihao Quan, Dan Li, Boxin Li, Xiao Zhang, Erli Meng, Wenjie Feng, Jian Lou, See-Kiong Ng

机构 * Sun Yat-sen University(中山大学) Xiaomi Corporation(小米公司) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出MarsTSC框架,通过自演化知识库和代理推理提升少样本多模态时间序列分类性能,实验表明其在六个VLM基础上均优于传统和基础模型基线。

Comments 17 pages, 12 figures, 8 tables. Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03353 2026-09-09 eess.IV cs.CV 版本更新

NeuralLVC: Neural Lossless Video Compression via Masked Diffusion with Temporal Conditioning

NeuralLVC:基于掩码扩散与时间条件的神经损失视频压缩

Tiberio Uricchio, Marco Bertini

机构 * Università di Pisa(比萨大学) Università degli Studi di Firenze(佛罗伦萨大学)

AI总结 NeuralLVC通过结合掩码扩散与I/P帧架构,实现损失视频压缩,利用时间冗余性,实验表明其在Xiph CIF序列中优于H.264和H.265无损压缩。

Comments Accepted at ACM Multimedia 2026 (MM '26), Rio de Janeiro, Brazil

Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), November 10-14, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04995 2026-09-07 cs.LG 新提交

Beyond Homoscedasticity: Decoupled Uncertainty Optimization for Deep Imbalanced Regression

超越同方差性:面向深度不平衡回归的解耦不确定性优化

Juncheng Zhou, Jiaxi Lu, Weijing Zeng, Zhong Li, Hao Qi, Jingsong Cui

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学网络空间安全学院) School of Mathematics and Statistics, Wuhan University(武汉大学数学与统计学院) School of Synthetic Biology and Biomanufacturing, Tianjin University(天津大学合成生物学与生物制造学院)

AI总结 针对深度不平衡回归中现有方法忽略异方差性及梯度耦合的问题,提出DUO框架,通过解耦均值-方差优化和分布引导对比学习提升性能,在多基准测试中取得最优结果。

Comments Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026). Main paper with supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24622 2026-09-07 cs.CV cs.AI 版本更新

CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies

CF-VLA:面向视觉-语言-动作策略的高效粗到细动作生成

Fan Du, Feng Yan, Jianxiong Wu, Xinrun Xu, Weiye Zhang, Weinong Wang, Yu Guo, Bin Qian, Zhihai He, Fei Wang, Heng Yang

机构 * Southern University of Science and Technology(南方科技大学) Xi’an Jiaotong University(西安交通大学) United Nova Technology(联合Nova技术) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出CF-VLA,通过粗到细两阶段方法优化视觉-语言-动作策略的动作生成,提升效率与性能,在低NFE条件下实现更优的效率-性能平衡。

Comments Accepted to ACM Multimedia (ACM MM) 2026 as an Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25300 2026-09-07 cs.CV eess.IV 版本更新

DenseScout: Algorithm-System Co-design for Budgeted Tiny Object Selection on Edge Platforms

DenseScout: 面向边缘平台的预算有限小目标选择的算法-系统联合设计

Zhouzhi Xiong, Zimo Zeng, Yi Chen, Shuqi Xu, Yunfeng Yan, Donglian Qi

机构 * College of Electrical Engineering, Zhejiang University(浙江大学电气工程学院)

AI总结 本文提出DenseScout,一种轻量级密集响应选择器,用于在边缘平台预算有限的情况下高效选择小目标候选区域,通过算法-系统联合设计提升部署性能。

Comments 18 pages. Accepted at ACM Multimedia 2026. Updated to the final camera-ready version with supplementary material, reproducibility clarifications, and a public source-code repository. Main results and conclusions remain unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04120 2026-09-04 cs.CV 新提交

BooM-VVT: Boosting Mask-Free Video Virtual Try-On with Image-Level Pseudo Data

BooM-VVT:借助图像级伪数据提升无掩码视频虚拟试穿性能

Wei Zhang, Xin Li, Peishu Shi, Jialin Gao, Xuekang Peng, Zhichao Lian, Yeying Jin

机构 * Nanjing University of Science and Technology(南京理工大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Meituan(美团)

AI总结 针对现有无掩码视频虚拟试穿依赖掩码、成本高及服装一致性差的问题,提出BooM-VVT框架,采用图像级伪数据、服装敏感关键帧采样等技术,构建OmniView数据集,实现更优的时间一致性与服装保真度。

Comments 23 pages, 18 figures, 8 tables. Accepted to ACM Multimedia 2026 (MM '26)

Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03554 2026-09-04 cs.CV cs.AI 新提交

WIDE: Wildcard Inference with Dynamic Expansion for Cross-Modal Generative Retrieval

WIDE:面向跨模态生成式检索的通配符动态扩展推理

Teng Guo, Xin Wang, Jiayou Xu, Keying Zhou, Jifeng Shen, Haoxin Ruan

AI总结 本文针对跨模态生成式检索中因模态信息不对称导致的强制幻觉问题,提出WIDE方法,通过AET、AWD、BSR模块抑制幻觉,在M-BEIR基准上优于现有最优方法。

Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026). 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02751 2026-09-03 cs.CV cs.MM 新提交

Multi-Tool Image Editing Attribution in Facial Forgery

面部伪造中的多工具图像编辑归因

Sheng Liu, Qiang Sheng, Danding Wang, Yu Li, Chenming Zhou, Juan Cao

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 针对多工具面部图像编辑归因难题,构建MultiEdit数据集,设计DPEC方法,在最多5步编辑的面部图像上优于9种现有方法。

Comments Accepted to ACM Multimedia 2026 (MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02640 2026-09-03 cs.CV 新提交

From Detection to Localization: A Unified Forensics Framework for Fully Synthetic and Tampered Images

从检测到定位:面向完全合成与篡改图像的统一取证框架

Annalisa Gallina, Marco Fiorucci, Marco Brigo, Federica Battisti, Lamberto Ballan

机构 * University of Padova(帕多瓦大学)

AI总结 本研究针对生成式模型带来的图像篡改检测难题,提出统一多类取证框架,兼具分类与像素级定位能力,性能优于近期基准。

Comments Accepted at the DFF Workshop, ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02152 2026-09-03 cs.IR cs.AI 新提交

Beyond Modality Harmony: Orthogonal Purification and Topology-Guided MoE for Conflict-Aware Multimodal Recommendation

超越模态和谐:用于冲突感知多模态推荐的正交纯化与拓扑引导型混合专家模型

Jialin Liu, Zhaorui Zhang, Ray C. C. Cheung

机构 * City University of Hong Kong(香港城市大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 该研究针对多模态推荐系统的模态-拓扑冲突问题,提出OrthoRec模型,通过CGOP纯化模态特征、TAR-MoE优化门控及safe-SSL目标,在Amazon数据集上提升了推荐性能与鲁棒性。

Comments Accepted to ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06981 2026-09-03 cs.CV 版本更新

Local Epistemic Uncertainty Guided Active Sampling for Plug-and-play Diffusive Image Restoration

面向即插即用扩散式图像复原的局部认知不确定性引导主动采样

Jiaqi Zhang, Zheng Pang, Rongrong Gao, Qiyuan Zhang, Yang Yang

机构 * Jiangsu University(江苏大学)

AI总结 该研究针对现有DMIR方法忽略生成过程动态性的局限,提出LEADer框架,通过空间域逐像素不确定性调节与时间域自适应轨迹剪枝,提升图像复原性能并减少采样时间,且可即插即用集成至多种DMIR基线。

Comments 12 Pages, 7 Figures, 5 Tables. Accepted to ACM Multimedia 2026 Oral!

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01479 2026-09-02 cs.CV 新提交

CameraEditor: Camera-Controlled Image Editing via Video-Prior Sequential Modeling

CameraEditor:基于视频先验序列建模的相机控制图像编辑

Xin Shen, Chengyou Jia, Keshuo Xing, Zifeng Zhu, Changliang Xia, Bowen Ping, Zhuohang Dang, Hangwei Qian, Minnan Luo

机构 * Xi’an Jiaotong University(西安交通大学) Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局)

AI总结 CameraEditor是将相机控制编辑转化为时间序列预测任务的图像编辑框架,通过几何感知与动态参考机制实现高精度相机控制,在自建数据集和CamEditor-Bench上表现优于现有方法。

Comments Accepted to ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00853 2026-09-02 cs.CV cs.AI 新提交

ADGNet: Asymmetric Dual-text Guided Network for Infrared Small Target Detection

ADGNet:用于红外小目标检测的非对称双文本引导网络

Tongtong Wang, Mingzhu Xu, Chenglong Yu, Jing Wang, Xiaohui Lin, Weili Guan

机构 * Shandong University(山东大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 针对红外小目标检测中纯视觉方法难区分目标与杂波、现有多模态方法存在缺陷的问题,提出ADGNet,设计ADP、ADBI、AFA模块,构建AITIR数据集,性能优于21种SOTA方法。

Comments 10 pages, 10 figures. Accepted by the 34th ACM International Conference on Multimedia (ACM Multimedia 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00742 2026-09-02 cs.CV cs.MM 新提交

Mind the Rift: Cross-Scale Coupling Mismatch for AI-Generated Video Detection

注意裂缝:人工智能生成视频检测中的跨尺度耦合不匹配

Siyu Li, Jin Yang, Weiheng Liang

AI总结 该研究针对AI生成视频检测难题,提出RIFT框架,利用跨尺度耦合不匹配作为取证信号,在两个基准数据集上实现高F1分数,且具有编码器无关性。

Comments 12 pages, 4 figures, 11 tables. Accepted at ACM Multimedia 2026 (MM '26), Rio de Janeiro, Brazil. This version includes the supplementary material as Appendix A-E

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00666 2026-09-02 cs.CV 新提交

DGNet: Dual-knowledge Guided Network for Infrared Small Target Detection

DGNet:用于红外小目标检测的双知识引导网络

Chenglong Yu, Mingzhu Xu, Jing Wang, Tongtong Wang, Pingping Miao, Liqiang Nie

机构 * Shandong University(山东大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 针对红外小目标检测中文本引导方法的语义纠缠与部署限制问题,提出双知识引导网络DGNet,通过PWM模块与CDA损失实现性能提升,在三个公开数据集上验证了其有效性。

Comments Accepted by ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏