arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

至 收录 1940
2607.15755 2026-08-03 cs.SD cs.AI 版本更新

AuEmoChat: Authentic Emotion Understanding and Rendering for Conversational Speech Synthesis

AuEmoChat:用于对话语音合成的真实情感理解与呈现

Zhenqi Jia, Yuan Zhao, Aruukhan, Rui Liu, Haizhou Li

AI总结 针对对话语音合成中情感表达不真实及多模态令牌干扰问题,提出AuEmoChat框架,通过AuEmoCodec学习情感令牌空间、AuEmoToMe合并冗余令牌,集成到模型并结合情感流匹配渲染语音,实验证明其性能优于现有基线。

Comments Accepted by ACMMM 2026

URL PDF HTML 收藏
2601.02854 2026-08-03 cs.AI 版本更新

M3MAD-Bench: Multi-Dimensional Evaluation of Multi-Agent Debate Across Domains and Modalities

M3MAD-Bench: 多智能体辩论在不同领域和模态中真的有效吗?

Ao Li, Jinghui Zhang, Luyu Li, Yuxiang Duan, Lang Gao, Mingcai Chen, Weijun Qin, Shaopeng Li, Fengxian Ji, Ning Liu, Lizhen Cui, Xiuying Chen, Yuntao Du

机构 * Shandong University(山东大学) MBZUAI Nanjing University of Posts and Telecommunications(南京邮电大学) BOB Cloud(BOB云)

AI总结 M3MAD-Bench通过多领域、多模态和多维指标评估多智能体辩论方法的有效性,提供全面的性能-成本分析。

Comments Accepted by ACMMM 2026

URL PDF HTML 收藏
2607.28580 2026-07-31 cs.AI 新提交

DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation

DualG-MRAG:面向多模态检索增强生成的宏观推理与微观匹配解耦框架

Jiacheng Tao, Qingyun Sun, Haonan Yuan, Ziwei Zhang, Jianxin Li

机构 * Beihang University(北京航空航天大学) SKLCCSE

AI总结 针对多模态RAG在复杂多跳推理中存在的问题,本文提出DualG-MRAG框架,通过解耦宏观推理与微观匹配抑制检索噪声,经实验验证其在证据召回和问答准确率上优于基线。

Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026). 12 pages

URL PDF HTML 收藏
2607.28285 2026-07-31 cs.CV 新提交

Beyond Visual Ambiguity: Guiding Robust Monocular Depth Estimation in Challenging Scenarios via Detailed Long Captions

超越视觉歧义:通过详细长文本引导具有挑战性场景下的鲁棒单目深度估计

Junrui Zhang, Jiaqi Li, Yiran Wang, Liao Shen, Zhiguo Cao

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

AI总结 该研究针对单目深度估计的视觉歧义问题,提出CapDepth框架,通过详细长文本引导,在非朗伯表面和恶劣天气下的深度误差较现有最优方法分别降低25.0%和22.0%。

Comments Accepted to ACM MM 2026

URL PDF HTML 收藏
2607.27761 2026-07-31 cs.LG cs.CV 新提交

DAS-PMVC: A Framework for Partial Multi-View Clustering via Dual Alignment and Structure Enhancement

DAS-PMVC:一种通过双对齐与结构增强实现的部分多视图聚类框架

Shubin Ma, Liang Zhao, Chuanye He, Zhenjiao Liu, Liang Zou, Lin Yuanbo Wu, Yu Shao

机构 * Dalian University of Technology(大连理工大学) Inspur Group Co., Ltd.(浪潮集团有限公司) China University of Mining and Technology(中国矿业大学) The University of Warwick(华威大学)

AI总结 该研究针对多视图聚类中的部分视图对齐问题,提出DAS-PMVC框架,通过锚点图结构对齐、结构增强特征学习与双对齐策略提升性能,在多数据集上优于现有最先进方法。

Comments 8 pages, 4 figures. Accepted by ACM Multimedia 2026

URL PDF HTML 收藏
2607.27699 2026-07-31 cs.CV cs.AI 新提交

RefineSVG: Visual Feedback-Driven Reinforcement Learning for Image-to-SVG Generation

RefineSVG:视觉反馈驱动的图像转SVG生成强化学习

Shaobo Liu, Feiqiao Mao, Shuaishuai Zhou, Yan Zhan, Weiqi Tan, Zhiqiong Lu, Zhengping Liang

机构 * Shenzhen University(深圳大学) Peking University(北京大学)

AI总结 RefineSVG是一种视觉反馈驱动的闭环框架,通过引入SVG语义词汇表和渐进式训练,使MLLM实现高保真图像转SVG生成,性能优于现有基线。

Comments 17 pages, 5 main-paper figures. Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026). Includes the complete supplementary material

URL PDF HTML 收藏
2607.27620 2026-07-31 cs.CV 新提交

MedXplore: Towards Reliable and Unbiased Generalized Category Discovery in Medical Imaging

MedXplore:面向医学成像中可靠且无偏的广义类别发现

Jianwei He, Kailin Lyu, Junhao Dong, Long Xiao, Wenjie Hou, Jingze Lu, Di Wu, Lin Shu, Jie Hao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanyang Technological University(南洋理工大学)

AI总结 针对医学成像中广义类别发现存在的旧类偏差问题,提出MedXplore框架,通过FAAC与ACAM模块优化表征学习,在多基准上实现准确率提升且旧类误报率显著降低。

Comments accepted by ACM MM 26

URL PDF HTML 收藏
2605.20290 2026-07-31 cs.GR cs.CV 版本更新

PhysOmni: Physics-Grounded Multi-Object Scene Generation from a Single Image with Real-Time Interaction

TelePhysics: 从单张图像生成物理一致的多物体场景 with 实时交互

Xin Zhang, Yabo Chen, Yijie Fang, Wanying Qu, Haibin Huang, Chi Zhang, Feng Xu, Xuelong Li

机构 * Fudan University(复旦大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI))

AI总结 本文提出TelePhysics,一种无需训练的框架,通过整体场景级3D重建将单张图像转换为物理一致且可控的视频。该方法通过统一的空间坐标系统表示完整场景几何,解决物体穿透和对齐模糊问题,实现准确的多物体交互和更丰富的复杂控制类型,从而在保持逼真视觉保真度的同时实现实时物理交互预览。

Comments ACMMM 2026. Project page: https://physomni.github.io/

URL PDF HTML 收藏
2605.14534 2026-07-31 cs.CV cs.AI cs.MM 版本更新

PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media

PROVE:一种用于视觉媒体的感知移除一致性基准

Fuhao Li, Shaofeng You, Jiagao Hu, Yu Liu, Yuxuan Chen, Zepeng Wang, Fei Wang, Daiguo Zhou, Jian Luan

机构 * MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

AI总结 本文提出RC指标和PROVE-Bench基准,通过滑动窗口特征比较和分布跟踪提升图像和视频移除任务的评估精度,实现更符合人类感知的一致性衡量。

Comments Accepted by ACMMM 2026. Project Page: https://xiaomi-research.github.io/prove/

URL PDF HTML 收藏
2603.09454 2026-07-31 cs.CR

ShapeMark: Robust and Diversity-Preserving Watermarking for Diffusion Models

ShapeMark: 用于扩散模型的鲁棒且保持多样性水印技术

Yuqi Qian, Yun Cao, Haocheng Fu, Meiyang Lv, Meineng Zhu

AI总结 ShapeMark通过将水印编码到结构化噪声模式中,提高了扩散模型的鲁棒性和生成多样性,实现了在多种有损场景下的高质量生成。

Journal ref In Proceedings of the 34th ACM International Conference on Multimedia (MM 2026)

URL PDF HTML 收藏
2507.05113 2026-07-31 cs.MM cs.CR cs.LG 版本更新

CLIP-Guided Backdoor Defense through Entropy-Based Poisoned Dataset Separation

基于CLIP的后门防御:通过基于熵的中毒数据集分离

Binyan Xu, Fan Yang, Xilin Dai, Di Tang, Kehuan Zhang

机构 * The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Sun Yat-sen University(中山大学)

AI总结 该研究提出CLIP引导后门防御(CGD),用CLIP分离干净与中毒输入,重训练模型中和后门,在4个数据集11种攻击上ASR降至1%以下,CA降幅仅0.3%,适配性与鲁棒性优异。

Comments 15 pages, 9 figures, 15 tables. To appear in the Proceedings of the 32nd ACM International Conference on Multimedia (MM '25)

URL PDF HTML 收藏
2607.26735 2026-07-30 cs.CV cs.AI cs.MM 新提交

Dual Inversion for Text-to-Image Diffusion Models: From Both Prompt and Noise Perspectives

文本到图像扩散模型的双重逆推:从提示与噪声双视角

Xiaolong Liu, Junjian Li, Yuan Xiao, Jiaqi Deng, Dayong Ye, Tianqing Zhu, Huan Huo

机构 * University of Technology Sydney(悉尼科技大学) Geely(吉利) City University of Hong Kong(香港城市大学) City University of Macau(澳门城市大学)

AI总结 该研究针对现有文本到图像扩散模型提示逆推方法的局限,提出联合恢复语义提示与潜在噪声的Dualin方法,实现了高质量逆推提示与最优图像保真度,为可控图像编辑奠定基础。

Comments Accepted by ACM MM 2026

URL PDF HTML 收藏
2607.26553 2026-07-30 cs.SD 新提交

ThinkOmni: A Reasoning-Driven Omni-Modal LLM Framework for Audio Forgery Detection and Localization

ThinkOmni:用于音频伪造检测与定位的推理驱动全模态大语言模型框架

Yuxiong Xu, Kaiqing Lin, Bin Li, Haodong Li, Sheng Li

机构 * Shenzhen University(深圳大学) Afirstsoft Technology Group Co., Ltd.(安福软件科技集团有限公司)

AI总结 针对现有AFDL方法泛化能力不足的问题,提出推理驱动的全模态大语言模型ThinkOmni,构建FACoT数据集,引入FMIL与FCML,实现了跨数据集的音频伪造检测与定位。

Comments Accepted by ACM MM 2026, 21 pages, 12 figures

URL PDF HTML 收藏
2607.26541 2026-07-30 cs.SD cs.CL 新提交

Prosody-driven Jailbreaks in Audio LLMs: A Controlled Study and Mechanistic Analysis

音频大语言模型中基于韵律的越狱:一项对照研究与机制分析

Jiachen Qian, Junyu Li

机构 * City University of Hong Kong(香港城市大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞))

AI总结 该研究通过控制文本内容改变语音传递预设构建评估协议与基准,发现特定韵律特征的语音能提升音频大语言模型的越狱成功率,表明语音传递是音频大语言模型安全评估的重要因素。

Comments Accepted at ACM Multimedia 2026 (ACM MM '26). 9 pages, 3 figures. Supplementary material included

Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), November 10-14, 2026, Rio de Janeiro, Brazil

URL PDF HTML 收藏
2607.26393 2026-07-30 cs.AI 新提交

CaM-Wolf: Causal-Aware Multimodal Agents for Social Deduction Games

CaM-Wolf:面向社交推理游戏的因果感知多模态智能体

Zheng Zhang, Nanjie Yao, Jiarui He, Deheng Ye, Peilin Zhao, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究针对现有SDG智能体多模态特性缺失的问题,提出首个整合多模态感知生成的CaM-Wolf,经实验验证其游戏性能与交互质量均有提升。

Comments Accepted by ACMMM 2026

URL PDF HTML 收藏
2512.00807 2026-07-30 cs.AI 版本更新

BioPro: Towards Difference-Aware Gender Fairness for Vision-Language Models

BioPro: 关于差分意识的性别公平性在视觉-语言模型中

Yujie Lin, Jiayao Ma, Qingguo Hu, Wenbo Li, Genji Li, Derek Wong, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系)

AI总结 BioPro通过差分意识的性别公平性方法,在视觉-语言模型中实现选择性去偏,减少中性情境中的性别偏见同时保持显性情境中的性别忠实性。

Comments ACM Multimedia 2026

URL PDF HTML 收藏
2607.25962 2026-07-29 cs.CV 新提交

LaP-Forensics: Latent-Pixel Consistency Guided Multimodal Reasoning for Deepfake Detection

LaP-Forensics:用于深度伪造检测的潜在像素一致性引导的多模态推理

Can Wang, Yuhao Wang, Yushe Cao, Canran Xiao, Fei Shen

机构 * The Hong Kong Polytechnic University(香港理工大学) University College London(伦敦大学学院) Tsinghua University(清华大学) Sun Yat-sen University(中山大学) National University of Singapore(新加坡国立大学)

AI总结 研究针对深度伪造检测问题,提出LaP-Forensics多模态框架,利用基于重建的取证证据及结构化模型预测,经组相对策略优化,实现跨生成器检测和伪影定位,实验验证了残差流效用,但后处理下文本忠实性和可靠性有局限。

Comments Accepted at ACM Multimedia 2026 (ACM MM 2026)

URL PDF HTML 收藏
2607.25392 2026-07-29 cs.CV 新提交

RDVSv2: A Large-scale Benchmark for RGB-D Video Salient Object Detection

RDVSv2:用于RGB-D视频显著目标检测的大规模基准测试

Tianyu Li, Jiahao He, Keren Fu, Qijun Zhao

机构 * National Key Laboratory of Fundamental Science on Synthetic Vision, Sichuan University(四川大学合成视觉基础科学国家重点实验室) College of Computer Science, Sichuan University(四川大学计算机学院)

AI总结 介绍用于RGB-D视频显著目标检测的大规模基准测试RDVSv2,其规模大、场景多样。基于SAM2建立强大基线,采用参数高效微调策略联合编码多模态线索,该基线在RDVSv2及现有基准测试中达最优,为相关研究提供资源。

Comments Accepted to ACMMM 2026

URL PDF HTML 收藏
2607.25108 2026-07-29 cs.CV cs.AI cs.LG eess.IV 新提交

OPERA: Offline Policy-guided Expert Routing and Adaptation for Universal Biomedical Image Analysis

OPERA:用于通用生物医学图像分析的离线策略引导专家路由与适应

Zihan Li, Feiyang Liu, Dandan Shan, Ruibo Wang, Qingqi Hong

机构 * University of Washington(华盛顿大学) Delft University of Technology(代尔夫特理工大学) Xiamen University(厦门大学)

AI总结 研究针对生物医学图像分析中分布变化阻碍模型部署的问题,提出OPERA多智能体集成框架,通过离线策略学习专家权重分配,结合多种机制协调智能体,经多数据集评估,有效提升性能与校准质量,为可部署生物医学AI提供实用路径。

Comments Accepted by ACM MM 2026. 18 pages

URL PDF HTML 收藏
2607.17761 2026-07-29 cs.SD cs.AI 版本更新

Time-Frequency Consistency Learning for Robust Speech Deepfake Detection

用于鲁棒语音深度伪造检测的时频一致性学习

Jun Xue, Zhuolin Yi, Yanzhen Ren, Yihuan Huang, Jiayu Xiong, Yi Chai, Guanxiang Feng, Jiajun Liu, Tong Zhang

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学网络科学与工程学院) Tongji university(同济大学)

AI总结 研究语音深度伪造检测在实际部署中因声学前端处理管道失真导致鲁棒性不足的问题,提出时频一致性学习框架,通过注意力驱动软对齐机制和频域结构一致性约束,提升检测模型在实际场景中的鲁棒性。

Comments Accepted by ACM MM 2026

URL PDF HTML 收藏
2607.13656 2026-07-29 cs.CV 版本更新

FreeLit: Paired-Free Indoor Relighting via Physics-Guided Diffusion

FreeLit:通过物理引导扩散实现无配对室内重光照

Chi-En Yen, Duy-Khanh Ngo, Wen-Wei Tang, Huu-Phu Do, Wen-Hsiao Peng, Ching-Chun Huang

AI总结 本文针对室内场景重光照难题,提出FreeLit无配对框架,利用物理引导光照先验及重光照引导的固有稳定策略,结合面向可控性的评估指标,实现稳定、物理一致且可控的重光照,提升低光照场景下的鲁棒性,无需配对监督。

Comments Updated to the ACM Multimedia 2026 camera-ready version

URL PDF HTML 收藏
2607.13454 2026-07-29 cs.CV cs.AI 版本更新

GeoAnchor: Collaborative Reasoning via Latent Decomposition for 3D Spatial Understanding

GeoAnchor:通过潜在分解进行协作推理以实现3D空间理解

Hao Li, Han Fang, Zixin Pan, Xin Wei, Hongbo Sun, Jinglin Xu, Zhiyu Lin, Ye Yuan, Zhongjiang He, Yu Yu, Hao Sun

机构 * Shanghai Jiao Tong University(上海交通大学) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司) University of Science and Technology Beijing(北京科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 针对从2D图像理解3D空间关系的挑战,提出GeoAnchor框架,通过分解3D空间信息为互补组件并结合协作训练策略,实现动态可解释推理,在复杂3D推理任务中优于现有技术。

Comments Accepted by ACM MM 2026

URL PDF HTML 收藏
2607.24607 2026-07-28 cs.IR 新提交

One Graph, Multiple Gains: Single High-Quality Item-Item Graph for Multimodal Recommendation

一图多益:用于多模态推荐的单个高质量物品-物品图

Jinfeng Xu, Zheyu Chen, Ziyue Peng, Shuo Yang, Jinze Li, Zewei Liu, Shujie Li, Yipeng Du, Edith C. H. Ngai

AI总结 研究多模态推荐中物品-物品图构建及应用,提出IIMRec框架构建高质量图,通过融合信号和NCER优化,并在推荐三阶段重用,以RIG、内容引导UI图扩展、INA三种方式使用,实验证明其性能优于基线,冷启动等条件下效果更佳。

Comments Accepted by ACM MM 2026

URL PDF HTML 收藏
2607.24430 2026-07-28 cs.HC cs.CL eess.AS 新提交

Let Me Look at You: Advanced Facial Expression Modeling for Conversational Speech Synthesis

让我看着你:用于对话语音合成的高级面部表情建模

Yifan Hu, Shuwei He, Rui Liu, Haizhou Li

AI总结 研究针对对话语音合成中面部表情线索常被忽视及缺乏多模态数据集的问题,提出基于大语言模型的FacialTalker框架,含AUTokenizer和DualDPO策略,构建VSDD-1K数据集,实验表明该框架在表情感知和语音合成质量上表现出色。

Comments 10 pages, 5 figures, 5 tables. Accepted by ACM MM 2026

URL PDF HTML 收藏
2607.24407 2026-07-28 cs.CV 新提交

Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding

思想令牌混合:统一感知与推理以实现自由形式多模态基础定位

Tianyi Gao, Han Fang, Tianyi Ding, Hao Li, Xin Wei, Hongbo Sun, Xiaodong Dong, Ye Yuan, Jinglin Xu, Kongming Liang, Hao Sun, Jingmin Xin

机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司) University of Science and Technology Beijing(北京科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 研究旨在统一多模态基础定位中的感知与推理。提出思想令牌混合(Motto)方法,通过空间接地思想令牌化及上下文自适应令牌链实现,构建PR-Bench基准,实验证明该方法在自由形式接地任务中达领先性能。

Comments Accepted by ACM MM 2026

URL PDF HTML 收藏
2607.23514 2026-07-28 cs.CL cs.AI cs.MM 新提交

Novel Claim or Déjà Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking

新主张还是似曾相识?重新思考多模态自动事实核查的“无污染”动态评估

Haorui He, Xinwen Chen, Dacheng Wen, Reynold Cheng, Francis C. M. Lau, Yupeng Li

机构 * Hong Kong Baptist University(香港浸会大学) The University of Hong Kong(香港大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院)

AI总结 研究多模态自动事实核查中基准的污染风险,通过实证研究静态和动态基准,发现动态评估虽能减少但不能消除污染,新主张可多种方式验证,污染会致性能膨胀和排名扭曲,为可信评估提供实用指南。

Comments Accepted at ACM Multimedia (ACM MM), 2026

URL PDF HTML 收藏
2607.23245 2026-07-28 cs.MM cs.LG 新提交

FedTaste: Topology-Aware Structural Transfer for Multimodal Federated Learning with Missing Modalities

FedTaste:用于具有缺失模态的多模态联邦学习的拓扑感知结构转移

Haochen Liang, Jie Zhang, Hideya Ochiai

AI总结 针对多模态联邦学习中模态缺失和数据分布问题,提出FedTaste框架,利用冻结基础模型提取联合多模态拓扑,结合模态自适应结构提示等方法,避免显式模态插补,在多数据集和非IID设置下性能优越且通信开销低。

Comments Accepted to ACM Multimedia (ACM MM) 2026

URL PDF HTML 收藏
2607.22726 2026-07-28 cs.CV 新提交

PCA: Persistence-Aware Compression and Aggregation for Fast Video Large Language Models

PCA:用于快速视频大语言模型的持久性感知压缩与聚合

Zihan Song, Shuo Ye, Bo Zhao, Ruixin Zhang, Jiayu Zhang, Shouhong Ding, Zitong Yu

机构 * Institute for Artificial Intelligence, Great Bay University(大湾区大学人工智能研究院) Sun Yat-sen University(中山大学) Youtu Lab, Tencent(腾讯优图实验室) Shenzhen University(深圳大学) Dongguan Key Laboratory for Intelligence and Information Technology(东莞市智能信息技术重点实验室)

AI总结 研究视频大语言模型长时帧冗余问题,提出PCA方法,含动态下采样和持久性感知运动增强模块,能在编码前保留视觉信息,提升效率与准确性,优于现有方法,速度有显著提升。

Comments Accepted by ACM MM 2026

URL PDF HTML 收藏
2607.22716 2026-07-28 cs.CV cs.LG 新提交

Visual Token Compression Enhances Robustness of MLLMs

视觉令牌压缩增强多模态大语言模型的鲁棒性

Shishen Gu, Jiequan Cui, Wenbo Hu, Zenglin Shi, Zhenzhen Hu, Richang Hong

机构 * Hefei University of Technology(合肥工业大学)

AI总结 研究如何增强多模态大语言模型的鲁棒性,核心方法是通过测量视觉令牌与语言特征空间的距离来识别并剪枝分布外视觉令牌,该方法能有效防御越狱攻击、减轻幻觉,提升模型在通用数据集上的表现。

Comments 20 pages, 16 figures. Accepted at ACM Multimedia 2026. Code: https://github.com/Eurek001/OOD-VTP

URL PDF HTML 收藏
2607.19942 2026-07-28 cs.CV cs.AI 版本更新

G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object Detection

G-MAD:用于多视图RGB-T航空目标检测的基于游戏的数据生成框架

Yechan Kim, JongHyun Park, Dongho Yoon, Namhoon Jung, Moongu Jeon

机构 * LIG Defense&Aerospace(LIG国防与航空航天公司) GIST(韩国科学技术院)

AI总结 研究针对航空目标检测中数据集构建的问题,提出基于游戏的G-MAD数据生成框架,可解决视点控制、数据对齐及标注成本等问题,支持多视图相机放置等功能,还构建并发布了AMOD基准。

Comments ACM Multimedia 2026 (Supplementary Material Included)

URL PDF HTML 收藏