arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-09-01 至 2026-09-01 共收录 238 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 22 篇

2608.31005 2026-09-01 cs.CV 新提交 57%

From Intent to Evidence: Policy-Steered Multi-Strategy Retrieval for Long-Video Agents

从意图到证据:面向长视频智能体的策略引导多策略检索

Can Zhang, Baofeng Zhang, Xiaotian Han, Junyuan Shang, Yuchen Ding, Shuohuan Wang, Dianhai Yu, Ruirui Li

机构 * Beijing University of Chemical Technology(北京化工大学) Baidu, Inc.(百度公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对长视频智能体现有统一证据获取方式的缺陷,提出无需训练的VESTA智能体,通过策略引导多策略检索等机制,在多个长视频基准上取得了显著性能提升。

Comments 15 pages, 5 figures, 6 tables (main paper with appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30521 2026-09-01 cs.CV 新提交 57%

MEOM: Multi-View Expected-OKS Maximization for Human Pose Triangulation

MEOM:用于人体姿态三角测量的多视图期望OKS最大化

Ziliang Xiong, Henglin Shi, Per-Erik Forssen

机构 * Linköping University(林雪平大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对传统人体姿态三角测量法的缺陷,提出MEOM框架,融合多视图热图并评估其可靠性,在两种设置下均实现最优性能,推理成本仅为现有最优方法的一半。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29937 2026-09-01 cs.AI 新提交 57%

AcrossWAM1.0:A Modular Latent World-Action Stack for Compact Robot Policies

AcrossWAM1.0:用于紧凑机器人策略的模块化潜在世界-动作栈

Yafei Zhang, Nan Wu

机构 * Across Physical AI(跨物理人工智能机构) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 该研究针对LaWAM的耦合问题推出AcrossWAM1.0模块化潜在世界-动作栈,在LIBERO实验中实现高成功率,参数规模显著缩小,提供可审计的部署边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28784 2026-09-01 cs.CV 新提交 57%

ClearText-Video: A Large-Scale Text-Centric Video Dataset Bridging Video Restoration and Scene-Text Enhancement

ClearText-Video:连接视频修复与场景文本增强的大规模以文本为中心的视频数据集

Jinlong Li, Jiaming Ding, Dingfu Lu, Malcolm Hsiu, Chuang Ke, Kangning Yang, Bochen Guan, Lan Fu, Jie Cai, Huiming Sun, Zibo Meng

机构 * OPPO US AI Center(OPPO美国人工智能中心) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究团队推出ClearText-Video数据集,评估发现视觉增强未必提升文本推理,仅OCR管道远逊于多模态推理,为相关系统提供基础。

Comments This paper is accepted by 2026 Proceedings of the European Conference on Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26495 2026-09-01 cs.CV 版本更新 57%

Video-FLAIR: Not Whether to Reason, But How

Video-FLAIR:不是是否推理,而是如何推理

Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出 Video-FLAIR 训练框架,通过强化学习让模型为多模态查询选择适配的推理模式,在多个视频多模态基准上提升准确率并降低 token 用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20186 2026-09-01 cs.CV 版本更新 57%

Improving Image-to-Image Translation via a Rectified Flow Reformulation

通过修正流重新公式化改进图像到图像转换

Satoshi Iizuka, Shun Okamoto, Kazuhiro Fukui

机构 * University of Tsukuba(茨口大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出I2I-RFR方法,通过将标准图像到图像回归网络重新解释为连续时间传输模型,提升图像转换性能,保留传统监督训练流程,增强感知质量和细节保留。

Comments Accepted to ECCV 2026. Project page: https://iizuka.cs.tsukuba.ac.jp/projects/i2irfr/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29304 2026-09-01 cs.LG 新提交 50%

MEL: Coordinate-Preserving EEG Tokenization for fMRI Translation

MEL:用于fMRI转换的坐标保留型EEG分词

Xiangyu Liu, Zeting Yan, Zhitong Yin, Boyang Li, Xi Zhang

机构 * Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院) The University of Hong Kong(香港大学) Peking University(北京大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究提出坐标保留型EEG表示框架MEL,通过结构化EEG表示解决EEG到fMRI转换中的表示接口不匹配问题,在基准数据集上相比NeuroBOLT基线提升了预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03540 2026-09-01 cs.RO 版本更新 50%

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

基于漂移的策略优化:面向在线机器人控制的原生一步生成策略

Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出一种原生一步生成策略框架,通过将迭代细化移至训练阶段,提升在线机器人控制的效率与稳定性,实验显示其在推理速度和性能上优于多步扩散策略。

Comments Accepted at the 34th ACM International Conference on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09608 2026-09-01 cs.RO 版本更新 50%

Super4DR: 4D Radar-centric Self-supervised Odometry and Gaussian-based Map Optimization

Super4DR: 基于4D雷达的自监督里程计与高斯基于地图优化

Zhiheng Li, Weihua Wang, Qiang Shen, Yichen Zhao, Zheng Fang

专题命中 视频多模态 :multi-modal(abstract)

AI总结 Super4DR通过基于4D雷达的自监督里程计和高斯地图优化,在恶劣天气中实现更准确的定位与地图重建。

Comments 19 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 跨模态检索 16 篇

2608.30255 2026-09-01 cs.IR 新提交 88%

CAMIE: Co-Engagement-Aware Multimodal Item Embeddings for Snap Dynamic Product Ads Retrieval

CAMIE:用于Snap动态产品广告检索的协同交互感知多模态物品嵌入

Xiaodong Liu, Siman Wang, Congfei Zhang, Hsiang-wei Chao, Xiao Bai, Wen Zhang, Jingxiao Ma, Zhe Liu, Yunzhi Zhou, Yajun Wang, Jinchao Li, Yu Zhang

专题命中 跨模态检索 :MLLM(summary_cn,abstract);multimodal(title,abstract)

AI总结 针对Snap动态产品广告检索的挑战,提出CAMIE框架,基于LLM/MLLM主干与协同交互数据微调,线上部署后显著提升多场景下的CTR与CVR。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29607 2026-09-01 cs.CV cs.IR 新提交 83%

SnapBench: Benchmarking Snap-and-Ask Multimodal Retrieval for Mobile Interactions

SnapBench:面向移动交互的抓拍提问多模态检索基准测试

Zirong Chen, Fuda Ye, Kuan Zhang, Enjun Du, Junfu Pu, Xinlei Wang, Xinyu Zuo, Lisheng Duan, Jin Ma, Yongqi Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tencent Yuanbao(腾讯元宝) Tsinghua University(清华大学) ARC Lab, Tencent(腾讯ARC实验室) The University of Hong Kong(香港大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本研究推出首个鲁棒抓拍提问多模态检索配对基准SnapBench,评估16种多模态检索器,发现图像损坏严重影响检索,还提出自适应融合方法MOOR,凸显模态校准的必要性。

Comments 37 pages. Yuanbao Technical Report. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26861 2026-09-01 cs.IR cs.CL 版本更新 83%

Evaluating Perspectival Biases in Cross-Modal Retrieval

评估跨模态检索中的视角偏差

Teerapol Saengsukhiran, Peerawat Chomphooyod, Narabodee Rodjananant, Chompakorn Chaksangchaichot, Patawee Prakrankamanant, Witthawin Sripheanpol, Pak Lovichit, Sarana Nutanong, Ekapol Chuangsuwanich

机构 * Department of Computer Engineering, Chulalongkorn University(楚莱隆坤大学计算机工程系) School of Information Science and Technology, VISTEC(信息科学与技术学院,VISTEC)

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 本文提出3XCM基准,揭示跨模态检索中语言和文化偏见的影响,强调需通过解耦策略实现公平检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29084 2026-09-01 cs.CR 新提交 82%

UiAs: User-Independent 3D Facial Anti-Spoofing via Multi-modal Wireless Signals

UiAs:基于多模态无线信号的用户无关三维人脸反欺骗

Zhiwei chen, Lebin Lyu, Yimo Zhang, Dingyu Zhong, Yijie Li, Yichao Chen, Dian Ding, Jiguo Yu, Xiaosong Zhang, Yongzhao Zhang

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract);cross-modal(abstract)

AI总结 UiAs是基于毫米波与声学的多模态三维人脸反欺骗系统,通过跨模态减法抑制用户相关几何变化,结合皮肤锚定对比学习,对未见过的用户实现93.25%的反欺骗准确率

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14747 2026-09-01 cs.CV cs.AI 版本更新 81%

MMLongEmbed: Benchmarking Multimodal Embedding Models in Long-Context Scenarios

MMLongEmbed: 长上下文场景下的多模态嵌入模型基准测试

Haitian Wang, Ruoxi Sun, Quantong Qiu, Juntao Li, Junhui Li, Hua Chen, Jinxiong Chang, Min Zhang

机构 * Soochow University(苏州大学) Ant Group(蚂蚁集团)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态嵌入模型在长上下文场景中缺乏系统评估的问题,提出首个综合基准MMLongEmbed,涵盖文本、文档和视频模态的检索任务,揭示模型依赖浅层特征匹配、难以捕捉深层语义依赖等瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30163 2026-09-01 cs.IR cs.CV 新提交 79%

Doc-REFRAG: Rethinking Multimodal Document Retrieval-Augmented Generation

Doc-REFRAG:重新思考多模态文档检索增强生成

Ruofan Hu, Shengyang Xu, Minjie Hong, Xiaoda Yang, Sashuai Zhou, Ke Lei, Tao Jin, Zhou Zhao

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 针对现有多模态RAG模型在多图像场景中准确率有限且计算开销大的问题,提出基于大规模数据集DocLongRAG的问题引导框架Doc-REFRAG,其在六个基准上优于11个基线,实现SOTA准确率且推理延迟更低。

Comments Accepted by EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13061 2026-09-01 cs.CV 版本更新 79%

LaME: Learning to Think in Latent Space for Multimodal Embedding via Information Bottleneck

LaME: 通过信息瓶颈在潜在空间中进行多模态嵌入的推理学习

Peixi Wu, Biao Yang, Feipeng Ma, Bosong Chai, Bo Lin, Wei Yuan, Fan Yang, Tingting Gao, Hebei Li, Xiaoyan Sun

机构 * University of Science and Technology of China(中国科学技术大学) Kuaishou Technology(快手科技) Zhejiang University(浙江大学) Tsinghua University(清华大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 提出LaME方法,将面向嵌入的潜在推理建模为弱监督信息瓶颈,使用可学习推理令牌在单次前向传播中完成推理,避免显式CoT的高计算成本和标注依赖,实现60倍加速。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27243 2026-09-01 cs.CV 版本更新 79%

Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models

检索头能看见图像吗?长上下文视觉语言模型中的多模态检索头

Aaron Branson Cigres Li, Zhaowei Wang, Yu Zhao, Yiming Du, Haobo Li, Xiyu Ren, Ginny Wong, Simon See, Lishu Luo, Haodong Duan, Pasquale Minervini, Yangqiu Song

机构 * HKUST(香港科技大学) University of Edinburgh(爱丁堡大学) CUHK(香港中文大学) NVAITC, NVIDIA, Santa Clara, USA(NVIDIA Santa Clara 分公司) Tsinghua University(清华大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态检索头检测方法,发现视觉语言模型中仅有4.4-10.2%的注意力头贡献了50%的正检索分数,这些头对长上下文推理至关重要,且可直接用于文档检索提升性能。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22280 2026-09-01 cs.CV 版本更新 79%

Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings

超越思维链:重写作为生成式多模态嵌入的通用接口

Peixi Wu, Ke Mei, Feipeng Ma, Bosong Chai, Zhibin Lan, Chenxi Zhao, Shannan Yan, Jie Chen, Zhangchi Hu, Yansong Peng, Bo Lin, Junjie Zhou, Dacheng Yin, Tianyi Wang, Fengyun Rao, Jing Lyu, Hebei Li, Xiaoyan Sun

机构 * WeChat Vision, Tencent Inc.(腾讯微信视觉部) Zhejiang University(浙江大学) Tsinghua University(清华大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 针对思维链推理在检索中产生冗余和语义歧义的问题,提出重写驱动的多模态嵌入框架RIME,联合优化生成与嵌入,并通过跨模态对齐和精炼强化学习实现高效准确的检索。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22642 2026-09-01 cs.LG cs.AI 版本更新 74%

Mol-JEPA: A multimodal Joint Embedding Predictive Architecture for Molecules

Mol-JEPA:用于分子的多模态联合嵌入预测架构

Florian Rottach, Sebastian Schieferdecker, William Rudman, Randall Balestriero, Carsten Eickhoff

机构 * University of Tübingen(蒂宾根大学) Boehringer Ingelheim(勃林格殷格翰) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Brown University(布朗大学)

专题命中 跨模态检索 :multimodal(title);分类 cs.AI

AI总结 针对分子基础模型的化学无效增强等局限,提出Mol-JEPA多模态框架,利用模态掩码融入生化上下文,在基准测试中展现出优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00104 2026-09-01 cs.CV cs.AI 版本更新 62%

R3G: A Reasoning-Retrieval-Reranking Framework for Vision-Centric Answer Generation

R3G: 一种面向以视觉为中心的答案生成的推理-检索-重排序框架

Zhuohong Chen, Zhengxian Wu, Zirui Liao, Shenao Jiang, Hangrui Xu, Yang Chen, Chaokui Su, Xiaoyu Liu, Haoqian Wang

机构 * The Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) State Key Laboratory of Nuclear Power Safety Technology and Equipment, China(核能安全技术与装备国家重点实验室) School of Computer Science and Information Engineering, Hefei University of Technology, China(合肥工业大学计算机科学与信息工程学院)

专题命中 跨模态检索 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 提出R3G框架,通过先制定推理计划指定所需视觉线索,再采用粗检索加细粒度重排序的两阶段策略选择证据图像,在MRAG-Bench上提升六种多模态大语言模型在九个子场景中的准确率,实现整体最优性能。

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 8602-8606, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29951 2026-09-01 cs.AI cs.IR 新提交 57%

Spatial Matryoshka Training for Multi-Granularity Visual Document Retrieval

面向多粒度视觉文档检索的空间嵌套训练

Trishan Singha Roy, Arkadeep Acharya, Vishwajeet Kumar, Jaydeep Sen, Sachindra Joshi

机构 * IBM(国际商业机器公司)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

AI总结 针对视觉文档检索的多模态晚期交互检索器存储成本高、压缩级别固定的问题,提出ColSNAP训练方法,可生成嵌套压缩层级,实现灵活的精度-存储权衡,大幅压缩下仍保持检索性能并可迁移至多类骨干网络。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28981 2026-09-01 cs.LG eess.AS 新提交 57%

V2TATC: A Joint Voice-Trajectory Embedding Framework and Dataset for Air Traffic Controller Situational Awareness

V2TATC:用于空中交通管制员态势感知的联合语音-轨迹嵌入框架与数据集

Louis Brusset, Mathurin Petit, Jordan Kam, Alexandre Bayen

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校)

专题命中 跨模态检索 :cross-modal(abstract);分类 eess.AS

AI总结 V2TATC是联合语音-轨迹嵌入框架,结合多模态技术,在旧金山湾区空域验证有效性,发布配对数据集并开展多类实验,助力空中交通管制员态势感知。

Comments 41 pages, 21 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22850 2026-09-01 cs.CV 版本更新 57%

What is the Right Embedding Space for Contrastive Learning in Referring Expression Counting?

REC中对比学习的合适嵌入空间是什么?

Kostas Triaridis, Panagiotis Kaliosis, E-Ro Nguyen, Jingyi Xu, Dimitris Samaras, Hieu Le

机构 * Stony Brook University(斯通布鲁克大学) EPFL(苏黎世联邦理工学院)

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

AI总结 该研究针对REC任务现有对比学习策略的局限,提出视觉嵌入空间的C-REX框架,作为即插即用模块提升REC及类别无关计数任务性能,在REC上MAE最高提升28%、RMSE提升24.5%。

Comments ECCV 2026 (15 pages, 4 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30337 2026-09-01 cs.LG q-bio.BM 新提交 50%

Coarse composition suffices: tabular in-context learning for multi-activity antimicrobial peptide profiling

粗组合已足够:用于多活性抗菌肽分析的表格式上下文学习

Raunak Kumar, Anuj Pal, Dhruvi Solanki, Parikshit Pareek, Juhi Singh, Jitin Singla

机构 * Indian Institute of Technology Roorkee(印度鲁基工业学院) Indian Institute of Science(印度科学学院)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究提出一种仅用序列描述符结合TabPFN的简单流程,在ESCAPE数据集上多活性抗菌肽预测性能超越主流复杂模型,且对远程同源物提升显著,推理无需结构预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16318 2026-09-01 cs.LG 版本更新 50%

Semantics at an Angle: When Cosine Similarity Works Until It Doesn't

角度语义:余弦相似度何时有效及失效

Kisung You

机构 * Baruch College, City University of New York(纽约城市大学巴克莱学院)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 研究探讨余弦相似度在信息处理等领域的应用,围绕其有用性取决于学习表示等因素展开,推导几何恒等式,区分失效机制,回顾证据并描述替代方法,得出其正尺度不变性有条件合理的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态生成 24 篇

2512.15052 2026-09-01 cs.CL cs.AI 版本更新 84%

SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification

SGM: 通过神经层面的净化为多模态大语言模型提供安全眼镜

Hongbo Wang, AprilPyone MaungMaung, Isao Echizen

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 SGM通过神经层面的净化技术,有效降低多模态大语言模型的毒性,同时保持生成流畅性和推理能力。

Comments Accepted to the EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20743 2026-09-01 cs.AI 版本更新 83%

Is Multimodal Speculative Decoding Ready for Diffusion-Based Parallel Drafting? A Survey and Empirical Diagnosis

多模态推测解码是否适用于基于扩散的并行草稿生成?一项调查与实证诊断

Yantao Li, Huanlin Gao, Fang Zhao, Chao Tan, Qiang Hui, Shuting Liu, Fuyuan Shi, Ting Lu, Shaoan Zhao, Xueqiang Guo, Xinpei Su, Jianbing Zhang, Xinyu Dai, Kai Wang, Shiguo Lian

机构 * Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院) Unicom Data Intelligence, China Unicom(中国联通数据智能)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文通过调查多模态模型并开展跨架构实证研究,探究多模态推测解码是否适用于基于扩散的并行草稿生成,提出统一分类法并分析现有方法的局限性与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00232 2026-09-01 cs.AI cs.LG 版本更新 83%

Self-Correction Can Amplify Hallucinations: Fact-Level Repair with Graph-Based Evidence Routing in Multimodal Generation

TIGER: 基于图证据路由的可追踪推理用于减轻多模态生成中的幻觉

Kaixiang Zhao, Tianrun Yu, Shawn Huang, Porter Jenkins, Yushun Dong, Amanda Hughes

机构 * Brigham Young University Florida State University

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出TIGER框架,通过从输入和输出中独立提取观测图与声明图,并基于图条件风险评分修复高风险声明,以减轻多模态生成中的事实级幻觉。

Comments Accepted at EMNLP 2026 (Main Conference). 29 pages, 8 figures, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26956 2026-09-01 cs.CV 版本更新 81%

RubricRM: Generative Reward Modeling via Dynamic Rubrics for Image Generation and Editing

RubricRM:基于动态评分规则的生成式奖励模型,用于图像生成与编辑

Zijian Kan, Wei Wang, Long Luo, Bing Zhao, Xuan Ren, Weixu Qiao, Wenbo Li, Hu Wei, Lin Qu

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Alibaba DAMO Academy(阿里巴巴达摩院)

专题命中 多模态生成 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 该研究提出RubricRM框架,为文本到图像生成和图像编辑训练专用模型,其性能优于现有专用奖励模型,且与强专有MLLM评估器竞争力相当,可用于图像生成与编辑的奖励建模。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13368 2026-09-01 cs.AI cs.CV 版本更新 81%

IterCAD: An Iterative Multimodal Agent for Visually-Grounded CAD Generation and Editing

IterCAD:一种用于视觉引导的CAD生成与编辑的迭代多模态智能体

Tao Hu, Jiaxin Ai, Licheng Wen, Xueheng Li, Shu Zou, Siqi Li, Nianchen Deng, Xinyu Cai, Hongbin Zhou, Pinlong Cai, Daocheng Fu, Yu Yang, Hairong Zhang, Botian Shi, Xuemeng Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出IterCAD,一种闭环交互式CAD生成与编辑的多模态智能体框架,通过渐进式SFT和几何感知强化学习优化,在代码可执行性和几何精度上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏