arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4979 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4979 篇

2606.08492 2026-07-02 cs.CV cs.AI 新提交 79%

Seeing is Believing: Aligning Prompt Rewriting with Visual Anchors for Text-to-Image Generation

眼见为实:基于视觉锚点的提示重写对齐用于文本到图像生成

Xuanyi Liu, Deyi Ji, Junyu Lu, Jing Wang, Lanyun Zhu, Qianxiong Xu, Xuhang Chen, Tianrun Chen, Siwei Ma

机构 * Peking University(北京大学) Tencent(腾讯) Dalian University of Technology(大连理工大学) Nanyang Technological University(南洋理工大学) University of Cambridge(剑桥大学) Zhejiang University(浙江大学)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出FaithRewriter框架,利用多模态大模型生成中间视觉线索,结合大语言模型生成视觉锚定的增强提示,再蒸馏至小模型,以缩小用户意图与生成图像之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30131 2026-05-29 cs.CL cs.CV 79%

CCS: Clinical Consensus Selection for Radiology Report Generation

CCS:放射学报告生成的临床共识选择

Xi Zhang, Yingshu Li, Zaiqiao Meng, Jake Lever, Edmond S. L. Ho

机构 * School of Computing Science, University of Glasgow(格拉斯哥大学计算机科学学院) School of Electrical and Computer Engineering, University of Sydney(悉尼大学电气与计算机工程学院) Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 提出CCS框架,通过采样多个候选报告并选择临床共识最高的一个,以改进放射学报告生成在推理时的质量。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12480 2026-05-13 cs.CV cs.AI 79%

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

OmniNFT: 多模态联合音频视频生成的模态感知强化学习

Guohui Zhang, XiaoXiao Ma, Jie Huang, Hang Xu, Hu Yu, Siming Fu, Yuming Li, Zeyue Xue, Lin Song, Haoyang Huang, Nan Duan, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) JD Explore Academy(京东探索研究院)

专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出OmniNFT,通过模态感知强化学习框架解决多模态联合生成中的模态一致性、梯度不平衡和信用分配问题,提升音频视频感知质量与同步性能。

Comments Project page: https://zghhui.github.io/OmniNFT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12138 2026-05-13 cs.CV cs.CL cs.IR 79%

Design Your Ad: Personalized Advertising Image and Text Generation with Unified Autoregressive Models

为广告设计:基于统一自回归模型的个性化广告图像和文本生成

Yexing Xu, Wei Feng, Shen Zhang, Haohan Wang, Yuxin Qin, Yaoyu Li, Ao Ma, Yuhao Luo, Lu Wang, Xudong Ren, Haoran Wang, Run Ling, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Longguang Wang, Yulan Guo

机构 * Sun Yat-Sen University(中山大学) Northeastern University(东北大学)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 本文提出统一广告生成模型Uni-AdGen,通过单个自回归框架生成个性化图文广告,结合前景感知模块和指令微调提升生成质量,并引入大规模广告数据集和新指标提升个性化生成效果。

Comments 22 pages, 19 figures, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18269 2026-04-21 cs.CL cs.CV 79%

TextTIGER: Text-based Intelligent Generation with Entity Prompt Refinement for Text-to-Image Generation

TextTIGER:基于实体提示精炼的文本智能生成用于文本到图像生成

Shintaro Ozaki, Tomoyuki Jinno, Kazuki Hayashi, Yusuke Sakai, Jingun Kwon, Hidetaka Kamigaito, Katsuhiko Hayashi, Manabu Okumura, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技術研究所) The University of Tokyo(东京大学) Chungnam National University(Chungnam国立大学) Institute of Science Tokyo(东京科学研究所)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 TextTIGER通过增强外部信息和大语言模型总结,优化实体描述以提升文本到图像生成性能,实验表明其在多种评估指标上优于仅使用描述的提示方法。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00007 2026-04-02 cs.CL cs.AI 79%

Dynin-Omni: Omnimodal Unified Large Diffusion Language Model

Dynin-Omni: 多模态统一的大扩散语言模型

Jaeik Kim, Woojin Kim, Jihwan Hong, Yejoon Lee, Sieun Hyeon, Mintaek Lim, Yunseok Han, Dogeun Kim, Hoeun Lee, Hyunggeun Kim, Jaeyoung Do

机构 * AIDAS Lab Seoul National University [1.5ex] Project Page Code Model Demo -2em

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);any-to-any(abstract);分类 cs.CL、cs.AI

AI总结 Dynin-Omni首次提出基于掩码扩散的多模态基础模型,统一文本、图像、语音的理解与生成,以及视频理解,通过共享离散令牌空间实现双向上下文迭代优化。

Comments Project Page: https://dynin.ai/omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01019 2025-04-22 cs.CV cs.AI 79%

MedUnifier: Unifying Vision-and-Language Pre-training on Medical Data with Vision Generation Task using Discrete Visual Representations

Ziyang Zhang, Yang Yu, Yucheng Chen, Xulei Yang, Si Yong Yeo

机构 * MedVisAI Lab(MedVisAI实验室) ECE, Northwestern University(电子工程系,西北大学) Institute for Infocomm Research (I 2 R), A*STAR, Singapore(信息与通信研究所(I2R),A*STAR,新加坡) Lee Kong Chian School of Medicine, Nanyang Technological University(Lee Kong Chian医学院,南洋理工大学)

专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

Comments To be pubilshed in CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00289 2025-04-03 cs.CV cs.AI cs.LG 79%

Dual Diffusion for Unified Image Generation and Understanding

Zijie Li, Henry Li, Yichun Shi, Amir Barati Farimani, Yuval Kluger, Linjie Yang, Peng Wang

专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17912 2024-07-19 cs.CL cs.AI cs.LG 79%

SERPENT-VLM : Self-Refining Radiology Report Generation Using Vision Language Models

Manav Nitin Kapadnis, Sohan Patnaik, Abhilash Nandy, Sourjyadip Ray, Pawan Goyal, Debdoot Sheet

专题命中 多模态生成 :multi-modal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CL、cs.AI

Comments 8 pages, 3 figures, 4 tables, Accepted as oral at Clinical NLP workshop at NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.09273 2022-10-24 cs.CV cs.AI 79%

Sound-Guided Semantic Video Generation

Seung Hyun Lee, Gyeongrok Oh, Wonmin Byeon, Chanyoung Kim, Won Jeong Ryoo, Sang Ho Yoon, Hyunjun Cho, Jihyun Bae, Jinkyu Kim, Sangpil Kim

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09146 2026-08-25 cs.SE 版本更新 78%

Exploring the Potential of Program Flowcharts on Code Generation Using Multimodal LLMs

利用多模态大语言模型探索程序流程图在代码生成中的潜力

Yuki Toi, Tao Xiao, Kazushi Tomoto, Masanari Kondo, Yasutaka Kamei

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 研究利用多模态大语言模型探索程序流程图对代码生成的潜力,通过从示例代码生成流程图并与问题陈述一起提供给模型进行代码生成实验,发现结合流程图可提升性能,不同细节程度的流程图效果有差异,还比较了与少样本学习的效果。

Comments 21 pages, Accepted at the 26th IEEE International Conference on Software Quality, Reliability, and Security (QRS 2026), Regular Papers Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02507 2026-08-24 cond-mat.mtrl-sci cs.ET cs.LG physics.app-ph physics.comp-ph 版本更新 78%

Towards Automated Discovery: A Review of Generative Models, Multimodal Learning and Closed-Loop Workflows in Inverse Materials Design

迈向自动发现:逆向材料设计中生成模型、多模态学习与闭环工作流综述

Anand Babu, Rogério Almeida Gouvêa, Gian-Marco Rignanese

机构 * Institute of Condensed Matter and Nanosciences, Université Catholique de Louvain(凝聚态与纳米科学研究所,比利时列日-努瓦尔桑大学) WEL Research Institute(WEL研究机构)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文综述了逆向材料设计中生成晶体结构建模、多模态学习和闭环设计管道的最新进展,重点讨论了可行性约束与物理先验的施加方式、多模态融合策略以及多种逆向设计策略(如条件生成与潜在优化、贝叶斯优化、强化学习和主动学习),并指出了常见失败模式及基于分阶段报告的评估实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18779 2026-08-21 cs.RO 版本更新 78%

DiffDef: A Diffusion Model for Generating Multimodal Goal Shapes From Demonstrations for Deformable Object Manipulation

DiffDef:一种用于从演示中生成可变形物体操纵的多模态目标形状的扩散模型

Bao Thach, Tanner Watts, Siyeon Kim, Britton Jordan, Mohanraj Shanthi, Shing-Hei Ho, James M. Ferguson, Tucker Hermans, Alan Kuntz

机构 * Robotics Center and Kahlert School of Computing, University of Utah(大学计算机学院和机器人中心,犹他大学) NVIDIA Corporation(英伟达公司)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 针对现有可变形物体操纵方法依赖不切实际的目标获取方式、无法处理多模态目标的问题,提出DiffDef扩散模型,学习可行目标形状分布,在仿真和两种物理机器人平台上验证其可提升任务性能。

Comments Published and presented at ICRA 2026. 8 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19116 2026-08-20 cond-mat.mtrl-sci 新提交 78%

JANUS: A Multi-modal Foundation Neural Sampler for Disordered Materials

JANUS:面向无序材料的多模态基础神经采样器

Denis Blessing, Mouyang Cheng, Maximilian Schebek, Jutta Rogal, Mingda Li, Carles Domingo-Enrich, Yuanqi Du

专题命中 多模态生成 :multi-modal(title);multimodal(abstract)

AI总结 研究人员开发JANUS多模态神经采样器,用于无序材料的热力学采样,其以远少于传统方法的能量评估次数重现平衡性质,可用于合金逆设计及半导体缺陷探索,为相关研究提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12592 2026-08-18 cs.LG 版本更新 78%

Represent, Then Generate: Multimodal-Conditioned Time-Series Generation under Irregular Missingness

先表征,再生成:不规则缺失下的多模态条件时间序列生成

Haochen Zhang, Jiaheng Guo, Yu-Chao Huang, Nicholas Konz, Tianlong Chen

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 提出ReCoGen两阶段框架,将多模态条件表征与生成分离,在三个生理基准的16项任务中超越6种生成器,可合成缺失生理信号以实现低侵入性临床监测。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25406 2026-08-07 cs.RO 版本更新 78%

MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation

MMaDA-VLA: 基于统一多模态指令与生成的大型扩散视觉-语言-动作模型

Yang Liu, Pengxiang Ding, Tengyue Jiang, Xudong Wang, Wenxuan Song, Minghui Lin, Han Zhao, Hongyin Zhang, Zifeng Zhuang, Wei Zhao, Siteng Huang, Jinkui Shi, Donglin Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) East China University of Science and Technology(华东理工大学) Huawei Celia Team(华为Celia团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) OpenHelix Robotics

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出MMaDA-VLA模型,通过统一多模态理解与生成框架,解决机器人操控中的时序不一致和长周期误差累积问题,实现高效视觉-语言-动作生成。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09241 2026-08-06 cs.IR 版本更新 78%

Closing the Indexing-Decoding Gap in Multimodal Generative Retrieval via Prefix Retention Optimization

通过前缀保留优化缩小多模态生成式检索中的索引-解码差距

Yufei Chen, Zihan Wang, Yubao Tang, Yukun Zhao, Maarten de Rijke, Zhaochun Ren

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 提出前缀保留优化(PRO)框架,通过前缀排序蒸馏、词汇调度和几何分数融合三种机制,缩小多模态生成式检索中索引与解码之间的差距,提升目标标识符前缀的保留率,在九个多模态检索任务上超越现有基线。

Comments 29 pages, 5 figures; code: https://github.com/layingfish/MGR_PRO

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16555 2026-08-03 cs.IR 版本更新 78%

MMGRec: Multimodal Generative Recommendation with Transformer Model

MMGRec: 基于Transformer模型的多模态生成推荐

Han Liu, Yinwei Wei, Xuemeng Song, Weili Guan, Yuan-Fang Li, Liqiang Nie

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 MMGRec通过生成范式引入多模态推荐,利用分层量化和Transformer模型生成用户偏好的项目标识符,提升推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23523 2026-07-28 cs.AR 新提交 78%

CircuitWeave: Topology-Behavior Alignment for Executable Multimodal RTL Generation

CircuitWeave:用于可执行多模态RTL生成的拓扑-行为对齐

Jiahao Feng, Haiyan Qin, Zhiwei Xie, Wang Kang

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 研究如何从自然语言规范生成RTL,提出CircuitWeave合同介导多模态框架,从原理图和文本提取合同并融合,通过联合目标监督相关过程,在生成可执行RTL上取得较好效果,部分指标高于无原理图的情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01257 2026-07-24 physics.app-ph cond-mat.mes-hall 78%

Trion Engineered Multimodal Transistors in Two dimensional Bilayer Semiconductor Lateral Heterostructures

三重态工程多模态晶体管在二维双层半导体横向异质结中的应用

Baisali Kundu, Poulomi Chakrabarty, Avijit Dhara, Roberto Rosati, Chandan Samanta, Suman K. Chakraborty, Srilagna Sahoo, Sajal Dhara, Saroj P. Dash, Ermin Malic, Saurabh Lodha, Prasana K. Sahoo

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本研究通过二维双层半导体横向异质结实现多模态晶体管,利用内在能级分离调控三重态生成与传输,为光电和量子技术发展提供新路径。

Journal ref Adv. Funct. Mater. 36, no. 26 (2026): e17486

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12923 2026-07-21 eess.SY cs.SY 版本更新 78%

Information-Optimal Formation Geometry Design for Multimodal UAV Cooperative Perception

多模态无人机协同感知的信息最优编队几何设计

Kai Xiong, Xingyu Wu, Anna Duan, Gang Li, Yongjun Huang, Supeng Leng, Jianhua He

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 针对多模态无人机协同感知,提出信息最优优化框架,通过最大化Fisher信息矩阵行列式优化分配与控制,引入等效编队转换策略及稳定飞行控制方案,相比传统方法,视场覆盖、通信信号强度和能耗等方面有显著提升,验证了任务驱动几何分配的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12965 2026-07-15 cs.RO 新提交 78%

MAMMOTH: A Multi-Modal End-to-End Policy for Off-Road Mobility Robust to Missing Modality

MAMMOTH:一种对缺失模态具有鲁棒性的越野移动多模态端到端策略

Ahaan Kotian, Shivani Subramanyan, Suresh Sundaram

机构 * Indian Institute of Science(印度科学研究所)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 研究针对非结构化越野环境自主导航难题,提出MAMMOTH多模态端到端策略。它融合多模态观测,用模态丢弃训练,还采用扩散策略学习联合概率分布,经实验验证性能优越,能提升避撞等能力及对缺失模态的泛化。

Comments Accepted to IROS 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07439 2026-07-03 cs.AR 新提交 78%

A 65 nm Multi-Modal Bayesian Inference Engine with 16.3 fJ/Sample Calibration-Free GRNG for Risk-Aware At-Home Skin Lesion Screening

65 nm 多模态贝叶斯推理引擎,具有 16.3 fJ/样本免校准 GRNG,用于风险感知的家庭皮肤病变筛查

Steven Davis, Likai Pei, Jianbo Liu, Zephan M. Enciso, Boyang Cheng, Xueji Zhao, Danny Z. Chen, Ningyuan Cao

专题命中 多模态生成 :multi-modal(title);multimodal(abstract)

AI总结 提出一种65 nm风险感知多模态贝叶斯推理引擎,通过存内计算架构实现词内混合高斯采样,提升不确定性建模能力,在鲁棒性和精度上超越现有单模态贝叶斯神经网络。

Comments This paper is accepted by IEEE Transactions on Circuits and Systems - Regular Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05503 2026-06-29 cs.CE 版本更新 78%

MolFORM: Multi-modal Flow Matching for Structure-Based Drug Design

MolFORM:基于多模态流匹配的结构药物设计

Jie Huang, Daiheng Zhang

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 提出MolFORM框架,利用多流匹配联合建模离散原子类型和连续3D坐标,并通过基于直接偏好优化的偏好引导微调提升生成质量,在多个评估指标上取得一致改进。

Comments Accepted to ICML 2025 genbio workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22774 2026-06-23 physics.optics 新提交 78%

Autonomous Generation of Metamaterial Databases Based on Multimodal Agents

基于多模态代理的元材料数据库自主生成

Shilong Qin, Zhicai Yu, Xuan Zheng, Yan Zhang, Aodi Yang, Kezhan Zhao, Qi Cheng Chen, Jian Wei You, Tie Jun Cui

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 提出MetaDataGenAgent多模态多代理框架,通过文献到仿真的自动化流程,从非结构化科学文献中提取并生成元材料结构-响应数据库,实现远场波束偏转、近场全息成像等功能。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14267 2026-06-15 cs.RO 新提交 78%

FloVerse: Floor Plan-Guided Multi-Modal Navigation

FloVerse:基于楼层平面图的多模态导航

Weiqi Huang, Shuangyi Dong, Jiaxin Li, Yifei Guo, Zan Wang, Wei Liang

机构 * School of Computer Science & Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract)

AI总结 提出FloVerse任务统一PointNav、ObjectNav和ImageNav,构建FloVerse-1.6K数据集,并设计ThreeDiff两阶段模仿学习策略,利用楼层平面图先验提升导航性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25820 2026-06-11 cs.LG 版本更新 78%

Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models

基于扩散的多模态大语言模型的视觉冗余控制并行解码

Yulin Yuan, Hongshuo Zhao, Xiangming Meng

机构 * Zhejiang University(浙江大学) ZJUI-UIUC Institute(ZJUI-UIUC研究院)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 针对扩散型多模态大语言模型并行解码中视觉冗余问题,提出视觉冗余指数(VRI)和无需训练的视觉冗余控制解码(VRCD)方法,通过令牌到图像的注意力优先选择视觉互补位置,在多个基准上提升准确率。

Comments 18 pages, 5 figures, preprint. Code is available at https://github.com/infiniteYuanyl/VRCD

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23965 2026-06-04 math.NA cs.NA 78%

Multimodal sampling via Schrödinger-Föllmer samplers with temperatures

基于带温度参数的薛定谔-弗尔默采样的多模态采样

Xiaojie Wang, Xiaoyan Zhang

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文通过引入温度参数并基于薛定谔-弗尔默扩散的欧拉离散化提出新采样器,在L^2-Wasserstein距离下获得O(h)的改进收敛率,数值实验表明高温对多模态分布采样至关重要且性能优于Langevin采样器。

Journal ref J. Complexity 96 (2026), Paper No. 102052

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30153 2026-05-29 stat.ML cs.IT cs.LG math.IT math.ST stat.TH 78%

Diffusion Models Are Statistically Optimal for Learning Low-Dimensional Multi-Modal Distributions

扩散模型在学习低维多模态分布时具有统计最优性

Jingda Wu, Changxiao Cai

机构 * Department of Industrial and Operations Engineering, University of Michigan, Ann Arbor, USA(工业与运营工程系,密歇根大学,安娜堡,美国)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文证明扩散模型在学习支撑在低维子空间并集上的分布时,样本复杂度仅依赖于内在维度,达到近最优的1-Wasserstein误差率,无需光滑性或有界密度假设。

Comments accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00944 2026-05-27 cs.CY 78%

Auditing the Reliability of Multimodal Generative Search

审计多模态生成式搜索的可靠性

Erfan Samieyan Sahneh, Luca Maria Aiello

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 通过大规模审计Gemini 2.5 Pro系统,发现3.7%至18.7%的基于视频的生成式搜索声明未被引用来源支持,主要失败模式为不可验证的特异性与夸大声明。

Comments 14 pages, LaTeX, typos corrected, adding Data Availability section + examples in appendix, New plot(overview)

详情

展开后加载摘要…

URL PDF HTML 收藏