arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-09-01 至 2026-09-01 共收录 238 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 24 篇

2602.08336 2026-09-01 cs.CL cs.CV 版本更新 81%

UReason: Benchmarking Reasoning-to-Generation Alignment in Unified Multimodal Models

从推理到像素:统一多模态模型中对齐差距的基准测试

Cheng Yang, Chufan Shi, Bo Shui, Yaokang Wu, Muzi Tao, Huijuan Wang, Ivan Yee Lee, Yong Liu, Xuezhe Ma, Taylor Berg-Kirkpatrick

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校) University of Southern California(南加利福尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文通过UReason基准测试,探讨统一多模态模型中模态对齐问题,发现去上下文生成在图像生成任务中表现更优,揭示了文本推理与生成图像之间存在对齐差距。

Comments Project page: https://ureason.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16990 2026-09-01 cs.CV 版本更新 79%

Dimple: Discrete Diffusion Multimodal Large Language Model with Parallel Decoding

Dimple:采用并行解码的离散扩散多模态大语言模型

Runpeng Yu, Xinyin Ma, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出首个离散扩散多模态大语言模型Dimple,采用自回归与扩散结合的训练范式,性能优于LLaVA-NEXT 3.9%,通过置信解码提升推理效率,还探索了结构先验的响应控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28937 2026-09-01 eess.IV 新提交 78%

Multimodal Deep Learning for Uncertainty-Aware Radiation Pneumonitis Risk Prediction

用于不确定性感知放射性肺炎风险预测的多模态深度学习

Jin Yang, Tian Liu, Jing Wang, Robert Samstein, Kenneth Rosenzweig, Julie Bloom, Ming Chao

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本研究提出MM-DiT框架,通过多模态预训练整合CT图像与放射剂量分布,可联合估计RP风险并量化三类不确定性,在独立队列中验证了其预测准确性与不确定性量化能力。

Comments 30 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31106 2026-09-01 cs.CV cs.SD 新提交 77%

DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

DreamX-Creator:实现2K分辨率原生音视频生成的民主化

Jiashu Zhu, Yanhao Zheng, Ruitian Tian, Rujing Dang, Shen Zhang, Bingze Song, Jiachen Lei, Ruimin Lin, Jiahong Wu, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 多模态生成 :cross-modal(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 DreamX-Creator 1.0是基于7B生成器的紧凑原生联合音视频生成系统,通过多阶段训练与2K细化流水线实现2K分辨率同步音视频生成,性能达开源先进水平,旨在推动该领域研究民主化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03236 2026-09-01 cs.AI 版本更新 77%

Perceive Before Reasoning: A Pre-Reasoning Perception Framework for Efficient and Reliable Proactive Mobile Agents

先感知后推理:一种用于高效可靠主动移动代理的预推理感知框架

Zhijie Ding, Weinan Hong, Zicheng Zhu, Lei Li, Dezhi Kong, Hao Wang, Peng Zhou, Xuchu Jiang, Jiaming Xu

机构 * HyperAI Team, Xiaomi Corporation(HyperAI团队,小米公司) Zhongnan University of Economics and Law(中南财经政法大学) Jilin University(吉林大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 提出预推理感知框架(PRPF),通过轻量级多模态主动感知器(MPP)进行干预门控和上下文压缩,仅在需要时激活主动代理推理器(PAR),以解决主动移动代理中干预时机与方式决策的目标错位和冗余推理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28669 2026-09-01 cs.CV cs.PL cs.SE 新提交 74%

MIRAGE-CAD: Construction-Mediated Multimodal Generation of Executable CAD Programs

MIRAGE-CAD:面向可执行CAD程序的构造介导多模态生成

Jizong Zhan

专题命中 多模态生成 :multimodal(title);分类 cs.CV

AI总结 MIRAGE-CAD针对四类输入实现可执行CAD程序的多模态生成,在2500个保留查询上取得构建与STEP导出成功率,证实需分别评估可执行性、几何保真度等指标。

Comments 64 pages, 5 figures, 20 tables, 7 appendices. Code, evaluation scripts and run reports: https://github.com/Cad-Kernel/MIRAGE-CAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30342 2026-09-01 cs.CV 新提交 70%

CapFrame: Text-Instructed Viewpoint Grounding in 3D Gaussian Scenes via Geometric Pseudo Labels

CapFrame:基于几何伪标签的3D高斯场景中文本引导视角定位

Jirong Li, Satoshi Ikehata, Shuhei Kurita, Ikuro Sato

机构 * Institute of Science Tokyo(东京科学大学) Denso IT Laboratory, Inc.(电装IT实验室) National Institute of Informatics(信息学研究所)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文针对3D高斯场景中虚拟相机位姿需人工设置的问题,提出CapFrame框架,通过检索-转换-优化流程实现文本引导的视角定位,实验表明其对齐度优于基线方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18279 2026-09-01 physics.optics cs.LG 版本更新 67%

A Comprehensive Review of Large Language Models for Nanophotonics: From Surrogate Modeling to Autonomous Design

面向纳米光子学的大语言模型综合综述:从代理建模到自主设计

Huanshu Zhang, Kegeng Tang, Lei Kang, Sawyer D. Campbell, Zihao Wang, Douglas H. Werner

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Tennessee at Chattanooga(田纳西大学查塔努加分校)

专题命中 多模态生成 :multimodal(abstract);multimodal foundation model(abstract)

AI总结 该综述探讨大语言模型(LLMs)如何通过语义接口、代码生成及工具编排改进纳米光子学工作流,梳理相关方法的两类模式及跨学科应用,展望具备物理感知的多模态基础模型,推动AI从被动工具向主动科研合作者转变。

Comments Accepted for publication in Advanced Photonics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30727 2026-09-01 cs.CV cs.AI 新提交 62%

RailGen: Improving Railway Intrusion Detection via Agent-Guided Small-Scale Foreign Object Generation

RailGen:通过智能体引导的小规模异物生成改进铁路入侵检测

Quan Hao, Ziyang Tao, Chenxi Zhang, Yudong Wang, Rui Shi, Liguo Zhang

机构 * School of Information Science and Technology, Beijing University of Technology(北京工业大学信息科学与技术学院) College of Computer Science, Beijing University of Technology(北京工业大学计算机学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对铁路异物检测的长尾小样本问题,提出RailGen智能体生成高质量小异物样本,结合FocalDEIM框架优化检测,显著提升了检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30307 2026-09-01 cs.CV cs.AI 新提交 62%

ScenePilot: Grow-and-Repair Policy for Text-Driven 3D Indoor Scene Generation

ScenePilot:面向文本驱动的3D室内场景生成的生长-修复策略

Jiawei Zhang, Hongsong Wang, Pan Zhou

机构 * Southeast University(东南大学) Singapore Management University(新加坡管理大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 ScenePilot是一种检索增强的生长-修复框架,通过HRAP模块检索布局先验、RMR模块进行轻量修复,实现了高效的文本驱动3D室内场景生成,提升了物理合理性等性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27505 2026-09-01 cs.CL cs.AI 版本更新 62%

A Survey on Rubric-Guided Reinforcement Learning for Language Models

面向语言模型的准则引导强化学习综述

Zifei Shan, Fangning Shao

机构 * WeChat, Tencent(腾讯微信)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 该综述针对传统RLHF的缺陷,提出贝叶斯框架并沿先验-后验轴分类准则引导强化学习,分析语言学相关对齐问题,明确未来研究方向。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30712 2026-09-01 cs.CL 新提交 57%

GUIDE: Guiding Internal Evidence with Language Instructions

GUIDE:用语言指令引导内部证据

Soyeon Caren Han, Hyunsuk Chung, Jinwoo Kim, Seungyeon Ji, Kyungreem Han

机构 * The University of Melbourne(墨尔本大学) Korea Institute of Science and Technology(韩国科学技术研究院) Korea University(高丽大学) University of Science and Technology(科学技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 研究针对多模态模型依赖非指令要求的捷径线索的问题,提出GUIDE框架,结合分组参数高效适配与指令条件门控调节多模态证据通路,在多模态任务上提升鲁棒性与可控性,拓展了多模态指令跟随的范围。

Journal ref EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30352 2026-09-01 cs.AI cs.HC 新提交 57%

Co-Annotator: Expert-Distilled ViT and VLM for Visual and Documentation Guidance in Age-Related Macular Degeneration

Co-Annotator:用于年龄相关性黄斑变性视觉与文档指导的专家蒸馏ViT及VLM

Ziheng "Leo" Li, Benjamin Freeman, Akshay Raman, Kavin Aravindhan Rajkumar, Xinxin Fang, Rishabh Srivastava, Steven Feiner, Kaveri A. Thakoor

机构 * Columbia University(哥伦比亚大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本研究提出Co-Annotator,将专家注视与口述提炼为AOI指导的ViT和生物标志物预填充的VLM,在AMD诊断中联合应用可显著提升效率且不降低准确率。

Comments 23 pages, 11 figures. To appear in UIST '26: Proceedings of the 39th Annual ACM Symposium on User Interface Software and Technology, November 02-05, 2026, Detroit, MI, USA. DOI: 10.1145/3830398.3830722

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29793 2026-09-01 cs.CV 新提交 57%

GridFlow: Structured Latent Flow for Seamless City-Scale 3D Point Cloud Generation

GridFlow:用于无缝城市级三维点云生成的结构化潜在流

Xinyu Wang, Muhammad Ibrahim, Atif Mansoor, Ajmal Mian

机构 * The University of Western Australia(西澳大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 该研究提出GridFlow框架,结合多模态条件生成城市级无缝三维点云,并构建City3D-MultiGen基准,实验显示其性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31009 2026-09-01 cs.LG 新提交 50%

Language-Informed Flow Matching for Trend-Guided Structure-Based 3D Molecular Generation

用于趋势引导的基于结构的3D分子生成的语言知情流匹配

Tianyu Gao, Zhikai Su, Jiashu Li, Wenjun Gao, Zichuan Ying, Zhe Zhao, Fei Zhang, Ye Wei

机构 * City University of Hong Kong(香港城市大学) The University of Hong Kong(香港大学) Stanford University(斯坦福大学)

专题命中 多模态生成 :cross-modal(abstract)

AI总结 该研究提出基于流匹配的语言知情跨模态框架LiFT,通过“感知-演化-组装”智能体和自条件解耦路由器实现趋势引导的3D分子生成,在Cross-Docked2020数据集上验证了其分布匹配、药物化学指标及结构有效性的优势。

Comments Accepted at Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29745 2026-09-01 cs.CR 新提交 50%

JITterFlip: Uncovering Fault Attack Surfaces in JIT-Compiled LLM Serving

JITterFlip:揭示JIT编译大语言模型服务中的故障攻击面

Tairui Wang, Zhi Zhang, Yansong Gao, Xin Zhang, Qingni Shen, Zhonghai Wu

专题命中 多模态生成 :multimodal(abstract)

AI总结 JITterFlip是首个针对基于GPU的LLM推理主机侧JIT服务控制平面的位翻转攻击,可生成乱码或正确输出,能绕过现有防御,通过Rowhammer攻击实现跨边界传播,在四个LLM上取得高PPL或延迟放大效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29504 2026-09-01 cs.NI 新提交 50%

RadioSight: Predictive mmWave XR Network Optimization from Dynamic Neural Radio Fields

RadioSight:基于动态神经无线电场的预测性毫米波XR网络优化

Lihao Zhang, Paul Kudyba, Zhenlin An, Haijian Sun

专题命中 多模态生成 :multi-modal(abstract)

AI总结 针对毫米波XR网络波束管理易受移动和遮挡导致中断的问题,提出RadioSight系统,结合反向波束追踪与语义同步,实现实时预测性波束优化,显著降低误差、提升吞吐量与链路稳定性。

Comments Accepted to ACM MobiCom 2026. 21 pages, 20 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29255 2026-09-01 cs.NI cs.LG 新提交 50%

A-MADiff: Attention-Guided Multi-Agent DRL with Diffusion Policies for Memory-Aware Task Orchestration in Mobile AIGC Networks

A-MADiff:面向移动AIGC网络中感知内存的任务编排的注意力引导多智能体深度强化学习与扩散策略

Chongzhi Wu, Zhengtao Li, Jiawen Kang, Jinbo Wen, Xiaohuan Li, Maomao Zhang, Ekram Hossain

专题命中 多模态生成 :multi-modal(abstract)

AI总结 针对移动AIGC网络中AIGC推理任务导致GPU内存耗尽的问题,本文提出A-MADiff算法,通过协作式多智能体框架建模Dec-POMDP,采用扩散策略与注意力引导机制,显著提升了累积奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26364 2026-09-01 cs.LG 版本更新 50%

Data-to-Energy Stochastic Dynamics

数据到能量的随机动力学

Kirill Tamogashev, Esmeralda S. Whitammer

机构 * University of Edinburgh(爱丁堡大学) CIFAR Fellow(蒙特利尔认知研究院研究员)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出了一种数据到能量的IPF方法,用于建模Schrödinger桥问题,无需数据样本即可学习多模态分布之间的传输,并改进了扩散系数的学习。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 64 篇

2606.29689 2026-09-01 cs.CL 版本更新 89%

Can MLLMs Critique Like Humans? Evaluating Open-Ended Aesthetic Reasoning in Multimodal Large Language Models

MLLM 能否像人类一样进行批评?评估多模态大语言模型中的开放式审美推理

Sajjad Ghiasvand, Maryam Amirizaniani, Haniyeh Ehsani Oskouie, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * UCSB(加州大学圣塔芭芭拉分校) University of Washington(华盛顿大学) UCLA(加州大学洛杉矶分校)

专题命中 多模态评测 :MLLM(title_cn,abstract);multimodal(title,abstract);分类 cs.CL

AI总结 本文评估多模态大语言模型在开放式审美批评中的表现,发现基于参考的相似度指标存在误导,模型在选择性、特异性和多样性方面与人类批评存在系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29802 2026-09-01 cs.CV 新提交 85%

Foundation and Multimodal Large Language Models for Face Presentation and Morph Attack Detection

用于人脸呈现与变形攻击检测的基础模型及多模态大语言模型

Hatef Otroshi Shahreza, Asif Hussain Khan, Peter Lorenz, Alain Komaty, Sébastien Marcel

机构 * Idiap Research Institute(Idiap研究所) Université de Lausanne(洛桑大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文研究通用基础模型和多模态大语言模型是否包含人脸呈现与变形攻击相关信息,通过五种方法在8个公开数据集上测试,发现微调后模型跨数据集检测性能达SOTA,将开源代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29278 2026-09-01 cs.CL 新提交 85%

Modality Fault Lines: Structural Corruptions Reveal Fragile Omni-Modal Reasoning

模态断层线:结构损坏揭示脆弱的全模态推理

Zhaolu Kang, Meixin Wu, Yu Xue, Yingjie He, Qiming Shi, Lei Wei, Yidi Wang, Richeng Xuan, Zhichao Hu

机构 * Tencent(腾讯) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 多模态评测 :omni-modal(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CL

AI总结 本研究提出SCEval诊断评估协议,通过结构损坏揭示全模态模型的脆弱推理,发现文本-视觉损坏是最稳定的共享断层线,多模态退化非相加性,干净准确率不代表结构不可靠时仍可靠。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28762 2026-09-01 cs.CV 新提交 85%

Inter-3D VQA: A Roadside Multimodal Benchmark for 3D Spatiotemporally Grounded Visual Question Answering

Inter-3D VQA:用于3D时空视觉问答的路侧多模态基准

Shaozu Ding, Linan Song, Dajiang Suo

机构 * The Polytechnic School, Arizona State University(亚利桑那州立大学理工学院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出用于交叉口3D时空视觉问答的路侧多模态基准Inter-3D VQA,构建含40.7万问答对的数据集,提出基线模型Inter-Geo与评估框架Inter-Metrics,实验显示Inter-Geo在接地时空推理任务上优于基于图像的VLM。

Comments Accepted to EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28062 2026-09-01 cs.AI 版本更新 85%

WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents

WeAgent-MMSearch:面向多模态搜索智能体的原生文本-视觉交互

Zongkai Liu, Hui Zhang, Liqiang Niu, Zhen Cao, Han Li, Juntao Liu, Wenchao Chen, Chengduo Zhao, Chao Yu, Fandong Meng

机构 * Weixin AI, Tencent(腾讯微信人工智能) Sun Yat-sen University(中山大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对现有多模态搜索智能体忽略图像、长程交互易失败的问题,提出 WeAgent-MMSearch 系统,通过 WeAgent-Harness 实现文本-视觉交互,经 FA-GSPO 后训练后,模型在多模态搜索基准上性能大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30475 2026-09-01 cs.CL cs.AI 新提交 84%

ImageEval 2026: Culturally Grounded Arabic Multimodal Evaluation

ImageEval 2026:基于文化语境的阿拉伯语多模态评估

Samir Abdaljalil, Hunzalah Hassan Bhatti, Ahlam Bashiti, Farina Amir, Md Arid Hasan, Basel Mousi, Nadir Durrani, Fahim Dalvi, Zien Sheikh Ali, Erchin Serpedin, Hasan Kurban, Mustafa Jarrar, Shammur Absar Chowdhury, Firoj Alam

机构 * Texas A&M University(德克萨斯农工大学) Qatar Computing Research Institute(卡塔尔计算研究所) Birzeit University(比尔宰特大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学) University of Toronto(多伦多大学)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CL、cs.AI

AI总结 ImageEval 2026共享任务含AynVQA和CRAI-Bench两项阿拉伯语多模态评估任务,14支团队参与,相关资源已发布,凸显文化语境多模态评估的挑战。

Comments Arabic LLMs, Multilingual, Multimodal, Shared Task

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30903 2026-09-01 cs.CL 新提交 83%

MMDS-Bench: Benchmarking Multimodal Large Language Models on Dynamic Stance in Social Media Interactions

MMDS-Bench:面向社交媒体互动中动态立场的多模态大语言模型基准测试

Yuzhe Ding, Kang He, Li Zheng, Shengwu Zheng, Teng Shi, Fei Li, Chong Teng, Donghong Ji

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学网络安全学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 本研究构建多模态动态立场分类基准MMDS-Bench,评估12个多模态大语言模型,发现其在关系推理类多模态动态立场理解上仍存在不足。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29286 2026-09-01 cs.AI 新提交 83%

MMPCBench: Benchmarking Multimodal Large Language Models on Proactive Critique of Flawed Inputs

MMPCBench:评估多模态大语言模型对有缺陷输入的主动批判能力的基准

Jinzhe Li, Gengxu Li, Jinnan Li, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) International Center of Future Science, Jilin University(吉林大学未来科学国际中心) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动人机智能工程研究中心)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型主动错误处理评估的空白,提出MMPCBench基准框架,测试发现主流MLLMs在主动批判上存在明显弱点,还识别出“一致性缺口”问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23938 2026-09-01 cs.CL 版本更新 83%

OmniACBench: A Benchmark for Evaluating Context-Grounded Acoustic Control in Omni-Modal Models

OmniACBench:一种评估多模态模型上下文感知语音控制的基准

Seunghee Kim, Bumkyu Park, Kyudan Jung, Joosung Lee, Soyoon Kim, Jeonghoon Kim, Taeuk Kim, Hwiyeol Jo

机构 * Hanyang University(翰阳大学) Seoul National University(首尔国立大学) KAIST AI(韩国科学技术院人工智能研究所) NAVER Cloud(NAVER云)

专题命中 多模态评测 :omni-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 OmniACBench评估多模态模型在上下文感知语音生成中的能力,通过语音速率、音调等六种特征验证,揭示模型在多模态整合中的瓶颈及三种常见失败模式。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15897 2026-09-01 cs.CV 版本更新 83%

ThermoSplat: Cross-Modal 3D Gaussian Splatting with Feature Modulation and Geometry Decoupling

ThermoSplat: 多模态3D高斯点云的特征调制与几何解耦

Zhaoqi Su, Shihai Chen, Xinyan Lin, Liqin Huang, Zhipeng Su, Xiaoqiang Lu

机构 * College of Physics and Information Engineering, Fuzhou University(物理与信息工程学院,福州大学)

专题命中 多模态评测 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 ThermoSplat通过特征调制和几何解耦实现多模态3D高斯点云的深度光谱感知重建,提升多光谱场景的渲染质量。

Journal ref 10.1016/j.neucom.2026.134796

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29037 2026-09-01 cs.CV cs.AI 新提交 82%

DocIntent: Answerability-Guided Agentic Restoration for Real-World Document Visual Question Answering

DocIntent:面向真实场景文档视觉问答的可回答性引导智能体式恢复方法

Zihan Huang, Shihang Wu, Junle Liu, Peirong Zhang, Yongxin Shi, Xuhan Zheng, Lianwen Jin

机构 * South China University of Technology(华南理工大学)

专题命中 多模态评测 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对真实场景退化影响多模态大语言模型文档问答的问题,提出无需训练的DocIntent框架,通过评估可回答性、选择性调用恢复工具及比较式回滚机制,提升了各类MLLM在WildDoc基准上的表现。

Comments 25 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏