arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-31 至 2026-08-31 共收录 37 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 5 篇

2502.12119 2026-08-31 cs.CV cs.AI cs.CL 版本更新 82%

PRISM: Self-Pruning Intrinsic Selection Method for Training-Free Multimodal Data Selection

PRISM:免训练多模态数据选择的自剪枝内在选择方法

Jinhe Bi, Aniri, Zengjie Jin, Yifan Wang, Danqi Yan, Wenke Huang, Xiaowen Ma, Sikuan Yan, Artur Hecker, Mang Ye, Xun Xiao, Hinrich Schuetze, Volker Tresp, Yunpu Ma

机构 * LMU Munich(慕尼黑大学) Munich Research Center, Huawei Technologies(慕尼黑研究中心,华为技术) METEOR School of Computer Science, Wuhan University(武汉大学计算机学院) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对多模态大语言模型视觉指令数据冗余问题,提出一种免训练框架PRISM,通过隐式重中心化消除视觉特征各向异性导致的全局语义漂移,实现高效数据选择,在降低计算成本的同时提升模型性能。

Comments Accepted to EMNLP 2026 and selected for the ACL 2026 Best Paper Consideration

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22737 2026-08-31 cs.CV cs.AI 版本更新 62%

CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models

CompareBench: 一个用于评估视觉比较推理能力的视觉-语言模型基准

Jie Cai

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CompareBench是一个用于评估视觉-语言模型中视觉比较推理能力的基准,揭示了当前模型在时间排序、空间关系和基本计数上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26866 2026-08-31 cs.CV 版本更新 57%

Order Matters: A Chinese Multi-Panel Meme Benchmark for Vision-Language Reasoning

顺序很重要:面向视觉-语言推理的中文多面板梗图基准

Haihan Li, Haihao Li, Zhenfei Xu, Jize Qian, Yubo Xie

机构 * Shanghai Maritime University(上海海事大学) Dalian Maritime University(大连海事大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究推出中文多面板梗图基准CMPM,评估大型视觉-语言模型对梗图的顺序感知推理能力,发现模型在打乱顺序时准确率大幅下降,Gemini 3.1 Pro和GPT-5.5表现优于开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20419 2026-08-31 cs.CV 版本更新 57%

Spectral Query-Key Product Weight Steering for Training-Free VLM Hallucination Mitigation

谱查询-键乘积权重引导用于免训练VLM幻觉缓解

Karn Tiwari, Varnith Chordia, Prathosh A P

机构 * Indian Institute of Science, Bengaluru(印度科学理工学院,班加罗尔) Snap Research(Snap 研究院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出QK乘积引导,一种无数据、免训练、零推理成本的权重编辑方法,通过抑制中间层主导奇异模式减少对象幻觉,在三个GQA基VLM上平均降低CHAIR$_s$ 4.0%。

Comments Published at the Workshop on Actionable Interpretability at COLM 2026, EMNLP Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28387 2026-08-31 cs.AI cs.LG 版本更新 57%

Prompts Without Evidence: How Neuroimaging Mentions Shift Clinical Vision-Language Model Predictions

脚手架效应:提示框架如何驱动临床VLM评估中的表面多模态增益

Doan Nam Long Vu, Simone Balloccu

机构 * Technical University of Darmstadt(达姆施塔特技术大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究发现,在临床VLM评估中,提示中提及MRI可用性即可解释70-80%的性能提升,与图像数据是否存在无关,这种“脚手架效应”揭示了表面评估无法反映真实多模态推理能力。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 3 篇

2604.14129 2026-08-31 cs.CV 版本更新 83%

Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models

别让视频说话:面向音频-视觉语言模型的音频对比偏好优化

Ami Baid, Zihui Xue, Kristen Grauman

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出ACPO方法,通过引入输出对比和输入对比目标,解决音频-视觉语言模型中视频驱动的音频幻觉问题,提升音频真实性和多模态能力。

Comments ECCV 2026 camera-ready version. Project page: this https URL (https://vision.cs.utexas.edu/projects/acpo/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06199 2026-08-31 eess.AS cs.AI cs.SD 版本更新 62%

FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation

FastSLM:用于高效长语音自适应的层次时间抽象

Junseok Lee, Chang-Jae Chun

机构 * OKESTRO Sejong University(世宗大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 针对长语音输入中标记爆炸问题,提出FastSLM架构,通过层次时间抽象器(HTA)实现每秒1.67个标记的极端压缩率(减少97%),在显著降低计算量和参数的同时,在长语音基准上达到与最先进模型竞争的性能。

Comments Contents updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12817 2026-08-31 eess.SP cs.SD 版本更新 50%

An Attention-Assisted AI Model for Real-Time Underwater Sound Speed Estimation Leveraging Remote Sensing Sea Surface Temperature Data

一种结合注意力机制的多模态数据融合模型用于实时估计水下声速

Pengfei Wu, Wei Huang, Yujie Shi, Feng Yin, Hao Zhang

机构 * Faculty of Information Science and Engineering, Ocean University of China(中国海洋大学信息科学与工程学部) School of Environmental Science and Engineering, Ocean University of China(中国海洋大学环境科学与工程学院)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出一种结合注意力机制的多模态数据融合卷积神经网络,用于实时估计水下声速剖面,通过提取远程感应海面温度数据与历史声速剖面特征之间的关系,提升估计精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 1 篇

2606.05917 2026-08-31 cs.CV cs.CL 版本更新 76%

MemoryCard: Topic-Aware Multi-Modal Clue Compression for Long-Video Question Answering

MemoryCard: 面向长视频问答的主题感知多模态线索压缩

Qing Yang, Pengcheng Huang, Xinze Li, Zhenghao Liu, Yukun Yan, Yu Gu, Ge Yu, Gang Li, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Digital China Group(数字中国集团)

专题命中 视频多模态 :multi-modal(title);分类 cs.CV、cs.CL

AI总结 提出MemoryCard框架,通过将长视频分割为主题事件单元并生成事件级摘要和代表性视觉时刻,以记忆卡形式增强VLMs的长视频问答能力,在相同视觉令牌预算下准确率提升高达21.8%。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 1 篇

2608.20756 2026-08-31 cs.CV cs.AI 版本更新 89%

Vis-Poison: Poisoning Visual Knowledge in Multimodal Retrieval-Augmented Generation

Vis-Poison:多模态检索增强生成中的视觉知识投毒攻击

Rujin Liang, Zhongpu Chen, Yuhao Lei, Xin Miao

机构 * Southwestern University of Finance and Economics(西南财经大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 跨模态检索 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出Vis-Poison攻击,通过自动化多智能体方法构建视觉合理的被投毒图像,在黑盒设置下对多模态RAG系统实现40.16%-65.40%的攻击成功率,且对仅依赖参数知识的MLLM平均成功率超60%。

Comments Findings of EMNLP, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 4 篇

2509.04438 2026-08-31 cs.CV cs.CL 版本更新 62%

The Telephone Game: Evaluating Semantic Drift in Unified Models

电话游戏:评估统一模型中的语义漂移

Sabbir Mollah, Rohit Gupta, Sirnam Swetha, Qingyang Liu, Ahnaf Munir, Mubarak Shah

机构 * Center For Research in Computer Vision, University of Central Florida, USA(计算机视觉研究中心,中央佛罗里达大学)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.CL

AI总结 该研究提出语义漂移协议(SDP)等方法,评估统一模型在交替执行图像-文本理解与生成时的语义漂移,发现现有孤立基准无法预测模型的多轮表现,为统一模型可靠性评估提供了更准确的方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22392 2026-08-31 cs.CV 版本更新 57%

iOSPointMapper: RealTime Pedestrian and Accessibility Mapping with Mobile AI

iOSPointMapper: 基于移动AI的实时行人及可达性制图

Himanshu Naidu, Yuxiang Zhang, Sachin Mehta, Anat Caspi

机构 * University of Washington(华盛顿大学) Paul G. Allen School of Computer Science and Engineering(保罗·G·艾伦计算机科学与工程学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 iOSPointMapper通过移动AI实现实时人行道制图,结合语义分割、LiDAR和GPS数据,提供隐私保护的数据收集与多模式交通数据整合,提升行人基础设施的可达性。

Comments Presented at the Transportation Research Board (TRB) 105th Annual Meeting, 2026. Revised manuscript with expanded methodology descriptions, clarified feature localization procedure, minor corrections and formatting updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20971 2026-08-31 cs.LG cs.CV 版本更新 57%

Amortizing intractable inference in diffusion models for vision, language, and control

在视觉、语言与控制任务的扩散模型中分摊难解推理

Siddarth Venkatraman, Moksh Jain, Luca Scimeca, Minsu Kim, Marcin Sendera, Mohsin Hasan, Luke Rowe, Sarthak Mittal, Pablo Lemos, Emmanuel Bengio, Alexandre Adam, Jarrid Rector-Brooks, Yoshua Bengio, Glen Berseth, Esmeralda S. Whitammer

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文针对扩散模型用作下游任务先验时的难解后验推理问题,提出相对轨迹平衡方法,在视觉、语言、多模态及连续控制等任务上取得良好效果

Comments NeurIPS 2024; code: this https URL (https://github.com/GFNOrg/diffusion-finetuning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19088 2026-08-31 quant-ph math-ph physics.optics 版本更新 50%

Efficient and scalable inter-module switching for distributed quantum computing architectures

分布式量子计算架构的高效可扩展模块间交换

Kamil Bradler

专题命中 多模态生成 :any-to-any(abstract)

AI总结 针对分布式量子计算模块间的高效可扩展交换需求,基于广义马赫-曾德尔干涉仪构建去中心化交换方案,实现主动光深度随逻辑块数对数缩放且不损失连通性。

Comments v3: close to the published version

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 10 篇

2507.20409 2026-08-31 cs.CL cs.AI cs.CY 版本更新 81%

Cognitive Chain-of-Thought (CoCoT): Structured Multimodal Reasoning about Social Situations

认知链式推理(CoCoT):关于社会情境的结构化多模态推理

Eunkyu Park, Wesley Hanwen Deng, Gunhee Kim, Motahhare Eslami, Maarten Sap

机构 * Seoul National University(首尔国立大学) Human-Computer Interaction Institute, Carnegie Mellon University(人机交互研究所,卡内基梅隆大学) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CoCoT框架,通过感知、情境推断和规范应用三个阶段提升多模态社会推理能力,在多个任务中取得显著提升。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18154 2026-08-31 cs.CL cs.AI cs.DB 版本更新 81%

FENCE: A Financial and Multimodal Jailbreak Detection Dataset

FENCE:一个金融和多模态越狱检测数据集

Mirae Kim, Seonghun Jeong, Youngjun Kwak

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 针对金融领域多模态越狱检测资源匮乏的问题,提出FENCE数据集,包含韩英双语文本和图像,用于训练和评估检测器,实验表明基线检测器准确率达99%。

Comments lrec 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06869 2026-08-31 cs.AI 版本更新 79%

Evidence-Based Intelligent Diagnostic and Therapeutic Visualization System with Large Language Models: Multi-Turn Interaction and Multimodal Treatment Plan Generation

基于证据的智能诊断与治疗可视化系统与大语言模型:多轮交互与多模态治疗方案生成

Yunhan Wang, Yuda Wang, Zhiying Tu, Mingqiang Song, Li Song, Kun Li, Dianhui Chu, Bolin Zhang

机构 * Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Harbin Institute of Technology (Weihai) Qingdao Research Institute(哈尔滨工业大学(威海)青岛研究院) Shandong Key Laboratory of Digital Service Computing Technology and Systems(山东省数字服务计算技术与系统重点实验室) Weihai Municipal Hospital(威海市人民医院) Shanghai Taizhu Technology Co., Ltd(上海泰山技术有限公司) Tianjin Zhifu Qihuang Medical Technology Co., Ltd(天津中孚启黄医疗技术有限公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 提出知识增强的可视化诊断系统,通过知识图谱约束、信息增益驱动提问和多模态治疗呈现,提升中医辨证透明度和治疗可解释性。

Comments 29 pages, 9 figures, 5 tables, including supporting information

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17304 2026-08-31 cs.CV 版本更新 79%

3D MRI-Based Alzheimer's Disease Classification Using Multi-Modal 3D CNN with Leakage-Aware Subject-Level Evaluation

基于3D MRI的阿尔茨海默病分类:使用多模态3D CNN与泄漏感知的受试者级评估

Md Sifat, Sania Akter, Akif Islam, Md. Ekramul Hamid, Abu Saleh Musa Miah, Najmul Hassan, Md Abdur Rahim, Jungpil Shin

机构 * University of Rajshahi(拉贾斯坦大学) University of Aizu(御所大学) Pabna University of Science(帕布纳科学大学)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出一种多模态3D卷积神经网络,利用原始OASIS 1 MRI体积进行阿尔茨海默病分类,通过受试者级交叉验证实现72.34%的准确率和0.7781的ROC AUC,验证了体积分析在疾病分类中的有效性。

Comments 4 tables, 6 figures, Accepted at 2026 International Conference on Power, Electronics, Communications, Computing, and Intelligent Infrastructure (PECCII)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07576 2026-08-31 cs.HC cs.CV 版本更新 79%

A Multimodal Dataset of Student Oral Presentations with Sensors and Evaluation Data

面向学生口头陈述的多模态数据集,包含传感器和评估数据

Alvaro Becerra, Ruth Cobos, Roberto Daza

机构 * Universidad Autonoma de Madrid, School of Engineering(马德里自治大学工程学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 SOPHIAS是一个包含学生口头陈述的多模态数据集,整合了传感器和评估数据,用于研究多模态行为与表现的关系及自动化反馈工具的开发。

Comments Preprint of an article accepted for publication in Scientific Data. GitHub repository of the dataset at: this https URL (https://github.com/dataGHIA/SOPHIAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14741 2026-08-31 cs.CV cs.AI 版本更新 76%

PolyComp: A Polycube-based Benchmark for Compositional 3D Spatial Reasoning in Multimodal Models

PolyComp:面向多模态模型组合式3D空间推理的基于多立方体(polycube)的基准测试集

Siddharth Patel

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

AI总结 该研究推出PolyComp基准测试集,考察多模态模型的组合式3D空间推理能力,测试了GPT-5.6 Sol等模型的准确率与成本,并发布了120个问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21919 2026-08-31 cs.CV cs.AI 版本更新 62%

SDGBiasBench: Benchmarking and Mitigating Vision--Language Models' Biases in Sustainable Development Goals

SDGBiasBench: 评估和减轻可持续发展目标中视觉-语言模型的偏见

Zihang Lin, Huaiyuan Qin, Muli Yang, Hongyuan Zhu

机构 * Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SDGBiasBench,一个用于评估和减轻可持续发展目标中视觉-语言模型偏见的大型基准测试集,通过分析模型在决策和估计层面的偏见,提出CADE方法以减少偏见,提高模型的准确性和可靠性。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06079 2026-08-31 cs.CV cs.AI 版本更新 62%

Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning

通过双自一致性强化学习实现科学图形程序合成

Juekai Lin, Yun Zhu, Honglin Lin, Sijing Li, Tianwei Lin, Zheng Liu, Xiaoyang Wang, Wenqiao Zhang, Lijun Wu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出双自一致性强化学习框架,结合高质量数据集和多维基准,提升科学图形到可编辑TikZ代码的转换能力,实现视觉与结构的高精度优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17198 2026-08-31 cs.CV cs.AI 版本更新 62%

Riverbank Erosion Analysis in Bangladesh Using Spatiotemporal Segmentation

基于时空分割的孟加拉国河岸侵蚀分析

M. Saifuzzaman Rafat, Akif Islam, Mohd Ruhul Ameen, Momen Khandoker Ope, Abu Saleh Musa Miah, Jungpil Shin

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本研究采用适配通用分割模型SAM的参数高效方法,基于500组卫星图像对构建数据集,实现孟加拉国河岸侵蚀的快速可靠监测,模型在测试集上表现优异且具备区域泛化能力。

Comments 5 figures, 4 Tables, Accepted to 2026 International Conference on Power, Electronics, Communications, Computing, and Intelligent Infrastructure (PECCII)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23607 2026-08-31 cs.CV cs.RO 版本更新 57%

Reasoning models do not yet follow their reasoning in autonomous driving: The KITScenes LongTail Dataset

长尾驾驶场景与推理轨迹:KITScenes长尾数据集

Royden Wagner, Omer Sahin Tas, Jaime Villa, Felix Hauser, Yinzhe Shen, Marlon Steiner, Dominik Strutz, Carlos Fernandez, Quentin Delfosse, Christoph Weinhuber, Christian Kinzig, Guillermo S. Gutierrez-Cabello, Hendrik Königshof, Fabian Immel, Richard Schwarzkopf, Nils Alexander Rack, Kevin Rösch, Kaiwen Wang, Jan-Hendrik Pauls, Martin Lauer, Igor Gilitschenski, Holger Caesar, Christoph Stiller

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) FZI Research Center for Information Technology(FZI信息技术研究中心) University Charles III of Madrid(马德里卡洛斯三世大学) Technical University of Madrid(马德里理工大学) University of Toronto(多伦多大学) Delft University of Technology(代尔夫特理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出KITScenes长尾数据集,通过多视角视频、轨迹、指令和推理轨迹提升模型在长尾驾驶场景下的泛化能力,评估指令遵循与语义连贯性。

Comments 27 pages; v2: update MMS values (bugfix); v3: more focus on reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态Agent 4 篇

2601.19151 2026-08-31 cs.AI cs.MA 版本更新 83%

Multimodal Collaborative Debate for Zero-Shot Time Series Reasoning

TS-Debate:多模态协作辩论用于零样本时间序列推理

Patara Trirat, Jin Myung Kwak, Jay Heo, Heejun Lee, Sung Ju Hwang

机构 * KAIST Seoul(韩国科学技术院)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 TS-Debate通过多模态协作辩论框架,在零样本时间序列推理中实现显著性能提升,通过专门代理和结构化协议提升模态保真度和数值精度。

Comments EMNLP 2026 (Main), Project Page: this https URL (https://deepauto-ai.github.io/ts-debate/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26536 2026-08-31 cs.CL cs.AI cs.CV cs.LG cs.RO 版本更新 80%

OceanGym: A Benchmark Environment for Underwater Embodied Agents

OceanGym: 一个用于水下具身智能体的基准环境

Yida Xue, Mingjun Mao, Xiangyuan Ru, Yuqi Zhu, Baochang Ren, Shuofei Qiao, Mengru Wang, Shumin Deng, Xinyu An, Ningyu Zhang, Ying Chen, Huajun Chen

专题命中 多模态Agent :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 OceanGym通过多模态大语言模型构建首个水下具身智能体基准,揭示水下环境感知与规划的挑战,推动水下自主系统发展。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10891 2026-08-31 cs.LG cs.AI cs.CV cs.RO eess.SY 版本更新 62%

Transformer-Based Autonomous Driving Models and Deployment-Oriented Compression: A Survey

基于Transformer的自动驾驶模型与面向部署的压缩:综述

Juan Zhong, Yuhang Shi, Zukang Xu, Xi Chen

机构 * Renmin University of China(中国人民大学) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院) Shanghai Academy of AI for Science(上海人工智能科学研究院) Department of houmo.ai(houmo.ai部门)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了基于Transformer的自动驾驶模型,并从部署角度分析了压缩与加速策略(如量化、剪枝、知识蒸馏等)如何影响模型设计、部署性、鲁棒性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23149 2026-08-31 cs.AI 版本更新 57%

Describe-Then-Act: Proactive Agent Steering via Distilled Language-Action World Models

描述-然后-行动:通过蒸馏的语言-动作世界模型实现前瞻性智能体导航

Massimiliano Pappa, Luca Romani, Valentino Sacco, Alessio Palma, Stéphane Lathuilière, Fabio Galasso, Xavier Alameda-Pineda, Indro Spinelli

机构 * Sapienza University of Rome, Italy(罗马大学萨皮恩扎) Inria, Univ. Grenoble Alpes, CNRS, LJK(法国国家信息与自动化技术研究所)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.AI

AI总结 本文提出DILLO模型,通过蒸馏方法实现无需视觉模拟的前瞻性智能体导航,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 多模态训练与对齐 6 篇

2509.19212 2026-08-31 cs.CL cs.AI 版本更新 88%

Steering Multimodal Large Language Models Decoding for Context-Aware Safety

面向上下文感知安全的多模态大语言模型解码引导

Zheyuan Liu, Zhangchen Xu, Guangyao Dou, Xiangchi Yuan, Zhaoxuan Tan, Radha Poovendran, Meng Jiang

机构 * University of Notre Dame(notre dame 大学) University of Washington(华盛顿大学) Johns Hopkins University(约翰霍普金斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型安全对齐的平衡难题,提出SafeCoDe解码框架,通过两阶段机制优化上下文敏感的弃权行为,在多基准实验中有效提升安全性能且保留模型有用性。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00234 2026-08-31 cs.CL cs.AI 版本更新 84%

OmniFusion: Simultaneous Multilingual Multimodal Translations via Modular Fusion

OmniFusion: 通过模块融合实现多语言多模态翻译

Sai Koneru, Matthias Huck, Jan Niehues

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) SAP SE(SAP公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出OmniFusion系统,通过融合预训练多模态基础模型与翻译LLM,实现语音、语音加图像及文本加图像的多语言多模态翻译,降低SimulST延迟并提升翻译质量。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏