arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-31 至 2026-08-31 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 7 篇

2608.27505 2026-08-31 cs.CL cs.AI 新提交 62%

A Survey on Rubric-Guided Reinforcement Learning for Language Models

面向语言模型的准则引导强化学习综述

Zifei Shan, Fangning Shao

机构 * WeChat, Tencent(腾讯微信)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 该综述针对传统RLHF的缺陷,提出贝叶斯框架并沿先验-后验轴分类准则引导强化学习,分析语言学相关对齐问题,明确未来研究方向。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04438 2026-08-31 cs.CV cs.CL 版本更新 62%

The Telephone Game: Evaluating Semantic Drift in Unified Models

电话游戏:评估统一模型中的语义漂移

Sabbir Mollah, Rohit Gupta, Sirnam Swetha, Qingyang Liu, Ahnaf Munir, Mubarak Shah

机构 * Center For Research in Computer Vision, University of Central Florida, USA(计算机视觉研究中心,中央佛罗里达大学)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.CL

AI总结 该研究提出语义漂移协议(SDP)等方法,评估统一模型在交替执行图像-文本理解与生成时的语义漂移,发现现有孤立基准无法预测模型的多轮表现,为统一模型可靠性评估提供了更准确的方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28086 2026-08-31 cs.IT cs.CV eess.IV 新提交 57%

Ada-TokenCom: Rate-Adaptive Token Communications via Large-Model-Driven Token Compression and Generation

Ada-TokenCom:基于大模型驱动的令牌压缩与生成的速率自适应令牌通信

Zijun Zhang, Li Qiao, Mahdi Boloursaz Mashhadi, Zhen Gao, Mehdi Bennis, Kaibin Huang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出基于大自回归模型的速率自适应令牌通信框架Ada-TokenCom,结合下一个令牌预测与算术编码,通过混合重建/生成方案及李雅普诺夫算法优化,实现优于基线的超低比特率语义通信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22392 2026-08-31 cs.CV 版本更新 57%

iOSPointMapper: RealTime Pedestrian and Accessibility Mapping with Mobile AI

iOSPointMapper: 基于移动AI的实时行人及可达性制图

Himanshu Naidu, Yuxiang Zhang, Sachin Mehta, Anat Caspi

机构 * University of Washington(华盛顿大学) Paul G. Allen School of Computer Science and Engineering(保罗·G·艾伦计算机科学与工程学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 iOSPointMapper通过移动AI实现实时人行道制图,结合语义分割、LiDAR和GPS数据,提供隐私保护的数据收集与多模式交通数据整合,提升行人基础设施的可达性。

Comments Presented at the Transportation Research Board (TRB) 105th Annual Meeting, 2026. Revised manuscript with expanded methodology descriptions, clarified feature localization procedure, minor corrections and formatting updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20971 2026-08-31 cs.LG cs.CV 版本更新 57%

Amortizing intractable inference in diffusion models for vision, language, and control

在视觉、语言与控制任务的扩散模型中分摊难解推理

Siddarth Venkatraman, Moksh Jain, Luca Scimeca, Minsu Kim, Marcin Sendera, Mohsin Hasan, Luke Rowe, Sarthak Mittal, Pablo Lemos, Emmanuel Bengio, Alexandre Adam, Jarrid Rector-Brooks, Yoshua Bengio, Glen Berseth, Esmeralda S. Whitammer

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文针对扩散模型用作下游任务先验时的难解后验推理问题,提出相对轨迹平衡方法,在视觉、语言、多模态及连续控制等任务上取得良好效果

Comments NeurIPS 2024; code: this https URL (https://github.com/GFNOrg/diffusion-finetuning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27885 2026-08-31 cs.LG 新提交 50%

There and Back Again: Bidirectional Diffusion Bridges for Multimodality Translation

双向扩散桥用于多模态转换:往返之道

Gabe Guo, Elon Litman, Thanawat Sornwanee, Jose Blanchet, Stefano Ermon

机构 * Stanford University(斯坦福大学)

专题命中 多模态生成 :image-text(abstract)

AI总结 针对现有多模态转换方法的不足,提出BIT双向图像-文本扩散桥,实现双向生成且性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19088 2026-08-31 quant-ph math-ph physics.optics 版本更新 50%

Efficient and scalable inter-module switching for distributed quantum computing architectures

分布式量子计算架构的高效可扩展模块间交换

Kamil Bradler

专题命中 多模态生成 :any-to-any(abstract)

AI总结 针对分布式量子计算模块间的高效可扩展交换需求,基于广义马赫-曾德尔干涉仪构建去中心化交换方案,实现主动光深度随逻辑块数对数缩放且不损失连通性。

Comments v3: close to the published version

详情

展开后加载摘要…

URL PDF HTML 收藏