arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-28 至 2026-01-28 共收录 63 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 10 篇

2509.05895 2026-01-28 cs.CV 83%

BTCChat: Advancing Remote Sensing Bi-temporal Change Captioning with Multimodal Large Language Model

BTCChat: 通过多模态大语言模型推进遥感双时相变化描述

Yujie Li, Wenjia Xu, Yuanben Zhang, Zhiwei Wei, Mugen Peng

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Aerospace Information Research Institute(航天信息研究所) Chinese Academy of Sciences(中国科学院) School of Geographical Sciences(地理科学学院) Hunan Normal University(湖南师范大学)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 BTCChat通过多模态大语言模型提升遥感双时相变化描述能力,引入变化提取模块和提示增强机制,实现更精确的视觉-语义对齐和更优的性能表现。

Comments 5 pages, 2 figures; Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09851 2026-01-28 cs.CV cs.AI cs.HC 81%

ViSIL: Unified Evaluation of Information Loss in Multimodal Video Captioning

ViSIL:多模态视频描述信息损失的统一评估

Po-han Li, Shenghui Chen, Ufuk Topcu, Sandeep Chinchali

机构 * The University of Texas at Austin, Texas, USA(德克萨斯大学奥斯汀分校)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 ViSIL通过信息论框架量化多模态视频摘要的信息损失,实现跨格式的统一评估,并在VQA任务中提升准确率7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19267 2026-01-28 cs.CL 74%

DiaDem: Advancing Dialogue Descriptions in Audiovisual Video Captioning for Multimodal Large Language Models

DiaDem: 促进音频视频字幕中的对话描述以提升多模态大语言模型

Xinlong Chen, Weihong Lin, Jingyun Hua, Linli Yao, Yue Ding, Bozhou Li, Bohan Zeng, Yang Shi, Qiang Liu, Yuanxing Zhang, Pengfei Wan, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别新实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Peking University(北京大学) Nanjing University(南京大学)

专题命中 图文多模态 :multimodal(title);分类 cs.CL

AI总结 DiaDem通过合成高质量数据集和难度分区的两阶段GRPO策略,提升了音频视频字幕中的对话描述准确性,并在多种基准测试中表现出色。

Comments Project webpage: https://diadem-captioner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14233 2026-01-28 cs.CV 74%

Enhancing Descriptive Captions with Visual Attributes for Multimodal Perception

通过视觉属性增强描述性标题以实现多模态感知

Yanpeng Sun, Jing Hao, Ke Zhu, Jiang-Jiang Liu, Yuxiang Zhao, Xiaofan Li, Na Zhao, Zechao Li, Jingdong Wang

机构 * NJUST(南京理工大学) Baidu VIS(百度视觉部) HKU(香港大学) NJU(南京大学) SUTD(新加坡科技设计大学)

专题命中 图文多模态 :multimodal(title);分类 cs.CV

AI总结 本文提出EDC方法,通过整合视觉专家的低级和细粒度属性,提升图像标题的描述质量,以增强多模态感知能力。

Comments An open-source Agent for generating detailed image captions

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14780 2026-01-28 cs.CL cs.AI cs.CV 67%

ReVision: A Dataset and Baseline VLM for Privacy-Preserving Task-Oriented Visual Instruction Rewriting

ReVision:一个用于隐私保护任务导向视觉指令重写的数据集和基线VLM

Abhijit Mishra, Mingda Li, Hsiang Fu, Richard Noh, Minji Kim

机构 * School of Information(信息学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Department of Statistics and Data Science(统计与数据科学系) Yale University(耶鲁大学) School of Computing and Augmented Intelligence(计算与增强智能学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 ReVision提出一个数据集和基线VLM,通过将多模态指令转换为纯文本命令,实现轻量级设备端指令重写,提升隐私保护的多模态AI应用能力。

Comments In Proceedings of the IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21850 2026-01-28 cs.CV cs.CL 62%

SCoPE VLM: Selective Context Processing for Efficient Document Navigation in Vision-Language Models

SCoPE VLM:面向视觉语言模型高效文档导航的 selective context processing

Gyubeum Lim, Yemo Koo, Vijay Krishna Madisetti

机构 * Georgia Institute of Technology(佐治亚理工学院) Konkuk University(韩国康克伦大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 SCoPE VLM通过引入滚动链机制和定制强化学习方法,实现高效文档导航,提升视觉语言模型在多页文档问答中的代理阅读能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09201 2026-01-28 cs.CR cs.AI cs.CV 62%

Learning to Detect Unseen Jailbreak Attacks in Large Vision-Language Models

学习检测未见过的大型视觉-语言模型中的对抗攻击

Shuang Liang, Zhihao Xu, Jiaqi Weng, Jialing Tao, Hui Xue, Xiting Wang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 LoD通过学习模型内部激活生成安全表示,实现对未见过的对抗攻击的高效检测,提升检测性能和效率。

Comments 12 pages; Previously this version appeared as arXiv:2510.15430 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19850 2026-01-28 cs.CV 57%

EgoHandICL: Egocentric 3D Hand Reconstruction with In-Context Learning

EgoHandICL: 以自身为中心的3D手重建与上下文学习

Binzhu Xie, Shi Qiu, Sicheng Zhang, Yinqiao Wang, Hao Xu, Muzammal Naseer, Chi-Wing Fu, Pheng-Ann Heng

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(医学智能与XR研究院,香港中文大学) Department of Computer Science, Khalifa University(计算机科学系,哈利法大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 EgoHandICL通过上下文学习框架提升以自身为中心的3D手重建的鲁棒性和一致性,结合视觉语言模型和掩码自动编码器实现更精确的手-物体交互推理。

Comments Accepted in ICLR 2026, Codebase: https://github.com/Nicous20/EgoHandICL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19798 2026-01-28 cs.CV 57%

Youtu-VL: Unleashing Visual Potential via Unified Vision-Language Supervision

Youtu-VL: 通过统一的视觉-语言监督释放视觉潜力

Zhixiang Wei, Yi Li, Zhehan Kan, Xinghua Jiang, Zuwei Long, Shifeng Liu, Hongze Shen, Wei Liu, Xiaoyu Tan, Haojia Lin, Yubo Zhu, Qianyu Li, Di Yin, Haoyu Cao, Weibo Gu, Xin Li, Yinsong Liu, Deqiang Jiang, Xing Sun, Yunsheng Wu, Mingkong Tang, Shuangyin Liu, Lexiang Tang, Haodong Lin, Junru Lu, Jiarui Qin, Lingfeng Qiao, Ruizhi Qiao, Bo Ke, Jianfeng He, Ke Li, Yangning Li, Yunhang Shen, Mengdan Zhang, Peixian Chen, Kun Yin, Bing Liu, Yunfei Wu, Huang Chen, Zhongpeng Cai, Xiaotian Li

机构 * Youtu-VL Team(Youtu-VL 团队)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 Youtu-VL通过统一视觉-语言自回归监督范式,提升多模态理解能力,实现视觉与语言的协同优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13126 2026-01-28 eess.IV cs.CV 57%

Knowledge-enhanced Pretraining for Vision-language Pathology Foundation Model on Cancer Diagnosis

基于知识增强的视觉语言病理基础模型用于癌症诊断

Xiao Zhou, Luoyi Sun, Dexuan He, Wenbin Guan, Ge Wang, Ruifen Wang, Lifeng Wang, Xiaojun Yuan, Xin Sun, Ya Zhang, Kun Sun, Yanfeng Wang, Weidi Xie

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Xinhua Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属新华医院) School of Artificial Intelligence(人工智能学院) Department of Pathology(病理学部) Department of Oral Pathology(口腔病理学部) Department of Pediatric Hematology/Oncology(儿科血液肿瘤科) Clinical Research and Innovation Unit(临床研究与创新单元) Department of Pediatric Cardiology(儿童心脏病科)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出KEEP模型,通过整合疾病知识图谱提升癌症诊断的视觉语言基础模型性能,显著优于现有方法。

Comments V2: fixed typos, updated experimental results, added ablation

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 9 篇

2510.22603 2026-01-28 eess.AS cs.CV cs.SD 84%

Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs

利用大语言模型缓解音频视觉语音识别中的注意力下沉和大规模激活

Anand, Umberto Cappellazzo, Stavros Petridis, Maja Pantic

机构 * University of British Columbia, Canada(不列颠哥伦比亚大学) Imperial College London, UK(伦敦帝国学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、eess.AS

AI总结 本文提出了一种简单有效的去相关损失,通过减少BOS与其它token的余弦相似性,缓解音频视觉语音识别中的注意力下沉和大规模激活问题,同时在高下采样率下降低词错误率。

Comments IEEE ICASSP 2026. The code is available at https://github.com/umbertocappellazzo/Llama-AVSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06893 2026-01-28 cs.CV cs.CL cs.MM cs.SC 82%

A New Hybrid Intelligent Approach for Multimodal Detection of Suspected Disinformation on TikTok

一种用于TikTok上疑似虚假信息多模态检测的新混合智能方法

Jared D. T. Guerrero-Sosa, Andres Montoro-Montarroso, Francisco P. Romero, Jesus Serrano-Guerrero, Jose A. Olivas

机构 * University of Castilla-La Mancha(卡斯蒂利亚-拉曼查大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本研究提出一种结合深度学习与模糊逻辑的混合方法,用于检测TikTok视频中的疑似虚假信息,通过多模态特征分析与可解释性检测提升虚假信息识别的准确性与实用性。

Journal ref Multimedia Tools and Applications 85 (2026) 37

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07253 2026-01-28 eess.AS cs.CV cs.SD 81%

Omni-AVSR: Towards Unified Multimodal Speech Recognition with Large Language Models

Omni-AVSR:迈向基于大语言模型的统一多模态语音识别

Umberto Cappellazzo, Xubo Liu, Pingchuan Ma, Stavros Petridis, Maja Pantic

机构 * Imperial College London, UK(伦敦帝国理工学院) University of Surrey, UK(萨里大学)

专题命中 音频语音多模态 :multimodal(title);audio-visual(abstract);分类 cs.CV、eess.AS

AI总结 Omni-AVSR通过统一多模态语音识别框架,结合高效多粒度训练与参数高效适应,实现跨任务协同,降低资源消耗并提升鲁棒性。

Comments Accepted to IEEE ICASSP 2026 (camera-ready version). Project website (code and model weights): https://umbertocappellazzo.github.io/Omni-AVSR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19673 2026-01-28 cs.SD cs.AI 79%

A Benchmark for Audio Reasoning Capabilities of Multimodal Large Language Models

多模态大语言模型音频推理能力的基准测试

Iwona Christop, Mateusz Czyżnikiewicz, Paweł Skórzewski, Łukasz Bondaruk, Jakub Kubiak, Marcin Lewandowski, Marek Kubis

机构 * Adam Mickiewicz University(亚当·密克维茨大学) Samsung R&D Institute Poland(三星波兰研发中心)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Audio Reasoning Tasks基准测试,用于评估多模态模型在结合不同音频任务进行推理方面的能力。

Comments 31 pages, 2 figures, accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19130 2026-01-28 eess.AS 79%

Beyond Lips: Integrating Gesture and Lip Cues for Robust Audio-visual Speaker Extraction

超越嘴唇:整合手势和嘴唇线索以实现鲁棒的音频视觉说话人提取

Zexu Pan, Xinyuan Qian, Shengkui Zhao, Kun Zhou, Bin Ma

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

AI总结 本文提出SeLG模型,通过融合嘴唇和手势信息,利用交叉注意力和对比学习提升音频视觉说话人提取的鲁棒性。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22263 2026-01-28 eess.AS 79%

Empowering Multimodal Respiratory Sound Classification with Counterfactual Adversarial Debiasing for Out-of-Distribution Robustness

通过反事实对抗去偏来增强多模态呼吸声分类以实现分布外鲁棒性

Heejoon Koo, Miika Toikkanen, Yoon Tae Kim, Soo Yong Kim, June-Woo Kim

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 本文提出反事实对抗去偏框架,通过抑制元数据依赖和增强元数据不变表示,提升多模态呼吸声分类在分布外鲁棒性上的性能。

Comments Accepted by ICASSP 2026 (2026 IEEE International Conference on Acoustics, Speech, and Signal Processing)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19063 2026-01-28 cs.CL cs.SD 57%

Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback

通过AI反馈强化学习优化语音对话系统的对话质量

Siddhant Arora, Jinchuan Tian, Jiatong Shi, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe

机构 * Carnegie Mellon University(卡内基梅隆大学) Sony Group Corporation(索尼集团)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL

AI总结 本文提出多奖励RLAIF框架,通过结合语义、音频质量和情感一致性奖励,提升语音对话系统的对话质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12619 2026-01-28 cs.LG cs.AI cs.DC 57%

BootSeer: Analyzing and Mitigating Initialization Bottlenecks in Large-Scale LLM Training

BootSeer:分析和缓解大规模大语言模型训练中的初始化瓶颈

Rui Li, Xiaoyun Zhi, Jinxin Chi, Menghan Yu, Lixin Huang, Jia Zhu, Weilun Zhang, Xing Ma, Wenjia Liu, Zhicheng Zhu, Daowen Luo, Zuquan Song, Xin Yin, Chao Xiang, Shuguang Wang, Wencong Xiao, Gene Cooperman

机构 * Northeastern University(东北大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 BootSeer通过优化容器镜像加载、依赖安装和模型检查点恢复,显著减少大规模LLM训练的启动开销。

Comments 18 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19281 2026-01-28 cs.HC 50%

Gazeify Then Voiceify: Physical Object Referencing Through Gaze and Voice Interaction with Displayless Smart Glasses

通过眼动和语音交互实现无显示屏智能眼镜的物理物体指认

Zheng Zhang, Mengjie Yu, Tianyi Wang, Kashyap Todi, Ajoy Savio Fernandes, Yue Liu, Haijun Xia, Tovi Grossman, Tanya Jonker

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 无显示屏智能眼镜通过眼动和语音交互实现物理物体指认,结合先进分割与视觉-语言模型,提升交互准确性和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 4 篇

2601.19151 2026-01-28 cs.AI cs.MA 83%

TS-Debate: Multimodal Collaborative Debate for Zero-Shot Time Series Reasoning

TS-Debate:多模态协作辩论用于零样本时间序列推理

Patara Trirat, Jin Myung Kwak, Jay Heo, Heejun Lee, Sung Ju Hwang

机构 * KAIST Seoul(韩国科学技术院)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 TS-Debate通过多模态协作辩论框架,在零样本时间序列推理中实现显著性能提升,通过专门代理和结构化协议提升模态保真度和数值精度。

Comments Code will be available at https://github.com/DeepAuto-AI/TS-Debate

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18192 2026-01-28 cs.CV cs.HC cs.MM 81%

MindCine: Multimodal EEG-to-Video Reconstruction with Large-Scale Pretrained Models

MindCine: 基于大规模预训练模型的多模态EEG到视频重建

Tian-Yi Zhou, Xuan-Hao Liu, Bao-Liang Lu, Wei-Long Zheng

机构 * School of Computer Science, Shanghai Jiao Tong University, 800 Dongchuan Road, Shanghai, China(计算机科学学院,上海交通大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 MindCine通过多模态联合学习和预训练大型EEG模型,实现有限数据下的高保真EEG到视频重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08512 2026-01-28 cs.CV cs.AI 81%

MLVTG: Mamba-Based Feature Alignment and LLM-Driven Purification for Multi-Modal Video Temporal Grounding

MLVTG: 基于Mamba的特征对齐与LLM驱动的多模态视频时间定位

Zhiyi Zhu, Xiaoyu Wu, Zihao Liu, Linlin Yang

机构 * State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 MLVTG通过结合MambaAligner和LLMRefiner,实现了多模态视频时间定位的高精度定位与语义净化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19686 2026-01-28 cs.CV 57%

Video-KTR: Reinforcing Video Reasoning via Key Token Attribution

Video-KTR: 通过关键令牌 attribution 增强视频推理

Ziyue Wang, Sheng Jin, Zhongrong Zuo, Jiawei Wu, Han Qiu, Qi She, Hao Zhang, Xudong Jiang

机构 * ByteDance(字节跳动) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) National University of Singapore(国立新加坡大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Video-KTR通过结合三种attribution信号,提升视频推理的准确性和可解释性,实现状态-of-the-art性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 4 篇

2601.19060 2026-01-28 cs.CV cs.AI 81%

Pixel-Grounded Retrieval for Knowledgeable Large Multimodal Models

基于像素的检索用于知识型大型多模态模型

Jeonghwan Kim, Renjie Tao, Sanat Sharma, Jiaqi Wang, Kai Sun, Zhaojiang Lin, Seungwhan Moon, Lambert Mathias, Anuj Kumar, Heng Ji, Xin Luna Dong

机构 * Meta Reality Labs(Meta现实实验室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 PixSearch是一种端到端的多模态模型,通过像素级检索和统一感知与推理,提升视觉问答任务中的事实一致性与泛化能力。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18203 2026-01-28 cs.IR 78%

DMAP: Human-Aligned Structural Document Map for Multimodal Document Understanding

DMAP: 人类对齐的多模态文档结构地图用于多模态文档理解

ShunLiang Fu, Yanxin Zhang, Yixin Xiang, Xiaoyu Du, Jinhui Tang

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 DMAP通过构建人类对齐的多模态文档结构地图,提升文档理解的结构化表示和多模态推理能力。

Comments WebConf 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19606 2026-01-28 cs.CV cs.AI cs.LG cs.SD eess.AS 67%

GMS-CAVP: Improving Audio-Video Correspondence with Multi-Scale Contrastive and Generative Pretraining

GMS-CAVP:通过多尺度对比和生成预训练提升音频视频对应关系

Shentong Mo, Zehua Chen, Jun Zhu

机构 * Carnegie Mellon University(卡内基梅隆大学) MBZUAI Tsinghua University(清华大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI、eess.AS

AI总结 GMS-CAVP通过多尺度对比和生成预训练方法提升音频视频对应关系建模,实现更深入的跨模态理解和高保真生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18850 2026-01-28 cs.SE 67%

Towards Safety-Compliant Transformer Architectures for Automotive Systems

面向汽车系统的安全合规Transformer架构

Sven Kirchner, Nils Purschke, Chengdong Wu, Alois Knoll

专题命中 跨模态检索 :multimodal(abstract);multimodal foundation model(abstract)

AI总结 本文提出了一种安全合规的Transformer架构,通过多模态基础模型提升汽车系统的容错性和鲁棒性,实现自动驾驶中的可认证AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 8 篇

2601.19839 2026-01-28 cs.RO cs.AI cs.HC 79%

HARMONI: Multimodal Personalization of Multi-User Human-Robot Interactions with LLMs

HARMONI: 基于大语言模型的多用户人机交互多模态个性化

Jeanne Malécot, Hamed Rahimi, Jeanne Cattoni, Marie Samson, Mouad Abrini, Mahdi Khoramshahi, Maribel Pino, Mohamed Chetouani

机构 * Institut Curie, Université Paris-Saclay(巴黎-萨克勒大学Curie研究所) Institute of Intelligent Systems and Robotics (ISIR), Sorbonne University(索邦大学智能系统与机器人研究所) Assistance Publique – Hôpitaux de Paris (AP-HP), Université Paris Cité(巴黎公共医院(AP-HP)与巴黎城市大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 HARMONI通过多模态个性化框架,利用大语言模型提升多用户人机交互的持续个性化和动态适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19834 2026-01-28 cs.AI 79%

Visual Generation Unlocks Human-Like Reasoning through Multimodal World Models

视觉生成通过多模态世界模型解锁类人推理

Jialong Wu, Xiaoying Zhang, Hongyi Yuan, Xiangcheng Zhang, Tianhao Huang, Changjing He, Chaoyi Deng, Renrui Zhang, Youbin Wu, Mingsheng Long

机构 * Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出视觉生成在特定任务中优于纯语言推理,通过构建VisWorld-Eval评估套件验证了多模态世界模型提升类人推理的能力。

Comments Project page: https://thuml.github.io/Reasoning-Visual-World

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19228 2026-01-28 cs.CV 70%

Towards Pixel-Level VLM Perception via Simple Points Prediction

通过简单的点预测实现像素级VLM感知

Tianhui Song, Haoyu Lu, Hao Yang, Lin Sui, Haoning Wu, Zaida Zhou, Zhiqi Huang, Yiping Bao, Y. Charles, Xinyu Zhou, Limin Wang

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 SimpleSeg通过简单点预测实现多模态大语言模型的像素级感知,无需复杂架构即可获得高精度分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏