arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-05 至 2026-01-05 共收录 32 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 1 篇

2411.17002 2026-01-05 cs.CV 57%

Semantic Anchor Transport: Robust Test-Time Adaptation for Vision-Language Models

语义锚点传输:面向视觉-语言模型的鲁棒性测试时间适应

Shambhavi Mishra, Julio Silva-Rodriguez, Ismail Ben Ayed, Marco Pedersoli, Jose Dolz

机构 * LIVIA, ÉTS Montréal, Canada(LIVIA,蒙特利尔ÉTS,加拿大) International Laboratory on Learning Systems (ILLS), McGILL - ETS - MILA - CNRS - Université Paris-Saclay - CentraleSupélec, Canada(学习系统国际实验室(ILLS),麦吉尔大学-ÉTS-MILA-CNRS-巴黎-萨克雷大学-中央超导大学,加拿大)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 语义锚点传输通过生成伪标签和多模板蒸馏方法,提升视觉-语言模型在分布偏移下的鲁棒性与计算效率。

Comments Added additional figures to communicate the algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 1 篇

2601.00777 2026-01-05 cs.SD cs.CV 79%

Investigating the Viability of Employing Multi-modal Large Language Models in the Context of Audio Deepfake Detection

探讨在音频深度伪造检测中使用多模态大语言模型的可行性

Akanksha Chuchra, Shukesh Reddy, Sudeepta Mishra, Abhijit Das, Abhinav Dhall

机构 * Indian Institute of Technology, Ropar, India(印度理工学院罗帕尔分校) Machine Intelligence Group, Birla Institute of Technology and Science, Pilani, Hyderabad Campus, India(比拉理工科学院帕利尼 Hyderabad 分校机器智能小组) Monash University, Melbourne, Australia(墨尔本大学)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文探讨了多模态大语言模型在音频深度伪造检测中的可行性,通过结合音频输入与多提示方法,展示了模型在域内数据上的良好表现及潜在应用价值。

Comments Accepted at IJCB 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 6 篇

2512.22905 2026-01-05 cs.CV 83%

JavisGPT: A Unified Multi-modal LLM for Sounding-Video Comprehension and Generation

JavisGPT:一种用于声音-视频理解和生成的统一多模态大语言模型

Kai Liu, Jungang Li, Yuchong Sun, Shengqiong Wu, Jianzhang Gao, Daoan Zhang, Wei Zhang, Sheng Jin, Sicheng Yu, Geng Zhan, Jiayi Ji, Fan Zhou, Liang Zheng, Shuicheng Yan, Hao Fei, Tat-Seng Chua

机构 * ZJU(浙江大学) NUS(国立新加坡大学) HKUST(GZ)(香港科技大学(广州)) RUC(中国人民大学) HZCU(杭州电子科技大学) NTU(国立台湾大学) SMU(新加坡国立大学) USYD(澳大利亚悉尼大学) ANU(澳大利亚国立大学)

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 JavisGPT是一种统一多模态大语言模型,通过三阶段训练流程在声音-视频理解和生成任务中表现出色,尤其在复杂和时间同步场景中表现更优。

Comments Accepted by NeurIPS as a Spotlight paper. Code: https://github.com/JavisVerse/JavisGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22979 2026-01-05 cs.CV 79%

PoseStreamer: A Multi-modal Framework for 3D Tracking of Unseen Moving Objects

PoseStreamer: 一种多模态框架用于未见移动物体的3D跟踪

Huiming Yang, Linglin Liao, Fei Ding, Sibo Wang, Zijian Zeng

机构 * School of Mathematics, Renmin University of China(中国人民大学数学学院)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 PoseStreamer是一种多模态框架,通过结合自适应姿态内存队列、以对象为中心的2D跟踪器和射线姿态滤波器,实现高速移动物体的高精度3D跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00369 2026-01-05 cs.CV 70%

BHaRNet: Reliability-Aware Body-Hand Modality Expertized Networks for Fine-grained Skeleton Action Recognition

BHaRNet: 以可靠性为关注点的多模态专家化网络用于细粒度骨骼动作识别

Seungyeon Cho, Tae-kyun Kim

机构 * School of Computing, KAIST(韩国釜山国立大学计算机学院)

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 BHaRNet通过可靠性建模和多模态整合,提升细粒度骨骼动作识别的鲁棒性和准确性。

Comments 16 pages; 8 figures. Extension of previous conference paper. Project page: https://github.com/VinnyCSY/BHaRNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00504 2026-01-05 cs.CV cs.AI cs.GR 62%

MotionPhysics: Learnable Motion Distillation for Text-Guided Simulation

MotionPhysics: 通过自然语言引导的模拟学习可学习的运动蒸馏

Miaowei Wang, Jakub Zadrożny, Oisin Mac Aodha, Amir Vaxman

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MotionPhysics通过自然语言引导模拟,利用可学习的运动蒸馏损失实现对3D物体物理参数的自动学习,提升动态模拟的逼真度和效率。

Comments AAAI2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14960 2026-01-05 cs.CV 57%

Body-Hand Modality Expertized Networks with Cross-attention for Fine-grained Skeleton Action Recognition

具有交叉注意力的体-手模态专家化网络用于细粒度骨骼动作识别

Seungyeon Cho, Tae-Kyun Kim

机构 * School of Computing, KAIST(韩国成均馆大学计算机学院)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出BHaRNet,通过体-手专家化网络和交叉注意力机制,提升细粒度骨骼动作识别的准确率,同时降低计算成本。

Comments 7 figures, 8 pages. Accepted to IROS 2025, project page: https://github.com/VinnyCSY/BHaRNet

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Hangzhou, China, 2025, pp. 11614-11621

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00607 2026-01-05 cs.LG 50%

Traffic-Aware Optimal Taxi Placement Using Graph Neural Network-Based Reinforcement Learning

基于图神经网络强化学习的交通感知出租车最优布置

Sonia Khetarpaul, P Y Sharan

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出基于图神经网络强化学习的交通感知出租车最优布置方法,通过实时整合交通数据优化出租车热点,有效减少乘客等待时间和司机行驶距离。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2601.00623 2026-01-05 cs.AI 79%

DA-DPO: Cost-efficient Difficulty-aware Preference Optimization for Reducing MLLM Hallucinations

DA-DPO:面向减少多模态大语言模型幻觉的高效难度感知偏好优化

Longtian Qiu, Shan Ning, Chuyu Zhang, Jiaxuan Sun, Xuming He

机构 * ShanghaiTech University(上海科技大学) Lingang Laboratory(灵冈实验室) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程技术研究中心)

专题命中 跨模态检索 :MLLM(title);multimodal(abstract);分类 cs.AI

AI总结 DA-DPO通过难度感知机制优化多模态大语言模型的偏好学习,有效减少幻觉并提升模型鲁棒性与泛化能力。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02660 2026-01-05 cs.CV cs.IR 57%

Spatially-Grounded Document Retrieval via Patch-to-Region Relevance Propagation

通过补丁到区域相关性传播实现空间感知的文档检索

Athos Georgiou

机构 * Independent Researcher(独立研究者)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 通过结合ColPali的补丁相似性与OCR区域,实现更精确的文档检索,提升RAG任务中的上下文相关性

Comments 21 pages, 6 figures, 8 tables. Includes ancillary files with full benchmark results and ablation studies. Code available at https://github.com/athrael-soju/Snappy

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09147 2026-01-05 cs.NI cs.AI cs.DC cs.LG cs.MA 57%

Agentic TinyML for Intent-aware Handover in 6G Wireless Networks

代理型TinyML用于6G无线网络中的意图感知切换

Alaa Saleh, Roberto Morabito, Sasu Tarkoma, Anders Lindgren, Susanna Pirttikangas, Lauri Lovén

机构 * Center for Ubiquitous Computing(无处不在计算中心) University of Oulu(奥卢大学) Department of Communication Systems(通信系统系) EURECOM Department of Computer Science(计算机科学系) University of Helsinki(赫尔辛基大学) RISE Research Institutes of Sweden(瑞典研究机构) Department of Computer Science, Electrical and Space Engineering(计算机科学、电气与空间工程系) Luleå University of Technology(卢勒奥技术大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出WAAN框架,利用TinyML代理实现6G网络中的意图感知主动切换,通过多模态环境控制案例验证其在保持用户体验方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 3 篇

2512.24513 2026-01-05 cs.CY 82%

From Static to Dynamic: Evaluating the Perceptual Impact of Dynamic Elements in Urban Scenes via MLLM-Guided Generative Inpainting

从静态到动态:通过MLLM引导的生成修复技术评估城市场景中动态元素的感知影响

Zhiwei Wei, Mengzi Zhang, Boyan Lu, Zhitao Deng, Nai Yang, Hua Liao

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract)

AI总结 通过MLLM引导的生成修复技术,研究评估了动态元素在城市场景中的感知影响,发现移除动态元素导致活力显著下降,揭示了光照、人类存在和深度变化对感知变化的关键作用。

Comments 31 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00051 2026-01-05 cs.CV 79%

TeleWorld: Towards Dynamic Multimodal Synthesis with a 4D World Model

TeleWorld:面向动态多模态合成的4D世界模型

Yabo Chen, Yuanzhi Liang, Jiepeng Wang, Tingxi Chen, Junfei Cheng, Zixiao Gu, Yuyang Huang, Zicheng Jiang, Wei Li, Tian Li, Weichen Li, Zuoxin Li, Guangce Liu, Jialun Liu, Junqi Liu, Haoyuan Wang, Qizhen Weng, Xuan'er Wu, Xunzhi Xiang, Xiaoyan Yang, Xin Zhang, Shiwen Zhang, Junyu Zhou, Chengcheng Zhou, Haibin Huang, Chi Zhang, Xuelong Li

机构 * TeleWorld Team(TeleWorld团队)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 TeleWorld提出了一种实时多模态4D世界建模框架,通过生成-重建-引导范式实现动态场景重建与长期记忆,提升世界模型的交互性和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17168 2026-01-05 cs.GR cs.CV 57%

StyGazeTalk: Learning Stylized Generation of Gaze and Head Dynamics

StyGazeTalk: 学习风格化的 gaze 和 head 动态生成

Chengwei Shi, Chong Cao

机构 * Beihang University(北京航空航天大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 StyGazeTalk 通过多模态框架生成风格化的 gaze 和 head 动态,提升 3D 面部生成的现实感。

Comments arXiv submission

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 9 篇

2505.02586 2026-01-05 cs.CV 83%

RGBX-DiffusionDet: A Framework for Multi-Modal RGB-X Object Detection Using DiffusionDet

RGBX-DiffusionDet: 一种利用DiffusionDet进行多模态RGB-X目标检测的框架

Eliraz Orfaig, Inna Stainvas, Igal Bilik

机构 * School of Electrical and Computer Engineering, Ben Gurion University of the Negev, Beer Sheva, Israel(电气与计算机工程学院,内盖夫本· Gurion大学,贝尔谢巴,以色列)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 RGBX-DiffusionDet通过自适应多模态编码器融合RGB与X数据,提升多模态目标检测性能,实现高效且紧凑的特征嵌入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00519 2026-01-05 cs.LG 78%

A Sparse-Attention Deep Learning Model Integrating Heterogeneous Multimodal Features for Parkinson's Disease Severity Profiling

一种整合异构多模态特征的稀疏注意力深度学习模型用于帕金森病严重程度评估

Dristi Datta, Tanmoy Debnath, Minh Chau, Manoranjan Paul, Gourab Adhikary, Md Geaur Rahman

机构 * School of Computing, Mathematics, and Engineering, Charles Sturt University(计算、数学与工程学院,查尔斯·斯特劳特大学) School of Dentistry and Medical Sciences, Charles Sturt University(牙科学院与医学科学学院,查尔斯·斯特劳特大学) AI and Cyber Futures Centre (AICF)(人工智能与未来技术中心(AICF)) Hawkins Clinic General Medical Practice(霍金斯诊所普通医疗实践)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出了一种整合异构多模态特征的稀疏注意力深度学习模型,用于提高帕金森病严重程度评估的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00478 2026-01-05 q-fin.RM q-fin.CP 78%

Multimodal Insights into Credit Risk Modelling: Integrating Climate and Text Data for Default Prediction

多模态视角下的信用风险建模:整合气候与文本数据用于违约预测

Zongxiao Wu, Ran Liu, Jiang Dai, Dan Luo

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本研究提出多模态框架整合气候与文本数据,通过LSTM、GRU和Transformer模型提升信用违约预测精度,发现物理气候风险,特别是内涝,是关键影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00264 2026-01-05 cs.CV 77%

S1-MMAlign: A Large-Scale, Multi-Disciplinary Dataset for Scientific Figure-Text Understanding

S1-MMAlign: 一个大规模、跨学科的数据集用于科学图像-文本理解

He Wang, Longteng Guo, Pengkang Huo, Xuanxu Lin, Yichen Yuan, Jie Jiang, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 S1-MMAlign是一个大规模跨学科数据集,通过语义增强提升科学图像与文本的对齐质量,推动AI在科学领域的应用。

Comments 12 pages, 5 figures. Dataset available at https://huggingface.co/datasets/ScienceOne-AI/S1-MMAlign

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00626 2026-01-05 cs.CV cs.LG 57%

HyperPriv-EPN: Hypergraph Learning with Privileged Knowledge for Ependymoma Prognosis

HyperPriv-EPN: 基于超图学习的特权知识用于室管膜瘤预后预测

Shuren Gabriel Yu, Sikang Ren, Yongji Tian

机构 * School of Software, Tsinghua University(清华大学软件学院) Beijing Tiantan Hospital(北京天坛医院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 HyperPriv-EPN通过基于超图的学习利用特权信息框架,利用术后数据提升术前室管膜瘤预后预测的准确性和生存分层能力。

Comments 6 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00561 2026-01-05 cs.CV 57%

AEGIS: Exploring the Limit of World Knowledge Capabilities for Unified Mulitmodal Models

AEGIS:探索统一多模态模型世界知识能力的极限

Jintao Lin, Bowen Dong, Weikang Shi, Chenyang Lei, Suiyun Zhang, Rui Liu, Xihui Liu

机构 * University of Hong Kong(香港大学) The Hong Kong Polytechnic University(香港理工大学) The Chinese University of Hong Kong(香港中文大学) Huawei Research(华为研究)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 AEGIS通过多任务基准测试和确定性检查表评估,揭示统一多模态模型在世界知识推理中的不足,并指出简化推理模块可缓解其缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00277 2026-01-05 q-bio.QM cs.AI 57%

Benchmarking Preprocessing and Integration Methods in Single-Cell Genomics

单细胞组学中预处理和整合方法的基准测试

Ali Anaissi, Seid Miad Zandavi, Weidong Huang, Junaid Akram, Basem Suleiman, Ali Braytee, Jie Hua

机构 * University of Technology Sydney, Australia(悉尼科技大学) University of Sydney, Australia(悉尼大学) Broad Institute, United States(Broad研究所) University of New South Wales, Australia(新南威尔士大学) Shaoyang University, China(韶阳大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本研究评估了单细胞数据预处理和整合方法的性能,发现Seurat和Harmony在整合效果上表现优异,Harmony在大数据集处理上更高效,UMAP是与整合技术最兼容的降维方法。

Comments The 23rd Australasian Data Science and Machine Learning Conference (AusDM'25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19936 2026-01-05 cs.CV 57%

VisualQuest: A Benchmark for Abstract Visual Reasoning in MLLMs

VisualQuest: 一个用于多模态大语言模型(MLLMs)抽象视觉推理的基准数据集

Kelaiti Xiao, Liang Yang, Dongyu Zhang, Paerhati Tulajiang, Hongfei Lin

机构 * School of Computer Science and Technology, Dalian University of Technology, Dalian, China(大连理工大学计算机科学与技术学院) School of Foreign Languages, Dalian University of Technology, Dalian, China(大连理工大学外语学院) School of Computer Science and Technology, Xinjiang Normal University, Urumqi, China(新疆师范大学计算机科学与技术学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 VisualQuest通过风格化图像和针对性问题,评估多模态大语言模型在抽象视觉推理上的能力,发现Gemini和GPT-4o在不同任务上表现突出,揭示多模态理解的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03958 2026-01-05 cs.RO 50%

MDE-AgriVLN: Agricultural Vision-and-Language Navigation with Monocular Depth Estimation

MDE-AgriVLN: 农业视觉与语言导航与单目深度估计

Xiaobei Zhao, Xingqi Lyu, Xin Chen, Xiang Li

机构 * China Agricultural University(中国农业大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 MDE-AgriVLN通过单目深度估计提升农业机器人视觉与语言导航性能,提高成功率并降低导航误差。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态Agent 5 篇

2507.01006 2026-01-05 cs.CV cs.AI cs.LG 81%

GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning

GLM-4.5V 和 GLM-4.1V-Thinking:迈向具有可扩展强化学习的多功能推理

V Team, Wenyi Hong, Wenmeng Yu, Xiaotao Gu, Guo Wang, Guobing Gan, Haomiao Tang, Jiale Cheng, Ji Qi, Junhui Ji, Lihang Pan, Shuaiqi Duan, Weihan Wang, Yan Wang, Yean Cheng, Zehai He, Zhe Su, Zhen Yang, Ziyang Pan, Aohan Zeng, Baoxu Wang, Bin Chen, Boyan Shi, Changyu Pang, Chenhui Zhang, Da Yin, Fan Yang, Guoqing Chen, Haochen Li, Jiale Zhu, Jiali Chen, Jiaxing Xu, Jiazheng Xu, Jing Chen, Jinghao Lin, Jinhao Chen, Jinjiang Wang, Junjie Chen, Leqi Lei, Letian Gong, Leyi Pan, Mingdao Liu, Mingde Xu, Mingzhi Zhang, Qinkai Zheng, Ruiliang Lyu, Shangqin Tu, Sheng Yang, Shengbiao Meng, Shi Zhong, Shiyu Huang, Shuyuan Zhao, Siyan Xue, Tianshu Zhang, Tianwei Luo, Tianxiang Hao, Tianyu Tong, Wei Jia, Wenkai Li, Xiao Liu, Xiaohan Zhang, Xin Lyu, Xinyu Zhang, Xinyue Fan, Xuancheng Huang, Yadong Xue, Yanfeng Wang, Yanling Wang, Yanzi Wang, Yifan An, Yifan Du, Yiheng Huang, Yilin Niu, Yiming Shi, Yu Wang, Yuan Wang, Yuanchang Yue, Yuchen Li, Yusen Liu, Yutao Zhang, Yuting Wang, Yuxuan Zhang, Zhao Xue, Zhengxiao Du, Zhenyu Hou, Zihan Wang, Peng Zhang, Debing Liu, Bin Xu, Juanzi Li, Minlie Huang, Yuxiao Dong, Jie Tang

机构 * Zhipu AI & Tsinghua University(智谱AI与清华大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 GLM-4.5V和GLM-4.1V-Thinking通过可扩展强化学习提升多模态推理能力,实现多任务高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00730 2026-01-05 cs.CV 79%

Grading Handwritten Engineering Exams with Multimodal Large Language Models

用多模态大语言模型评分手写工程考试

Janez Perš, Jon Muhovič, Andrej Košir, Boštjan Murovec

机构 * University of Ljubljana, Faculty of Electrical Engineering(卢布尔雅那大学电子工程学院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本研究利用多模态大语言模型对斯洛文尼亚语手写工程考试进行自动评分,通过多阶段设计实现高可靠性,达到与人工评分约8分的均方差,验证了结构化提示和参考定位的重要性。

Comments 10 pages, 5 figures, 2 tables. Supplementary material available at https://lmi.fe.uni-lj.si/en/janez-pers-2/supplementary-material/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00696 2026-01-05 cs.LG cs.GT cs.RO 78%

Bayesian Inverse Games with High-Dimensional Multi-Modal Observations

高维多模态观测下的贝叶斯逆游戏

Yash Jain, Xinjie Liu, Lasse Peters, David Fridovich-Keil, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Delft University of Technology(代尔夫特理工大学) Sunrise Setting Ltd SAGE Publications Ltd(SAGE出版社有限公司)

专题命中 多模态Agent :multi-modal(title);multimodal(abstract)

AI总结 本文提出了一种基于贝叶斯推断的逆博弈框架,利用多模态观测数据实时生成隐藏智能体目标的后验分布,提升推断质量并实现更安全的决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06115 2026-01-05 cs.RO cs.SY eess.SY 78%

Hybrid A* Path Planning with Multi-Modal Motion Extension for Four-Wheel Steering Mobile Robots

四轮转向移动机器人多模态运动扩展的混合A*路径规划

Runjiao Bao, Lin Zhang, Tianwei Niu, Haoyu Yuan, Shoukun Wang

机构 * School of Automation, Beijing Institute of Technology, Beijing 100081, China(自动化学院,北京理工大学,北京100081,中国)

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 本文提出了一种针对四轮转向移动机器人的混合A*路径规划方法,通过多模态运动扩展提升复杂环境下的路径规划性能。

Comments Updated method details, parameters, and experimental scenarios

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00598 2026-01-05 cs.CV 70%

Modality Dominance-Aware Optimization for Embodied RGB-Infrared Perception

具身RGB-红外感知的模态主导意识优化

Xianhui Liu, Siqi Jiang, Yi Xie, Yuqing Lin, Siao Liu

机构 * College of Electronics and Information Engineering(电子信息工程学院) School of Computer Science and Technology(计算机科学与技术学院) Department of Electrical and Computer Engineering(电气与计算机工程系) School of Future Science and Engineering(未来科学与工程学院) Key Laboratory of General Artificial Intelligence and Large Models in Provincial Universities(省属大学通用人工智能与大模型重点实验室)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MDACL框架,通过模态主导指数量化模态主导性,结合分层跨模态指导和对抗均衡正则化,有效缓解跨模态融合中的优化偏差,实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 多模态训练与对齐 3 篇

2601.00352 2026-01-05 cs.CV 83%

OmniVaT: Single Domain Generalization for Multimodal Visual-Tactile Learning

OmniVaT:单域泛化用于多模态视觉-触觉学习

Liuxiang Qiu, Hui Da, Yuzhen Niu, Tiesong Zhao, Yang Cao, Zheng-Jun Zha

机构 * Fujian Key Laboratory for Intelligent Processing and Wireless Transmission of Media Information(福建智能媒体信息处理与无线传输重点实验室) College of Physics and Information Engineering(物理与信息工程学院) Fuzhou University(福州市大学) College of Computer and Data Science(计算机与数据科学学院) MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition(MoE脑启发智能感知与认知重点实验室) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 OmniVaT通过多模态分数傅里叶适配器和离散树生成模块,首次实现单域泛化多模态视觉-触觉学习任务,提升跨领域适应性与泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00670 2026-01-05 cs.HC 82%

Wave2Word: A Multimodal Transformer Framework for Joint EEG-Text Alignment and Multi-Task Representation Learning in Neurocritical Care

Wave2Word: 一种多模态Transformer框架,用于神经重症监护中的联合EEG-文本对齐和多任务表示学习

Argha Kamal Samanta, Deepak Mewada, Monalisa Sarma, Debasis Samanta

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 Wave2Word提出一种多模态Transformer框架,通过整合信号域建模与结构化临床语言监督,实现EEG-文本对齐和多任务表示学习,提升神经重症监护中的EEG分析效果。

详情

展开后加载摘要…

URL PDF HTML 收藏