arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-05 至 2026-02-05 共收录 64 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 14 篇

2602.04290 2026-02-05 cs.CL 79%

Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision

引导验证器:通过动态过程监督实现协作多模态推理

Lingzhuang Sun, Ruitong Liu, Yuxia Zhu, Xiaohan Xu, Jingxuan Wei, Xiangxiang Zhang, Bihui Yu, Wentao Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) The University of Hong Kong(香港大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出引导验证器框架,通过动态过程监督实现多模态推理的协作优化,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04299 2026-02-05 cs.HC 78%

A Multimodal fNIRS-EEG Dataset for Unilateral Limb Motor Imagery

用于单侧肢体运动想象的多模态fNIRS-EEG数据集

Lufeng Feng, Baomin Xu, Haoran Zhang, Bihai Lin, Zuxuan Deng, Sidi Tao, Chenyu Liu, Shifan Jia, Li Duan, Ziyu Jia

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出MIND数据集,用于单侧肢体多方向运动想象,通过融合fNIRS和EEG数据提升BCI分类性能。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04365 2026-02-05 cs.LG 67%

EXaMCaP: Subset Selection with Entropy Gain Maximization for Probing Capability Gains of Large Chart Understanding Training Sets

EXaMCaP: 通过熵增最大化进行子集选择以探测大规模图表理解训练集的探测能力提升

Jiapeng Liu, Liang Li, Bing Li, Peng Fu, Xiyan Gao, Chengyang Fang, Xiaoshuai Hao, Can Ma

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyberspace Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院) School of Computer and Artificial Intelligence, Jiangxi University of Finance and Economics(江西财经大学计算机与人工智能学院)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract)

AI总结 EXaMCaP通过熵增最大化选择子集,以高效探测大规模图表理解训练集的能力提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13551 2026-02-05 cs.CL cs.AI 62%

Reading Between the Lines: Combining Pause Dynamics and Semantic Coherence for Automated Assessment of Thought Disorder

在言语间解读:结合停顿动态与语义连贯性用于自动评估思维障碍

Feng Chen, Weizhe Xu, Changye Li, Serguei Pakhomov, Alex Cohen, Simran Bhola, Sandy Yin, Sunny X Tang, Michael Mackinley, Lena Palaniyappan, Dror Ben-Zeev, Trevor Cohen

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过结合停顿动态与语义连贯性,提出了一种可扩展的多模态框架,用于自动评估思维障碍的严重程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04454 2026-02-05 cs.CV 57%

Seg-ReSearch: Segmentation with Interleaved Reasoning and External Search

Seg-ReSearch: 基于交织推理和外部搜索的分割

Tianming Liang, Qirui Du, Jian-Fang Hu, Haichao Jiang, Zicheng Lin, Wei-Shi Zheng

机构 * ISEE Lab, Sun Yat-sen University(中山大学ISEE实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 Seg-ReSearch通过交织推理和外部搜索提升分割系统处理动态开放世界查询的能力,有效克服现有方法的知识瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00843 2026-02-05 cs.AI cs.HC 57%

Benchmarking Large Language Models for Diagnosing Students' Cognitive Skills from Handwritten Math Work

对大型语言模型诊断学生手写数学作业认知技能的基准测试

Yoonsu Kim, Hyoungwook Jin, Hayeon Doh, Eunhye Kim, Dongyun Jung, Seungju Kim, Kiyoon Choi, Jinho Son, Juho Kim

机构 * School of Computing, KAIST, Daejeon, Republic of Korea(韩国庆熙大学计算机学院) University of Michigan, Ann Arbor, USA(美国密歇根大学) Ewha Womans University, Seoul, Republic of Korea(韩国成均馆大学) AlgorithmLabs, Seoul, Republic of Korea(韩国AlgorithmLabs公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文评估了18种大型语言模型在诊断学生手写数学作业认知技能时的表现,发现模型在模糊证据下表现不佳,揭示了模型在证据处理上的系统性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04154 2026-02-05 cs.CV 57%

Context Determines Optimal Architecture in Materials Segmentation

上下文决定材料分割的最佳架构

Mingjian Lu, Pawan K. Tripathi, Mark Shteyn, Debargha Ganguly, Roger H. French, Vipin Chaudhary, Yinghui Wu

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本研究提出跨模式评估框架,揭示材料图像分割中不同上下文对最佳架构的影响,并提供可解释性工具以提升材料表征的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03895 2026-02-05 cs.CV cs.LG 57%

Benchmarking Bias Mitigation Toward Fairness Without Harm from Vision to LVLMs

面向视觉到大视觉语言模型的公平性无害基准测试

Xuwei Tan, Ziyu Hu, Xueru Zhang

机构 * The Ohio State University(俄亥俄州立大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 NH-Fair提出一个统一基准,评估视觉到大视觉语言模型的公平性无害性,通过系统调优和数据增强方法减少偏见,提升公平性和准确性。

Comments Accepted at ICLR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02148 2026-02-05 cs.AI cs.LG 57%

OmniCellTOSG: The First Cell Text-Omic Signaling Graphs Dataset for Graph Language Foundation Modeling

OmniCellTOSG: 首个细胞文本-组学信号图谱数据集用于图语言基础建模

Heming Zhang, Tim Xu, Dekang Cao, Shunning Liang, Guntaas Shergill, Nicholas Hadas, Lars Schimmelpfennig, Levi Kaster, Di Huang, Guangfu Li, S. Peter Goedegebuure, David DeNardo, Li Ding, Ryan C. Fields, J Philip Miller, Pirooz Eghtesady, Carlos Cruchaga, William Buchser, Jonathan Cooper, Marco Sardiello, Patricia Dickson, Yixin Chen, Michael Province, Philip Payne, Fuhai Li

机构 * Institute for Informatics, Data Science and Biostatistics(信息学、数据科学与生物统计学研究所) Washington University in St. Louis(华盛顿大学圣路易斯分校) Department of Computer Science(计算机科学系) NeuroGenomics and Informatics Center(神经基因组学与信息学中心) Department of Genetics(遗传学系) Department of Surgery(外科医学系) Siteman Cancer Center(西门癌中心) Department of Medicine(医学系) Department of Pediatrics(儿科医学系) University of Connecticut(康涅狄格大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 OmniCellTOSG通过整合文本、组学和信号网络信息,提出CellTOSG-FM模型,在多种下游任务中超越现有组学基础模型,提供疾病相关靶点和信号通路的可解释分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26336 2026-02-05 cs.SE 50%

UniSage: A Unified and Post-Analysis-Aware Sampling for Microservices

UniSage: 一种统一且事后分析感知的微服务采样

Zhouruixing Zhu, Zhihan Jiang, Tianyi Yang, Pinjia He

专题命中 多模态评测 :multi-modal(abstract)

AI总结 UniSage通过整合追踪和日志,结合轻量级异常检测模块,实现事后分析感知的统一采样框架,显著提升数据保留率和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 5 篇

2511.17729 2026-02-05 cs.AI 86%

M^3-Bench: Multi-Modal, Multi-Hop, Multi-Threaded Tool-Using MLLM Agent Benchmark

M^3-Bench: 多模态、多跳、多线程工具使用 MLLM agent 评估基准

Yang Zhou, Mingyu Zhao, Zhenting Wang, Difei Gu, Bangwei Guo, Ruosong Ye, Ligong Han, Can Jin, Dimitris N. Metaxas

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 多模态Agent :multi-modal(title);MLLM(title);multimodal(abstract);分类 cs.AI

AI总结 M^3-Bench是首个评估多模态工具使用下模型上下文协议的基准,通过多跳、多线程工作流和可追溯的一对一对应关系,揭示了多模态大语言模型在论点保真度和结构一致性方面的持续差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04763 2026-02-05 cs.LG cs.AI 79%

Active Asymmetric Multi-Agent Multimodal Learning under Uncertainty

在不确定性下主动非对称多智能体多模态学习

Rui Liu, Pratap Tokekar, Ming Lin

机构 * University of Maryland, College Park(马里兰大学 College Park分校)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 在不确定性下主动非对称多智能体多模态学习通过模态层面协作提升事故检测性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04112 2026-02-05 cs.CL 79%

DELTA: Deliberative Multi-Agent Reasoning with Reinforcement Learning for Multimodal Psychological Counseling

DELTA: 基于强化学习的多智能体推理用于多模态心理辅导

Jiangnan Yang, Junjie Chen, Fei Wang, Yiqi Nie, Yuxin Liu, Zhangling Duan, Jie Chen

机构 * Anhui University(安徽大学) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究所)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 DELTA 通过强化学习和多智能体推理提升多模态心理辅导的质量与情感契合度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04157 2026-02-05 cs.RO 78%

A Modern System Recipe for Situated Embodied Human-Robot Conversation with Real-Time Multimodal LLMs and Tool-Calling

一种面向情境具身人机对话的现代系统配方,结合实时多模态大语言模型与工具调用

Dong Won Lee, Sarah Gillet, Louis-Philippe Morency, Cynthia Breazeal, Hae Won Park

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文提出了一种结合实时多模态大语言模型与工具调用的系统配方,用于提升情境具身人机对话的交互质量与效率。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04144 2026-02-05 cs.AI cs.LG 70%

OMG-Agent: Toward Robust Missing Modality Generation with Decoupled Coarse-to-Fine Agentic Workflows

OMG-Agent:迈向鲁棒缺失模态生成的解耦粗到细代理工作流

Ruiting Dai, Zheyu Wang, Haoyu Yang, Yihan Liu, Chengzhi Wang, Zekun Zhang, Zishan Huang, Jiaman Cen, Lisi Mo

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 OMG-Agent通过解耦粗到细的代理工作流,有效解决多模态数据缺失问题,提升生成的鲁棒性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 11 篇

2602.04231 2026-02-05 cs.RO 82%

GeoLanG: Geometry-Aware Language-Guided Grasping with Unified RGB-D Multimodal Learning

GeoLanG: 基于几何的语言引导抓取与统一RGB-D多模态学习

Rui Tang, Guankun Wang, Long Bai, Huxin Gao, Jiewen Lai, Chi Kit Ng, Jiazheng Wang, Fan Zhang, Hongliang Ren

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 GeoLanG通过统一RGB-D多模态学习,结合深度引导几何模块和自适应通道集成,实现鲁棒的语言引导抓取,提升复杂环境中的抓取精度和泛化能力。

Comments IEEE ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04016 2026-02-05 eess.SP cs.LG 82%

A Multi-Modal Foundational Model for Wireless Communication and Sensing

一种用于无线通信和传感的多模态基础模型

Vahid Yazdnian, Yasaman Ghasempour

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract)

AI总结 本文提出了一种多模态基础模型,通过物理指导的自监督预训练策略,实现无线通信和传感任务的稳健泛化与高效适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21436 2026-02-05 cs.LG cs.AI cs.CL cs.CV 82%

From Consistency to Complementarity: Aligned and Disentangled Multi-modal Learning for Time Series Understanding and Reasoning

从一致性到互补性:面向时间序列理解和推理的对齐与解缠多模态学习

Hang Ni, Weijia Zhang, Fei Wang, Zezhi Shao, Hao Liu

机构 * The Hong Kong University of Science(香港科学与技术大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 MADI通过细粒度对齐和解缠交互提升多模态时间序列理解和推理能力,实现更精确的数值-视觉模态整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04405 2026-02-05 cs.CV cs.MM 81%

Interactive Spatial-Frequency Fusion Mamba for Multi-Modal Image Fusion

交互式空间-频率融合Mamba用于多模态图像融合

Yixin Zhu, Long Lv, Pingping Zhang, Xuehu Liu, Tongdan Tang, Feng Tian, Weibing Sun, Huchuan Lu

机构 * School of Future Technology, Dalian University of Technology and the Key Laboratory of Data Science and Smart Education (Hainan Normal University), Ministry of Education(未来技术学院,大连理工大学和数据科学与智能教育关键实验室(海南师范大学),教育部) Affiliated Zhongshan Hospital of Dalian University(大连大学附属中山医院) School of Computer Science and Artificial Intelligence, Wuhan University of Technology(计算机科学与人工智能学院,武汉理工大学) Central Hospital of Dalian University of Technology(大连理工大学中心医院) School of Information and Communication Engineering, Dalian University of Technology(信息与通信工程学院,大连理工大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出交互式空间-频率融合Mamba框架,通过多尺度频率融合和交互式融合提升多模态图像融合性能。

Comments This work is accepted by IEEE Transactions on Image Processing. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16419 2026-02-05 cs.CL cs.CV 81%

Learning Domain Knowledge in Multimodal Large Language Models through Reinforcement Fine-Tuning

通过强化微调学习多模态大语言模型中的领域知识

Qinglong Cao, Yuntian Chen, Chao Ma, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University, Shanghai, China(人工智能大规模并行计算实验室,人工智能研究院,上海交通大学,上海)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出通过强化微调框架在优化层面整合领域知识,提升多模态大语言模型在专门领域任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04512 2026-02-05 q-bio.NC cs.AI 79%

BrainVista: Modeling Naturalistic Brain Dynamics as Multimodal Next-Token Prediction

BrainVista: 以多模态下一项令牌预测建模自然主义脑动力学

Xuanhua Yin, Runkai Zhao, Lina Yao, Weidong Cai

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 BrainVista通过多模态自回归框架建模自然主义脑动力学,采用网络级令牌化器和空间混合头以解构系统特定动态并捕捉跨网络信息流,通过S2B掩码机制实现严格因果条件,提升fMRI编码性能。

Comments 17 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04670 2026-02-05 cs.AI 79%

Improving Multimodal Brain Encoding Model with Dynamic Subject-awareness Routing

改进多模态脑编码模型的动态主体感知路由

Xuanhua Yin, Runkai Zhao, Weidong Cai

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 AFIRE和MIND通过动态主体感知路由提升多模态脑编码模型的性能,增强跨受试者泛化能力并实现可解释的专家模式。

Comments 7 pages, 4 figures, accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20977 2026-02-05 cs.CL 79%

Evaluating and Steering Modality Preferences in Multimodal Large Language Model

评估和引导多模态大语言模型中的模态偏好

Yu Zhang, Jinlong Ma, Yongshuai Hou, Xuefeng Bai, Kehai Chen, Yang Xiang, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CL

AI总结 本文提出MC²基准测试,通过受控证据冲突场景评估和引导多模态大语言模型的模态偏好,揭示了其可通过指令引导和潜在表示控制,并展示了通过表示工程方法提升多模态任务性能的潜力。

Comments Modality Preference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04565 2026-02-05 cs.CV 57%

Understanding Degradation with Vision Language Model

理解视觉退化

Guanzhou Lan, Chenyi Liao, Yuqi Yang, Qianli Ma, Zhigang Wang, Dong Wang, Bin Zhao, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院、光学与电子学(iOPEN)、西北工业大学) Honors College, Northwestern Polytechnical University(荣誉学院、西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) School of Artificial Intelligence, Shanghai Jiaotong University(人工智能学院、上海交通大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DU-VLM模型,通过结构化奖励强化学习解决视觉退化理解问题,引入大规模数据集并实现高保真图像恢复。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08420 2026-02-05 cs.RO 50%

LiDAR, GNSS and IMU Sensor Fine Alignment through Dynamic Time Warping to Construct 3D City Maps

通过动态时间规整实现LiDAR、GNSS和IMU传感器精细对齐以构建3D城市地图

Haitian Wang, Hezam Albaqami, Xinyu Wang, Muhammad Ibrahim, Zainy M. Malakan, Abdullah M. Algamdi, Mohammed H. Alghamdi, Ajmal Mian

机构 * University of Western Australia(西澳大学) University of Jeddah(朱尔法大学) Umm Al-Qura University(乌姆·阿勒·盖拉大学) King Khalid University(国王·卡利德大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出通过动态时间规整实现LiDAR、GNSS和IMU传感器精细对齐,以提高3D城市地图构建的精度和一致性。

Comments This paper has been submitted to IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing (JSTARS) and is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02542 2026-02-05 cs.LG cs.CR 50%

OverThink: Slowdown Attacks on Reasoning LLMs

OverThink: 对推理大语言模型的减速攻击

Abhinav Kumar, Jaechul Roh, Ali Naseh, Marzena Karpinska, Mohit Iyyer, Amir Houmansadr, Eugene Bagdasarian

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Simon Fraser University(西蒙弗雷泽大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 OverThink攻击通过注入伪装推理问题,迫使推理大语言模型消耗更多token,从而增加延迟和成本,同时探讨了其防御和影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 8 篇

2602.04486 2026-02-05 cs.CL 83%

Beyond Unimodal Shortcuts: MLLMs as Cross-Modal Reasoners for Grounded Named Entity Recognition

超越单模态捷径:MLLMs作为跨模态推理器用于 grounded 命名实体识别

Jinlong Ma, Yu Zhang, Xuefeng Bai, Kehai Chen, Yuwei Wang, Zeming Liu, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

专题命中 其他多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 本文提出MCR方法,通过多风格推理模式注入和约束引导的可验证优化,解决MLLMs在跨模态推理中的模态偏见问题,提升 grounded 命名实体识别的性能。

Comments GMNER

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07825 2026-02-05 cs.CV cs.AI cs.LG 81%

Deep Multimodal Learning with Missing Modality: A Survey

缺失模态下的深度多模态学习:综述

Renjie Wu, Hu Wang, Hsiang-Ting Chen, Gustavo Carneiro

机构 * The Australian National University(澳大利亚国立大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Adelaide University(阿德莱德大学) The University of Surrey(萨里大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文综述了缺失模态下的多模态学习方法,分析了其动机、技术细节、应用及挑战,为该领域的发展提供了全面的视角。

Comments Accepted by TMLR (Transactions on Machine Learning Research)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14265 2026-02-05 cs.LG 78%

Unified Multimodal Vessel Trajectory Prediction with Explainable Navigation Intention

具有可解释导航意图的统一多模态船舶轨迹预测

Rui Zhang, Chao Li, Kezhong Liu, Chen Wang, Bolong Zheng, Hongbo Jiang

机构 * School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) School of Navigation, Wuhan University of Technology(武汉理工大学航海学院) Hubei Key Laboratory of Internet of Intelligence, School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院智能互联网关键实验室) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文提出了一种整合可解释导航意图的统一多模态船舶轨迹预测框架,通过构建持续性意图树和动态瞬时意图模型,提升预测的准确性和可解释性。

Journal ref IEEE Transactions on Intelligent Transportation Systems, vol. 27, no. 1, pp. 258-269, Jan. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03949 2026-02-05 cs.IT cs.AI cs.LG math.IT 57%

Semantic Rate Distortion and Posterior Design: Compute Constraints, Multimodality, and Strategic Inference

语义速率与后验设计:计算限制、多模态与战略推断

Emrah Akyol

机构 * Electrical and Computer Engineering Department, Binghamton University(宾夕法尼亚大学布林茅尔分校电子与计算机工程系)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文研究了在计算限制下的语义压缩问题,通过后验设计和多模态观测优化,提高了语义准确性和模型效率。

Comments submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏