arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-16 至 2026-01-16 共收录 40 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 6 篇

2601.09879 2026-01-16 cs.CV cs.AI 86%

MedVL-SAM2: A unified 3D medical vision-language model for multimodal reasoning and prompt-driven segmentation

MedVL-SAM2:一种统一的3D医学视觉-语言模型,用于多模态推理和基于提示的分割

Yang Xing, Jiong Wu, Savas Ozdemir, Ying Zhang, Yang Yang, Wei Shao, Kuang Gong

机构 * Department of Biomedical Engineering, University of Florida(佛罗里达大学生物医学工程系) Department of Radiology, University of Florida(佛罗里达大学放射学系) Research Computing, University of Florida(佛罗里达大学研究计算中心) Department of Medicine, University of Florida(佛罗里达大学医学系) Department of Radiology, UC San Francisco(旧金山大学放射学系)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 MedVL-SAM2是一种统一的3D医学多模态模型,通过联合训练实现报告生成、VQA和多任务分割的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10094 2026-01-16 cs.CV cs.AI cs.LG 81%

V-Zero: Self-Improving Multimodal Reasoning with Zero Annotation

V-Zero:基于零标注的自改进多模态推理

Han Wang, Yi Yang, Jingyuan Hu, Minfeng Zhu, Wei Chen

机构 * State Key Laboratory of CAD&CG(计算机辅助设计与图形学国家重点实验室) Zhejiang University(浙江大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 V-Zero通过自改进机制在无需人工标注的情况下提升多模态模型的视觉数学推理和通用视觉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15372 2026-01-16 cs.IR cs.AI cs.CV cs.LG cs.MM 75%

Image Complexity-Aware Adaptive Retrieval for Efficient Vision-Language Models

面向高效视觉-语言模型的图像复杂度感知自适应检索

Mikel Williams-Lekuona, Georgina Cosma

机构 * Computer Science, Loughborough University, Loughborough, UK(计算机科学,洛桑大学,洛桑,英国)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 ICAR通过自适应计算方法提升视觉-语言模型效率,实现高效图像-文本匹配与复杂度评估。

Comments Camera-ready version for ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10535 2026-01-16 cs.CV 57%

SVII-3D: Advancing Roadside Infrastructure Inventory with Decimeter-level 3D Localization and Comprehension from Sparse Street Imagery

SVII-3D:利用厘米级3D定位与稀疏街道影像的综合理解,推进道路基础设施库存建设

Chong Liu, Luxuan Fu, Yang Jia, Zhen Dong, Bisheng Yang

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS), Wuhan University, Wuhan 430079, China(信息工程测绘遥感国家重点实验室(LIESMARS),武汉大学) Research Institute Ltd, Chengdu 610000, China(四川省公路规划设计研究有限公司)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 SVII-3D通过厘米级3D定位与稀疏影像综合理解,提升道路基础设施库存的自动化创建与细粒度状态诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09668 2026-01-16 cs.CV 57%

STEP3-VL-10B Technical Report

STEP3-VL-10B 技术报告

Ailin Huang, Chengyuan Yao, Chunrui Han, Fanqi Wan, Hangyu Guo, Haoran Lv, Hongyu Zhou, Jia Wang, Jian Zhou, Jianjian Sun, Jingcheng Hu, Kangheng Lin, Liang Zhao, Mitt Huang, Song Yuan, Wenwen Qu, Xiangfeng Wang, Yanlin Lai, Yingxiu Zhao, Yinmin Zhang, Yukang Shi, Yuyang Chen, Zejia Weng, Ziyang Meng, Ang Li, Aobo Kong, Bo Dong, Changyi Wan, David Wang, Di Qi, Dingming Li, En Yu, Guopeng Li, Haiquan Yin, Han Zhou, Hanshan Zhang, Haolong Yan, Hebin Zhou, Hongbo Peng, Jiaran Zhang, Jiashu Lv, Jiayi Fu, Jie Cheng, Jie Zhou, Jisheng Yin, Jingjing Xie, Jingwei Wu, Jun Zhang, Junfeng Liu, Kaijun Tan, Kaiwen Yan, Liangyu Chen, Lina Chen, Mingliang Li, Qian Zhao, Quan Sun, Shaoliang Pang, Shengjie Fan, Shijie Shang, Siyuan Zhang, Tianhao You, Wei Ji, Wuxun Xie, Xiaobo Yang, Xiaojie Hou, Xiaoran Jiao, Xiaoxiao Ren, Xiangwen Kong, Xin Huang, Xin Wu, Xing Chen, Xinran Wang, Xuelin Zhang, Yana Wei, Yang Li, Yanming Xu, Yeqing Shen, Yuang Peng, Yue Peng, Yu Zhou, Yusheng Li, Yuxiang Yang, Yuyang Zhang, Zhe Xie, Zhewei Huang, Zhenyi Lu, Zhimin Fan, Zihui Cheng, Daxin Jiang, Qi Han, Xiangyu Zhang, Yibo Zhu, Zheng Ge

机构 * Multimodal Intelligence Team(多模态智能团队)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 STEP3-VL-10B 是一个轻量级开源基础模型,通过统一预训练和强化学习策略,在紧凑规模下实现多模态智能,超越大规模模型并在复杂推理任务中表现优异。

Comments 50 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08355 2026-01-16 cs.CV 57%

Semantic Misalignment in Vision-Language Models under Perceptual Degradation

视觉-语言模型在感知退化下的语义错位

Guo Cheng

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本研究探讨了视觉-语言模型在感知退化下的语义错位问题,发现传统分割指标的下降并未影响下游行为,揭示了像素鲁棒性与多模态语义可靠性之间的脱节。

Comments 10 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 3 篇

2601.10272 2026-01-16 cs.CL cs.AI cs.LG cs.SD 73%

MoST: Mixing Speech and Text with Modality-Aware Mixture of Experts

MoST:通过模态感知混合专家混合语音和文本

Yuxuan Lou, Kai Yang, Yang You

机构 * School of Computer Science, National University of Singapore(新加坡国立大学计算机科学学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 MoST通过模态感知混合专家架构,实现语音和文本的高效融合,首次公开了基于混合专家的语音-文本大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19670 2026-01-16 cs.CL 57%

CoSense-LLM: Semantics at the Edge with Cost- and Uncertainty-Aware Cloud-Edge Cooperation

CoSense-LLM:在成本和不确定性意识下实现边缘语义的云边协作

Hasan Akgul, Mari Eplik, Javier Rojas, Aina Binti Abdullah, Pieter van der Merwe

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 CoSense-LLM通过边缘优先设计,在成本和不确定性意识下实现云边协作,以提供紧凑的语义标记和隐私保护。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10119 2026-01-16 cs.CR 50%

Advanced Encryption Technique for Multimedia Data Using Sudoku-Based Algorithms for Enhanced Security

基于数独算法的多媒体数据高级加密技术

Mithil Bavishi, Anuj Bohra, Kushal Vadodaria, Abhinav Bohra, Neha Katre, Ramchandra Mangrulkar, Vinaya Sawant

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出了一种基于数独算法的高级加密技术,用于增强多媒体数据的安全性,通过时间戳依赖密钥生成并支持多种媒体类型。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 2 篇

2601.10228 2026-01-16 cs.CV cs.MM eess.IV 81%

Optimizing Multimodal LLMs for Egocentric Video Understanding: A Solution for the HD-EPIC VQA Challenge

优化多模态大语言模型以实现视角视频理解:HD-EPIC VQA挑战的解决方案

Sicheng Yang, Yukai Huang, Shitong Sun, Weitong Cai, Jiankang Deng, Jifei Song, Zhensong Zhang

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出一种优化多模态大语言模型的方法,通过预处理、微调和时间链式思考提示,在HD-EPIC VQA挑战中实现了41.6%的准确率。

Comments 4 pages, 1 figure, CVPR 2025 EgoVis Workshop, 2nd Place in HD-EPIC Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02064 2026-01-16 cs.CV 79%

RTV-Bench: Benchmarking MLLM Continuous Perception, Understanding and Reasoning through Real-Time Video

RTV-Bench: 通过实时视频对多模态大语言模型的连续感知、理解和推理进行基准测试

Shuhang Xun, Sicheng Tao, Jungang Li, Yibo Shi, Zhixin Lin, Zhanhui Zhu, Yibo Yan, Hanqian Li, Linghao Zhang, Shikang Wang, Yixin Liu, Hanbo Zhang, Ying Ma, Xuming Hu

机构 * HIT(哈尔滨工业大学) HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) XJTU(西安交通大学) SDU(山东大学) CityU(城市大学) HUST(华中科技大学)

专题命中 视频多模态 :MLLM(title);multimodal(abstract);分类 cs.CV

AI总结 RTV-Bench通过实时视频对多模态大语言模型的连续感知、理解和推理能力进行细粒度基准测试,揭示了实时模型在长时段视频处理中的性能优势与局限。

Comments Accepted by NeurIPS 2025 Datasets and Benchmarks Track;

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2508.01346 2026-01-16 cs.CR 78%

MultiCFV: Detecting Control Flow Vulnerabilities in Smart Contracts Leveraging Multimodal Deep Learning

MultiCFV: 利用多模态深度学习检测智能合约中的控制流漏洞

Hongli Peng, Xiaoqi Li, Wenkai Li

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 MultiCFV通过融合多模态特征提升智能合约控制流漏洞检测与代码克隆识别的准确性

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06743 2026-01-16 cs.MM cs.IR 57%

The State-of-the-Art in Lifelog Retrieval: A Review of Progress at the ACM Lifelog Search Challenge Workshop 2022-24

生命周期检索的最新进展:ACM生命周期检索挑战工作坊2022-24年进展综述

Allie Tran, Werner Bailer, Duc-Tien Dang-Nguyen, Graham Healy, Steve Hodges, Björn Þór Jónsson, Luca Rossetto, Klaus Schoeffmann, Minh-Triet Tran, Lucia Vadicamo, Cathal Gurrin

专题命中 跨模态检索 :multimodal(abstract);分类 cs.MM

AI总结 本文综述了ACM生命周期检索挑战工作坊2022-24年在交互式生命周期检索领域的最新进展,重点分析了嵌入式检索方法、大语言模型整合及多模态界面的创新,并探讨了系统性能与用户界面设计的平衡问题。

Journal ref 2025 IEEE Access, 13. pp. 216340-216363. ISSN 2169-3536

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09985 2026-01-16 cs.LG cs.AR cs.IR 50%

FaTRQ: Tiered Residual Quantization for LLM Vector Search in Far-Memory-Aware ANNS Systems

FaTRQ:面向远内存感知的ANNS系统中的分层残差量化

Tianqi Zhang, Flavio Ponzina, Tajana Rosing

机构 * San Diego State University(圣地亚哥州立大学)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 FaTRQ通过分层残差量化和自定义加速器,提升ANNS系统的存储效率和吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 3 篇

2509.14981 2026-01-16 cs.CV 57%

SPATIALGEN: Layout-guided 3D Indoor Scene Generation

SPATIALGEN: 布局引导的3D室内场景生成

Chuan Fang, Heng Li, Yixun Liang, Jia Zheng, Yongsen Mao, Yuan Liu, Rui Tang, Zihan Zhou, Ping Tan

机构 * Hong Kong University of Science and Technology(香港科技大学) Manycore Tech Inc(Manycore科技公司)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 SPATIALGEN通过布局引导的多视角多模态扩散模型生成高质量3D室内场景,解决现有方法在视觉质量、多样性及语义一致性方面的不足。

Comments 3D scene generation; diffusion model; Scene reconstruction and understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22974 2026-01-16 cs.CV 57%

RealCamo: Boosting Real Camouflage Synthesis with Layout Controls and Textual-Visual Guidance

RealCamo: 通过布局控制和文本-视觉引导提升真实伪装合成

Chunyuan Chen, Yunuo Cai, Shujuan Li, Weiyun Liang, Bin Wang, Jing Xu

机构 * College of Artificial Intelligence, Nankai University, Tianjin, China(人工智能学院,南开大学,天津,中国) School of Data Science, Fudan University, Shanghai, China(数据科学学院,复旦大学,上海,中国)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 RealCamo通过布局控制和文本-视觉引导提升真实伪装合成,解决现有方法在伪装效果和背景一致性上的不足。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10708 2026-01-16 cs.LG math.ST stat.TH 50%

High-accuracy and dimension-free sampling with diffusions

高精度和无维度的扩散采样

Khashayar Gatmiry, Sitan Chen, Adil Salim

机构 * UC Berkeley(伯克利大学) Harvard University(哈佛大学)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出了一种基于低次近似与插值方法的扩散模型求解器,实现了高精度采样且不依赖环境维度。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 9 篇

2601.10513 2026-01-16 cs.CL cs.HC 83%

AEQ-Bench: Measuring Empathy of Omni-Modal Large Models

AEQ-Bench:衡量多模态大模型的共情能力

Xuan Luo, Lewei Yao, Libo Zhao, Lanqing Hong, Kai Chen, Dehua Tao, Daxin Tan, Ruifeng Xu, Jing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) The Harbin Institute of Technology(哈尔滨工业大学) Huawei(华为) Hong Kong University of Science and Technology(香港理工大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 多模态评测 :omni-modal(title,abstract);multi-modal(abstract);分类 cs.CL

AI总结 AEQ-Bench通过评估多模态大模型在情感识别和音频响应共情判断上的能力,揭示了音频输出能力对模型性能的影响及非语言表达评估的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17116 2026-01-16 cs.MM cs.AI cs.CV cs.IR 82%

The CASTLE 2024 Dataset: Advancing the Art of Multimodal Understanding

CASTLE 2024数据集:推动多模态理解艺术的发展

Luca Rossetto, Werner Bailer, Duc-Tien Dang-Nguyen, Graham Healy, Björn Þór Jónsson, Onanong Kongmeesub, Hoang-Bao Le, Stevan Rudinac, Klaus Schöffmann, Florian Spiess, Allie Tran, Minh-Triet Tran, Quang-Linh Tran, Cathal Gurrin

机构 * Dublin City University(都柏林城市大学) JOANNEUM RESEARCH(JOANNEUM研究机构) University of Bergen(卑尔根大学) Reykjavik University(雷克雅未克大学) University of Amsterdam(阿姆斯特丹大学) Klagenfurt University(克雷克夫特大学) University of Basel(巴塞尔大学) VNU Ho Chi Minh University of Science(越南胡志明国家科学大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 CASTLE 2024数据集通过提供多视角视频和音频数据,推动多模态理解技术的发展。

Comments 7 pages, 6 figures, dataset available via https://castle-dataset.github.io/

Journal ref 2025 MM'25: Proceedings of the 33rd ACM International Conference on Multimedia (pp. 12629-12635)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10323 2026-01-16 cs.CV cs.CL 81%

ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding

ROMA: 实时多模态助手与交互式流式理解

Xueyun Tian, Wei Li, Bingbing Xu, Heng Dong, Yuanzhuo Wang, Huawei Shen

机构 * CAS Key Laboratory of AI Safety, Institute of Computing Technology, CAS, Beijing, China(中国科学院人工智能安全重点实验室,计算技术研究所,中国科学院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Tsinghua University, Beijing, China(清华大学,北京,中国)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 ROMA通过实时多模态处理和交互式流式理解,实现统一的反应性和主动性交互,展现强大的多模态处理能力。

Comments Our project page is available at https://eureka-maggie.github.io/ROMA_show

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09562 2026-01-16 cs.IR 78%

MM-BRIGHT: A Multi-Task Multimodal Benchmark for Reasoning-Intensive Retrieval

MM-BRIGHT: 一种多任务多模态基准用于推理密集型检索

Abdelrahman Abdallah, Mohamed Darwish Mounis, Mahmoud Abdalla, Mahmoud SalahEldin Kasem, Mostafa Farouk Senussi, Mohamed Mahmoud, Mohammed Ali, Adam Jatowt, Hyun-Soo Kang

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 MM-BRIGHT是首个用于推理密集型检索的多模态基准,通过29个技术领域中的2,803个现实世界查询,评估了多模态检索模型在文本到文本、多模态到文本等任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10165 2026-01-16 cs.CV 70%

Advancing Adaptive Multi-Stage Video Anomaly Reasoning: A Benchmark Dataset and Method

推动自适应多阶段视频异常推理:一个基准数据集和方法

Chao Huang, Benfeng Wang, Wei Wang, Jie Wen, Li Shen, Wenqi Ren, Yong Xu, Xiaochun Cao

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学计算机科学与技术学院(深圳校区)) Shenzhen Key Laboratory of Visual Object Detection and Recognition, Harbin Institute of Technology(哈尔滨工业大学深圳视觉目标检测与识别重点实验室)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出视频异常推理任务及相应数据集,通过结构化思维链和自适应策略优化,提升多阶段视频异常推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10122 2026-01-16 cs.CL cs.AI cs.HC 62%

Role-Playing Agents Driven by Large Language Models: Current Status, Challenges, and Future Trends

由大型语言模型驱动的角色扮演代理:现状、挑战与未来趋势

Ye Wang, Jiaxing Chen, Hongjiang Xiao

机构 * Communication University of China(中国传媒大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文系统回顾了由大型语言模型驱动的角色扮演代理的现状、挑战及未来趋势,探讨了关键技术路径与评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10687 2026-01-16 cs.CV 57%

A continental-scale dataset of ground beetles with high-resolution images and validated morphological trait measurements

大陆尺度的地面甲虫高分辨率图像数据集及经验证的形态学特征测量

S M Rayeed, Mridul Khurana, Alyson East, Isadora E. Fluck, Elizabeth G. Campolongo, Samuel Stevens, Iuliia Zarubiieva, Scott C. Lowe, Michael W. Denslow, Evan D. Donoso, Jiaman Wu, Michelle Ramirez, Benjamin Baiser, Charles V. Stewart, Paula Mabee, Tanya Berger-Wolf, Anuj Karpatne, Hilmar Lapp, Robert P. Guralnick, Graham W. Taylor, Sydne Record

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) Virginia Tech(弗吉尼亚理工大学) The University of Maine(缅因大学) University of Florida(佛罗里达大学) The Ohio State University(俄亥俄州立大学) Vector Institute(向量研究所) University of Guelph(圭尔夫大学) National Ecological Observatory Network(国家生态观测网络)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本研究通过高分辨率图像和验证的形态学特征测量,构建了一个大陆尺度的地面甲虫数据集,为自动化物种识别和特征研究提供了可靠的基础。

Comments 21 pages, 10 figures; Submitted to Nature Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09952 2026-01-16 cs.CV cs.RO 57%

OT-Drive: Out-of-Distribution Off-Road Traversable Area Segmentation via Optimal Transport

OT-Drive: 基于最优传输的离群分布越野可通行区域分割

Zhihua Zhao, Guoqiang Li, Chen Min, Kangping Lu

机构 * School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Shandong Pengxiang Automobile Co., Ltd(山东鹏翔汽车有限公司)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 OT-Drive通过最优传输方法实现离群分布越野可通行区域分割,提升自动驾驶在复杂环境下的鲁棒性和泛化能力。

Comments 9 pages, 8 figures, 6 tables. This work has been submitted to the IEEE for possible publication. Code will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02737 2026-01-16 cs.CV 57%

Unveiling and Bridging the Functional Perception Gap in MLLMs: Atomic Visual Alignment and Hierarchical Evaluation via PET-Bench

揭示和弥合MLLMs中的功能感知差距:通过PET-Bench实现原子视觉对齐和分层评估

Zanting Ye, Xiaolong Niu, Xuanbin Wu, Xu Han, Shengyuan Liu, Jing Hao, Zhihao Peng, Hao Sun, Jieqin Lv, Fanghu Wang, Yanchao Huang, Hubing Wu, Yixuan Yuan, Habib Zaidi, Arman Rahmim, Yefeng Zheng, Lijun Lu

机构 * School of Biomedical Engineering, Southern Medical University(生物医学工程学院,南方医科大学) School of Biomedical Engineering, Shanghai Jiaotong University(生物医学工程学院,上海交通大学) Department of Electronic Engineering, Chinese University of Hong Kong(电子工程系,中国香港大学) Faculty of Dentistry, The University of Hong Kong(牙科学院,香港大学) Department of Nuclear Medicine, The Second Affiliated Hospital of Guangzhou University of Chinese Medicine(核医学科,广州中医药大学第二附属医院) PET Center, Department of Nuclear Medicine, Guangdong Provincial People’s Hospital, Southern Medical University(PET中心,核医学科,广东省人民医院,南方医科大学) Department of Nuclear Medicine, Nanfang Hospital, Southern Medical University(核医学科,南芳医院,南方医科大学) Division of Nuclear Medicine and Molecular Imaging, Geneva University Hospitals(核医学与分子影像学部,日内瓦大学医院) Departments of Radiology, Physics, and Biomedical Engineering, The University of British Columbia(放射学、物理和生物医学工程系,不列颠哥伦比亚大学) Medical Artificial Intelligence Laboratory, Westlake University(医学人工智能实验室,西湖大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出AVA方法,通过原子视觉对齐解决MLLMs在功能成像中的感知差距,提升诊断准确性14.83%。

Comments 9 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态Agent 6 篇

2601.09714 2026-01-16 cs.CL cs.AI 62%

Evaluating Novelty in AI-Generated Research Plans Using Multi-Workflow LLM Pipelines

利用多工作流LLM管道评估AI生成的研究计划新颖性

Devesh Saraogi, Rohit Singhee, Dhruv Kumar

机构 * Birla Institute of Technology and Science, Pilani, India(比拉理工学院和科学学院,皮兰迪)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文通过多工作流LLM管道评估AI生成研究计划的新颖性,发现递归分解和长上下文工作流在新颖性和可行性方面表现更优。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10020 2026-01-16 cs.CL 57%

EHRNavigator: A Multi-Agent System for Patient-Level Clinical Question Answering over Heterogeneous Electronic Health Records

EHRNavigator: 一种用于异构电子健康记录上患者级临床问答的多智能体系统

Lingfei Qian, Mauro Giuffre, Yan Wang, Huan He, Qianqian Xie, Xuguang Ai, Xeuqing Peng, Fan Ma, Ruey-Ling Weng, Donald Wright, Adan Wang, Qingyu Chen, Vipina K. Keloth, Hua Xu

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL

AI总结 EHRNavigator通过多智能体系统在异构电子健康记录上实现患者级临床问答,展示出高准确率和高效响应,有效连接基准评估与临床应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15143 2026-01-16 cs.AI cs.MA 57%

An intelligent agent-based simulation of human mobility in extreme urban morphologies

基于智能代理的极端城市形态中人类移动性模拟

Abderaouf Bahi, Amel Ourici

机构 * Computer Science and Applied Mathematics Laboratory (LIMA) Faculty of Science and Technology(计算机科学与应用数学实验室(LIMA)理学院) Faculty of Science and Technology, Chadli Bendjedid University(科学与技术学院,Chadli Bendjedid大学) Mathematical Modeling and Numerical Simulation Laboratory (LAM2SIN) Faculty of Technology(数学建模与数值模拟实验室(LAM2SIN)技术学院) Faculty of Technology, Badji Mokhtar University(技术学院,Badji Mokhtar大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文提出了一种混合模拟框架,通过整合强化学习和图神经网络,实现了在极端城市形态中高效且可持续的移动性解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10208 2026-01-16 cs.RO 50%

Terrain-Adaptive Mobile 3D Printing with Hierarchical Control

地形自适应移动三维打印与分层控制

Shuangshan Nors Li, J. Nathan Kutz

机构 * Department of Electrical and Computer Engineering, University of Washington, USA(电气与计算机工程系,华盛顿大学) Department of Applied Mathematics, University of Washington, USA(应用数学系,华盛顿大学)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本研究提出了一种结合人工智能与分层控制的地形自适应移动三维打印框架,通过多传感器融合和闭环控制实现高精度打印与移动性平衡。

Comments Submitted to the 43rd International Symposium on Automation and Robotics in Construction (ISARC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏