arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-21 至 2026-01-21 共收录 151 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 45 篇

2601.11637 2026-01-21 cs.CV 70%

Evaluating Self-Correcting Vision Agents Through Quantitative and Qualitative Metrics

通过定量和定性指标评估自我纠正的视觉代理

Aradhya Dixit

机构 * The Thørväld Group(Thørväld集团) Inria Paris-Rocquencourt(巴黎-罗克琴堡Inria) Rajiv Gandhi University Doimukh(拉贾·甘地大学多伊穆克) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒姆研究实验室) The Kumquat Consortium(昆夸特联盟)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 本文提出诊断微基准测试,通过量化和定性指标评估视觉代理的自我纠正能力,揭示语义漂移是主要瓶颈,并定义可重复的框架以提升多模态代理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09949 2026-01-21 cs.CV 70%

UVE: Are MLLMs Unified Evaluators for AI-Generated Videos?

UVE: MLLMs是否能作为AI生成视频的统一评估器?

Yuanxin Liu, Rui Zhu, Shuhuai Ren, Jiacong Wang, Haoyuan Guo, Xu Sun, Lu Jiang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) ByteDance Seed(字节跳动种子) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文探讨使用多模态大语言模型作为AI生成视频的统一评估器的可行性,并通过UVE-Bench基准测试评估了18种MLLMs的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14084 2026-01-21 cs.CV cs.AI cs.CL 67%

DermaBench: A Clinician-Annotated Benchmark Dataset for Dermatology Visual Question Answering and Reasoning

DermaBench:一种用于皮肤科视觉问答和推理的临床标注基准数据集

Abdurrahim Yilmaz, Ozan Erdem, Ece Gokyayla, Ayda Acar, Burc Bugra Dagtas, Dilara Ilhan Erdil, Gulsum Gencoglan, Burak Temelkuran

机构 * Imperial College London(帝国理工学院伦敦分校) Istanbul Medeniyet University(伊斯坦布尔医学大学) Usak Research and Training Hospital(Usak研究与培训医院) Istanbul Research and Training Hospital(伊斯坦布尔研究与培训医院) Ipswich Hospital(伊普斯韦奇医院) Medicana Atakoy Hospital(Medicana阿塔基医院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 DermaBench是首个由临床专家标注的皮肤科视觉问答基准数据集,通过精细标注和开放式描述提升多模态模型在皮肤科图像理解与临床推理中的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14127 2026-01-21 cs.CV cs.CL 62%

The Side Effects of Being Smart: Safety Risks in MLLMs' Multi-Image Reasoning

智能的副作用:MLLMs多图像推理中的安全风险

Renmiao Chen, Yida Lu, Shiyao Cui, Xuan Ouyang, Victor Shea-Jay Huang, Shumin Zhang, Chengwei Pan, Han Qiu, Minlie Huang

机构 * CoAI group, DCST, Tsinghua University(清华大学) Beihang University(北航) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 研究发现,多图像推理能力越强的模型在安全测试中越容易产生不安全响应,揭示了模型在任务解决中可能忽视安全约束的风险。

Comments *15 pages, 5 figures. Introduces MIR-SafetyBench (2,676 instances; 9 multi-image relations). Equal contribution; †Corresponding author. Code/data: https://github.com/thu-coai/MIR-SafetyBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10462 2026-01-21 cs.AI cs.CV 62%

ChartComplete: A Taxonomy-based Inclusive Chart Dataset

ChartComplete: 基于分类的包容性图表数据集

Ahmad Mustapha, Charbel Toumieh, Mariette Awad

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 ChartComplete数据集基于图表分类学,涵盖30种图表类型,为多模态大语言模型提供新的基准测试资源。

Comments 7 pages, 4 figures, 3 tables, 1 algorithm. Dataset and source code available at https://github.com/AI-DSCHubAUB/ChartComplete-Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09012 2026-01-21 cs.CL cs.AI 62%

TranslateGemma Technical Report

TranslateGemma 技术报告

Mara Finkelstein, Isaac Caswell, Tobias Domhan, Jan-Thorsten Peter, Juraj Juraska, Parker Riley, Daniel Deutsch, Geza Kovacs, Cole Dilanni, Colin Cherry, Eleftheria Briakou, Elizabeth Nielsen, Jiaming Luo, Kat Black, Ryan Mullins, Sweta Agrawal, Wenda Xu, Erin Kats, Stephane Jaskiewicz, Markus Freitag, David Vilar

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 TranslateGemma基于Gemma 3开发,通过两阶段微调提升多语言翻译性能,实现高效且高质量的翻译模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13304 2026-01-21 cs.CV 57%

CausalSpatial: A Benchmark for Object-Centric Causal Spatial Reasoning

CausalSpatial: 一个用于以对象为中心的因果空间推理的基准

Wenxin Ma, Chenlong Wang, Ruisheng Yuan, Hao Chen, Nanru Dai, S. Kevin Zhou, Yijun Yang, Alan Yuille, Jieneng Chen

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 CausalSpatial提出一个基准测试,评估模型在因果空间推理中的能力,揭示当前MLLMs在3D场景中处理‘如果’问题的不足,并提出COW模型以改进基于物理现实的推理。

Comments Code is available: https://github.com/CausalSpatial/CausalSpatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13264 2026-01-21 cs.CL 57%

Unlearning in LLMs: Methods, Evaluation, and Open Challenges

在大语言模型中进行反学习:方法、评估与开放挑战

Tyler Lizzo, Larry Heck

机构 * AI Virtual Assistant (AVA) Lab(人工智能虚拟助手(AVA)实验室) Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文探讨了大语言模型中反学习的方法、评估体系及开放挑战,旨在为开发可靠且负责任的反学习技术提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10521 2026-01-21 cs.CV 57%

BikeActions: An Open Platform and Benchmark for Cyclist-Centric VRU Action Recognition

BikeActions: 一个面向骑行者的VRU动作识别开放平台和基准

Max A. Buettner, Kanak Mazumder, Luca Koecher, Mario Finkbeiner, Sebastian Niebler, Fabian B. Flohr

机构 * Munich University of Applied Sciences(慕尼黑应用科学大学) Intelligent Vehicles Lab (IVL)(智能车辆实验室)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 BikeActions通过多模态数据集和开放平台,提升骑行者意图识别的准确性和研究的可扩展性。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13225 2026-01-21 cs.CV cs.HC 57%

Not all Blends are Equal: The BLEMORE Dataset of Blended Emotion Expressions with Relative Salience Annotations

并非所有混合情绪都相同:具有相对显著性标注的BLEMORE混合情绪表达数据集

Tim Lachmann, Alexandra Israelsson, Christina Tornberg, Teimuraz Saghinadze, Michal Balazia, Philipp Müller, Petri Laukka

机构 * Stockholm University(斯德哥尔摩大学) Georgian Technical University(格鲁吉亚技术大学) INRIA Université Côte d’Azur(INRIA 阿尔卑斯大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) German Research Center for Artificial Intelligence(德国人工智能研究中心) Uppsala University(乌普萨拉大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 BLEMORE数据集通过多模态视频和音频样本,提供混合情绪表达的相对显著性标注,用于提升混合情绪识别方法的性能和研究。

Comments Accepted for publication at IEEE Face & Gesture 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12744 2026-01-21 cs.AI cs.NI cs.SE 57%

Vision Language Models for Optimization-Driven Intent Processing in Autonomous Networks

面向自主网络的基于视觉语言模型的优化驱动意图处理

Tasnim Ahmed, Yifan Zhu, Salimur Choudhury

机构 * School of Computing, Queen's University, Ontario, Canada(计算学院,女王大学,安大略,加拿大)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出IntentOpt基准测试,评估不同视觉语言模型在生成网络优化代码中的性能,发现视觉参数提取和程序化思维提示显著降低执行成功率,开源模型表现低于闭源模型。

Comments Accepted for presentation at The IEEE International Conference on Communications (ICC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12325 2026-01-21 cs.CV 57%

Multi-Sensor Matching with HyperNetworks

多传感器匹配与超网络

Eli Passov, Nathan S. Netanyahu, Yosi Keller

机构 * Faculty of Computer Science Bar-Ilan University(计算机科学学院巴伊兰大学) Faculty of Engineering Bar-Ilan University(工程学院巴伊兰大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种基于超网络的多模态补丁匹配方法,通过引入轻量级描述符学习架构和条件实例归一化模块,提升跨模态适应性和鲁棒性,并在VIS-NIR基准中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10369 2026-01-21 cs.CV 57%

Fine-Grained Human Pose Editing Assessment via Layer-Selective MLLMs

通过层选择性MLLMs实现细粒度人体姿态编辑评估

Ningyu Sun, Zhaolin Cai, Zitong Xu, Peihang Chen, Huiyu Duan, Yichao Yan, Xiongkuo Min, Xiaokang Yang

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程研究所,上海交通大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出HPE-Bench基准和基于层选择性MLLMs的统一框架,用于细粒度评估人体姿态编辑的真实性和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09208 2026-01-21 cs.HC cs.AI 57%

Mikasa: A Character-Driven Emotional AI Companion Inspired by Japanese Oshi Culture

Mikasa:受日本Oshi文化启发的以角色驱动的情感AI伴侣

Miki Ueno

机构 * The Kyoto College of Graduate Studies for Informatics(京都大学研究生信息学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 Mikasa通过稳定角色和明确关系定义,展示角色驱动设计在情感AI伴侣中的功能性。

Comments This version includes minor explanatory additions in Appendix B-D, Section 2.6, and selected footnotes. A short demonstration video link is also provided

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07581 2026-01-21 cs.CV 57%

BenchSeg: A Large-Scale Dataset and Benchmark for Multi-View Food Video Segmentation

BenchSeg: 一个多视角食物视频分割的大型数据集和基准

Ahmad AlMughrabi, Guillermo Rivo, Carlos Jiménez-Farfán, Umair Haroon, Farid Al-Areqi, Hyunjun Jung, Benjamin Busam, Ricardo Marques, Petia Radeva

机构 * Department of Engineering, Pompeu Fabra University(工程系,庞培法布拉大学) Photogrammetry and Remote Sensing, Technical University of Munich(摄影测量与遥感,慕尼黑技术大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 BenchSeg通过多视角食物视频分割数据集和基准,改进了食物分割和跟踪的性能,提升了饮食分析的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10427 2026-01-21 cs.CV 57%

STRIDE-QA: Visual Question Answering Dataset for Spatiotemporal Reasoning in Urban Driving Scenes

STRIDE-QA:用于城市驾驶场景时空推理的视觉问答数据集

Keishi Ishihara, Kento Sasaki, Tsubasa Takahashi, Daiki Shiono, Yu Yamaguchi

专题命中 多模态评测 :image-text(abstract);分类 cs.CV

AI总结 STRIDE-QA通过大规模视觉问答数据集提升自动驾驶中动态交通场景的时空推理能力,显著提升VLMs在空间定位和未来运动预测中的表现。

Comments Accepted to AAAI 2026 (Oral). project page: https://turingmotors.github.io/stride-qa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08464 2026-01-21 cs.CL cs.LG cs.SI 57%

Large Language Models Meet Stance Detection: A Survey of Tasks, Methods, Applications, Challenges and Future Directions

大语言模型与立场检测:任务、方法、应用、挑战与未来方向的综述

Lata Pangtey, Anukriti Bhatnagar, Shubhi Bansal, Shahid Shafi Dar, Nagendra Kumar

机构 * Department of Computer Science and Engineering, Indian Institute of Technology (IIT) Indore, Indore 453552, India(计算机科学与工程系,印度理工学院(IIT)印多尔,印多尔453552,印度)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文综述了大语言模型在立场检测中的任务、方法、应用及挑战,提出分类框架并探讨未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12119 2026-01-21 cs.CV 57%

CARLA-Round: A Multi-Factor Simulation Dataset for Roundabout Trajectory Prediction

CARLA-Round: 一个用于环形交叉口轨迹预测的多因素模拟数据集

Xiaotong Zhou, Zhenhui Yuan, Yi Han, Tianhua Xu, Laurence T. Yang

机构 * School of Engineering University of Warwick(工程学院 华威大学) School of Information Engineering Wuhan University of Technology(信息工程学院 武汉理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 CARLA-Round数据集通过系统设计的环形交叉口轨迹预测模拟数据,量化了交通密度和天气对预测性能的影响,实现了有效的仿真到现实迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12079 2026-01-21 cs.CV 57%

EmoLat: Text-driven Image Sentiment Transfer via Emotion Latent Space

EmoLat:通过情绪潜在空间实现文本驱动的图像情感迁移

Jing Zhang, Bingjie Fan, Jixiang Zhu, Zhe Wang

机构 * department of Computer Science and Engineering, East China University of Science and Technology(计算机科学与工程系,东华大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 EmoLat通过构建情绪潜在空间,实现文本驱动的图像情感迁移,提升情感表示的判别性和可迁移性,建立可控的图像情感编辑新范式。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13926 2026-01-21 q-bio.QM cs.LG eess.SP 50%

SCG With Your Phone: Diagnosis of Rhythmic Spectrum Disorders in Field Conditions

用手机进行SCG:野外条件下的节律光谱障碍诊断

Peter Golenderov, Yaroslav Matushenko, Anastasia Tushina, Michal Barodkin

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出了一种基于智能手机的深度学习框架,用于在野外条件下通过噪声SCG信号进行节律障碍诊断,实现了高准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13542 2026-01-21 physics.comp-ph cs.LG 50%

Refined Gradient-Based Temperature Optimization for the Replica-Exchange Monte-Carlo Method

细化的基于梯度的温度优化用于复制交换蒙特卡洛方法

Tatsuya Miyata, Shunta Arai, Satoshi Takabe

机构 * Institute of Science Tokyo(东京科学研究所)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出了一种基于梯度的细化温度优化方法,通过重参数化技术确保物理约束,提高复制交换蒙特卡洛方法的采样效率和稳定性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12716 2026-01-21 cs.CR 50%

CellularSpecSec-Bench: A Staged Benchmark for Evidence-Grounded Interpretation and Security Reasoning over 3GPP Specifications

CellularSpecSec-Bench: 一个分阶段的基准,用于基于证据的解释和3GPP规范的保安推理

Ke Xie, Xingyi Zhao, Yiwen Hu, Shuhan Yuan, Tian Xie

专题命中 多模态评测 :multimodal(abstract)

AI总结 CellularSpecSec-Bench通过分阶段基准和统一框架,提升对3GPP规范的解释和安全推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12012 2026-01-21 cs.RO 50%

Model selection and real-time skill assessment for suturing in robotic surgery

机器人手术中缝合技能的模型选择与实时评估

Zhaoyang Jacopo Hu, Alex Ranne, Alaa Eldin Abdelaal, Kiran Bhattacharyya, Etienne Burdet, Allison M. Okamura, Ferdinando Rodriguez y Baena

机构 * Department of Mechanical Engineering, Imperial College London(帝国理工学院机械工程系) Department of Computing, Imperial College London(帝国理工学院计算机系) Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系) Intuitive Surgical, Inc.(Intuitive Surgical公司) Department of Bioengineering, Imperial College London(帝国理工学院生物工程系)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本研究通过多模态深度学习模型实时评估机器人手术缝合技能,证明融合模型在预测准确性上优于单模态模型,并展示了高技能数据对模型泛化能力的提升作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11525 2026-01-21 cs.HC 50%

PlotGen-Bench: Evaluating VLMs on Generating Visualization Code from Diverse Plots across Multiple Libraries

PlotGen-Bench: 评估VLMs在从多样化图表生成可视化代码的能力 across 多个库

Yi Zhao, Zhen Yang, Shuaiqi Duan, Wenmeng Yu, Zhe Su, Jibing Gong, Jie Tang

专题命中 多模态评测 :multimodal(abstract)

AI总结 PlotGen-Bench评估VLMs在多库场景下生成可视化代码的能力,发现开源模型在视觉和语义一致性上表现欠佳,需进一步提升。

Comments 30 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 9 篇

2601.12981 2026-01-21 cs.CV cs.LG 79%

Early Prediction of Type 2 Diabetes Using Multimodal data and Tabular Transformers

利用多模态数据和表格变压器进行2型糖尿病早期预测

Sulaiman Khan, Md. Rafiul Biswas, Zubair Shah

机构 * College of Science and Engineering(科学与工程学院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 利用TabTrans分析多模态数据,通过预测T2DM风险,提升糖尿病管理的前瞻性与个性化水平。

Comments 08 pages, 06 figures, accepted for publication in FLLM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12037 2026-01-21 cs.HC cs.CV cs.SY eess.SY 79%

Multimodal Feedback for Handheld Tool Guidance: Combining Wrist-Based Haptics with Augmented Reality

多模态反馈用于手持工具引导:结合基于手腕的触觉反馈与增强现实

Yue Yang, Christoph Leuze, Brian Hargreaves, Bruce Daniel, Fred M Baik

机构 * Stanford University(斯坦福大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本研究通过结合增强现实与触觉反馈,提升手术中手持工具的精确引导与操作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08434 2026-01-21 cs.RO cs.AI 79%

Large Multimodal Models for Embodied Intelligent Driving: The Next Frontier in Self-Driving?

大规模多模态模型用于具身智能驾驶:自我驾驶的下一个前沿?

Long Zhang, Yuchen Xia, Bingqing Wei, Zhen Liu, Shiwen Mao, Zhu Han, Mohsen Guizani

机构 * School of Information and Electrical Engineering, Hebei University of Engineering(河北工程大学信息与电子工程学院) School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) Department of Electrical and Computer Engineering, Auburn University(阿肯色大学电气与计算机工程系) Department of Electrical and Computer Engineering, University of Houston(休斯顿大学电气与计算机工程系) Department of Computer Science and Engineering, Kyung Hee University(庆熙大学计算机科学与工程系) Machine Learning Department, Mohamed Bin Zayed University of Artificial Intelligence(Mohamed Bin Zayed人工智能大学机器学习系)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出了一种语义和策略双驱动的混合决策框架,用于提升具身智能驾驶中的持续学习与联合决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18177 2026-01-21 cs.CV cs.LG cs.MA 79%

Scene-Aware Vectorized Memory Multi-Agent Framework with Cross-Modal Differentiated Quantization VLMs for Visually Impaired Assistance

具有跨模态差异化量化功能的场景感知向量内存多智能体框架用于视障辅助

Xiangxiang Wang, Xuanyu Wang, YiJia Luo, Yongbin Yu, Manping Fan, Jingtao Zhang, Liyong Ren

机构 * School of Information Software Engineering, University of Electronic Science Sichuan Provincial Key Laboratory for Human Disease Gene Study, Sichuan Academy of Medical Sciences \& Sichuan Provincial People's Hospital, University of Electronic Science Faculty of Computing, Harbin Institute of Technology, Harbin, China

专题命中 多模态Agent :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出了一种具有跨模态差异化量化的多智能体框架,通过减少内存消耗和提升处理效率,为视障人士提供更高效的环境感知与辅助导航支持。

Comments 28 pages,9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12582 2026-01-21 cond-mat.mtrl-sci cs.AI 74%

Ontology-aligned structuring and reuse of multimodal materials data and workflows towards automatic reproduction

面向多模态材料数据和工作流的本体对齐结构化与重用,以实现自动重现

Sepideh Baghaee Ravari, Abril Azocar Guzman, Sarath Menon, Stefan Sandfeld, Tilmann Hickel, Markus Stricker

专题命中 多模态Agent :multimodal(title);分类 cs.AI

AI总结 本文提出一种基于本体驱动和大型语言模型的框架,用于自动提取和结构化多模态材料数据和工作流,以提高计算结果的可重现性和重用性。

Comments 39 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10672 2026-01-21 cs.RO cs.CV 57%

Vision Language Action Models in Robotic Manipulation: A Systematic Review

视觉语言动作模型在机器人操作中的应用:系统综述

Muhayy Ud Din, Waseem Akram, Lyes Saad Saoud, Jan Rosell, Irfan Hussain

机构 * Khalifa University Center for Autonomous Robotic Systems (KUCARS), Khalifa University, United Arab Emirates(卡利法大学自主机器人系统中心(KUCARS)、卡利法大学、阿拉伯联合酋长国) Institute of Industrial and Control Engineering (IOC), Universitat Politecnica de Catalunya, Spain(工业与控制工程研究所(IOC)、巴塞罗那技术大学、西班牙)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文综述了视觉语言动作模型在机器人操作中的应用,分析了102个模型、26个数据集和12个模拟平台,探讨了多模态对齐和可扩展预训练等关键挑战。

Comments submitted to annual review in control

详情

展开后加载摘要…

URL PDF HTML 收藏