arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-18 至 2026-02-18 共收录 45 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 6 篇

2601.10313 2026-02-18 cs.CV cs.MM 81%

Hierarchical Refinement of Universal Multimodal Attacks on Vision-Language Models

面向视觉语言模型的层次化通用多模态攻击

Peng-Fei Zhang, Zi Huang

机构 * School of Electrical Engineering and Computer Science, the University of Queensland(电气工程与计算机科学学院,昆士兰大学) Department of Computer Science, City University of Hong Kong(计算机科学系,香港城市大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出HRA框架,通过层次化优化路径和文本重要性建模,实现对视觉语言模型的通用多模态攻击,验证了其在多种任务和数据集上的优越迁移性能。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22914 2026-02-18 cs.CV cs.LG 79%

cadrille: Multi-modal CAD Reconstruction with Reinforcement Learning

cadrille: 多模态CAD重建与强化学习

Maksim Kolodiazhnyi, Denis Tarasov, Dmitrii Zhemchuzhnikov, Alexander Nikulin, Ilya Zisman, Anna Vorontsova, Anton Konushin, Vladislav Kurenkov, Danila Rukhovich

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) AXXX ETH Zurich(苏黎世联邦理工学院) Innopolis University(因诺波利斯大学) Institute of Mechanics, Armenia(亚美尼亚力学研究所)

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 cadrille通过强化学习实现多模态CAD重建,首次在CAD任务中应用RL微调,提升重建性能并设定新基准。

Comments ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15190 2026-02-18 cs.CL 79%

AIC CTU@AVerImaTeC: dual-retriever RAG for image-text fact checking

AIC CTU@AVerImaTeC:双检索器RAG用于图像-文本事实核查

Herbert Ullrich, Jan Drchal

专题命中 图文多模态 :image-text(title);multimodal(abstract);分类 cs.CL

AI总结 AIC CTU@AVerImaTeC提出双检索器RAG方法,通过结合文本和图像检索模块,实现高效的图像-文本事实核查,具有低运行成本和易复现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15124 2026-02-18 cs.CV 79%

Zero-shot HOI Detection with MLLM-based Detector-agnostic Interaction Recognition

基于多模态大语言模型的零样本人-物交互检测

Shiyu Xuan, Dongkai Wang, Zechao Li, Jinhui Tang

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computing and Artificial Intelligence, Southwestern University of Finance and Economics(西南财经大学计算机与人工智能学院) Nanjing Forestry University(南京林业大学)

专题命中 图文多模态 :MLLM(title);multi-modal(abstract);分类 cs.CV

AI总结 本文提出基于多模态大语言模型的零样本人-物交互检测框架,通过解耦检测与识别任务,结合确定性生成方法和空间感知模块,实现高效准确的零样本交互识别。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15543 2026-02-18 cs.RO 78%

Selective Perception for Robot: Task-Aware Attention in Multimodal VLA

机器人选择性感知:多模态VLA中的任务感知注意力

Young-Chae Son, Jung-Woo Lee, Yoon-Ji Choi, Dae-Kwan Ko, Soo-Chul Lim

机构 * Dongguk University(东国大学)

专题命中 图文多模态 :multimodal(title,abstract)

AI总结 本文提出了一种动态信息融合框架,通过任务感知注意力提升机器人多模态VLA模型的效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14073 2026-02-18 cs.CL cs.AI 62%

Annotation-Efficient Vision-Language Model Adaptation to the Polish Language Using the LLaVA Framework

利用LLaVA框架实现波兰语视觉-语言模型的高效标注

Grzegorz Statkiewicz, Alicja Dobrzeniecka, Karolina Seweryn, Aleksandra Krasnodębska, Karolina Piosek, Katarzyna Bogusz, Sebastian Cygert, Wojciech Kusa

机构 * NASK National Research Institute(国家研究机构NASK)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用LLaVA框架高效适应波兰语的视觉-语言模型,通过自动化翻译和合成数据提升多模态模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 5 篇

2510.10509 2026-02-18 cs.SD cs.AI 74%

MARS-Sep: Multimodal-Aligned Reinforced Sound Separation

MARS-Sep: 多模态对齐强化声音分离

Zihan Zhang, Xize Cheng, Zhennan Jiang, Dongjie Fu, Jingyuan Chen, Zhou Zhao, Tao Jin

机构 * Zhejiang University(浙江大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 音频语音多模态 :multimodal(title);分类 cs.AI

AI总结 MARS-Sep通过强化学习框架实现多模态对齐,提升声音分离的语义一致性和信号质量。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05705 2026-02-18 cs.CV cs.AI cs.CL 67%

Long Grounded Thoughts: Synthesizing Visual Problems and Reasoning Chains at Scale

长 grounded 思考:大规模合成视觉问题和推理链

David Acuna, Chao-Han Huck Yang, Yuntian Deng, Jaehun Jung, Ximing Lu, Prithviraj Ammanabrolu, Hyunwoo Kim, Yuan-Hong Liao, Yejin Choi

机构 * nvidia(NVIDIA公司) uoft(多伦多大学) uwaterloo(滑铁卢大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出了一种大规模合成视觉问题和推理链的框架,通过生成高质量数据集提升多模态推理性能,验证了其在视觉、文本和音频任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12174 2026-02-18 cs.LG cs.AI cs.CL cs.CV 67%

Just KIDDIN: Knowledge Infusion and Distillation for Detection of INdecent Memes

Just KIDDIN: 基于知识注入与蒸馏的有害表情包检测

Rahul Garg, Trilok Padhi, Hemang Jain, Ugur Kursuncu, Ponnurangam Kumaraguru

机构 * IIIT Hyderabad Georgia State University(佐治亚州立大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出了一种结合知识蒸馏与注入的框架,用于提升有害表情包检测的性能,通过整合大规模知识图谱和视觉语言模型,实现更准确的毒性识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15381 2026-02-18 cs.IR cs.CV 57%

Automatic Funny Scene Extraction from Long-form Cinematic Videos

从长篇电影视频中自动提取搞笑场景

Sibendu Paul, Haotian Jiang, Caren Chen

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种端到端系统,用于从长篇电影视频中自动识别和排名幽默场景,通过多模态方法提升场景定位和幽默检测精度。

Journal ref Association for the Advancement of Artificial Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15766 2026-02-18 cs.SD 50%

TAC: Timestamped Audio Captioning

TAC:带时间戳的音频描述

Sonal Kumar, Prem Seetharaman, Ke Chen, Oriol Nieto, Jiaqi Su, Zhepei Wang, Rithesh Kumar, Dinesh Manocha, Nicholas J. Bryan, Zeyu Jin, Justin Salamon

机构 * University of Maryland, College Park, USA(美国马里兰大学 College Park 分校) Adobe Research, USA(Adobe 研究院) OpenAI, USA (work done while at Adobe)(OpenAI, USA)

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 TAC通过生成时间接地的音频描述提升复杂声音场景的理解,结合TAC-V实现音频-视觉语义桥梁,提升文本推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 7 篇

2511.10902 2026-02-18 cs.CL 79%

Multimodal Peer Review Simulation with Actionable To-Do Recommendations for Community-Aware Manuscript Revisions

多模态同行评审模拟:面向社区意识的论文修订可操作待办推荐系统

Mengze Hong, Di Jiang, Weiwei Zhao, Yawen Li, Yihang Wang, Xinyuan Luo, Yanjie Sun, Chen Jason Zhang

机构 * Hong Kong Polytechnic University(香港理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Independent Researcher(独立研究者)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本研究提出一个多模态同行评审模拟系统,通过整合文本和视觉信息,利用检索增强生成技术提升评审质量,并生成可操作的待办列表,以提高论文修订的效率和准确性。

Comments Accepted by TheWebConf 2026 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18891 2026-02-18 cs.LG 78%

CAAT-EHR: Cross-Attentional Autoregressive Transformer for Multimodal Electronic Health Record Embeddings

CAAT-EHR: 多模态电子健康记录嵌入的交叉注意力自回归变压器

Mohammad Al Olaimat, Shaika Chowdhury, Serdar Bozdag

机构 * Department of Computer Science and Engineering, University of North Texas(计算机科学与工程系,北卡罗来纳大学达顿分校) BioDiscovery Institute, University of North Texas(生物发现研究所,北卡罗来纳大学达顿分校) Center for Computational Life Sciences, University of North Texas(计算生命科学中心,北卡罗来纳大学达顿分校)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 CAAT-EHR通过多模态嵌入和自回归机制提升EHR分析的通用性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15782 2026-02-18 cs.CV 57%

Meteorological data and Sky Images meets Neural Models for Photovoltaic Power Forecasting

气象数据与天空图像融合神经模型用于光伏功率预测

Ines Montoya-Espinagosa, Antonio Agudo

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出融合天空图像、光伏历史数据和气象数据的神经模型,提升光伏功率预测的准确性与鲁棒性,支持更高效的电网运行和太阳能管理。

Comments CAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15397 2026-02-18 cs.RO cs.AI 57%

ActionCodec: What Makes for Good Action Tokenizers

ActionCodec:什么使好的动作分词器成为可能

Zibin Dong, Yicheng Liu, Shiduo Zhang, Baijun Ye, Yifu Yuan, Fei Ni, Jingjing Gong, Xipeng Qiu, Hang Zhao, Yinchuan Li, Jianye Hao

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Tianjin University(天津大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出ActionCodec,通过信息论原则提升动作分词性能,实现无需机器人预训练的VLA模型新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15329 2026-02-18 cs.CV 57%

EventMemAgent: Hierarchical Event-Centric Memory for Online Video Understanding with Adaptive Tool Use

EventMemAgent: 基于分层事件中心记忆的在线视频理解与自适应工具使用

Siwei Wen, Zhangcheng Wang, Xingjian Zhang, Lei Huang, Wenjun Wu

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算先进创新中心,人工智能学院,北京航空航天大学) Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北京航空航天大学) Paradigm Inc.(4Paradigm公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 EventMemAgent通过分层事件中心记忆和自适应工具使用,解决在线视频理解中长程推理与细粒度细节的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10807 2026-02-18 cs.CV 57%

Prompts to Summaries: Zero-Shot Language-Guided Video Summarization with Large Language and Video Models

提示到摘要:基于大语言和视频模型的零样本语言引导视频摘要

Mario Barbara, Alaa Maalouf

机构 * Department of Computer Science, the University of Haifa(哈ifa大学计算机科学系)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出一种基于大语言和视频模型的零样本视频摘要方法,通过提示生成用户引导的摘要,无需训练数据,优于现有无监督和监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15567 2026-02-18 cs.RO 50%

Constraining Streaming Flow Models for Adapting Learned Robot Trajectory Distributions

约束流式流模型以适应学习的机器人轨迹分布

Jieting Long, Dechuan Liu, Weidong Cai, Ian Manchester, Weiming Zhi

机构 * School of Computer Science, The University of Sydney, Australia(计算机科学学院,悉尼大学,澳大利亚) School of Aerospace, Mechanical and Mechatronic Engineering, The University of Sydney, Australia(航空航天、机械与机电工程学院,悉尼大学,澳大利亚) Australian Center For Robotics, The University of Sydney, Australia(机器人研究中心,悉尼大学,澳大利亚) College of Connected Computing, Vanderbilt University, TN, USA(连接计算学院,范德比尔特大学,美国)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 CASF通过约束感知流式流模型在实时中适应机器人轨迹,确保安全性和可行性,优于传统方法。

Comments 8 pages, 8 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 2 篇

2602.15556 2026-02-18 cs.CV 57%

Revealing and Enhancing Core Visual Regions: Harnessing Internal Attention Dynamics for Hallucination Mitigation in LVLMs

揭示并增强核心视觉区域:利用内部注意力动态缓解LVLMs中的幻觉

Guangtao Lyu, Qi Liu, Chenghao Xu, Jiexi Yan, Muli Yang, Xueting Li, Fen Fang, Cheng Deng

机构 * School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) College of Computer and Information, Hohai University(河海大学计算机与信息学院) Institute for Infocomm Research, A*STAR(A*STAR信息与通信研究所)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 PADE通过构建PAD图和系统令牌补偿,利用内部注意力动态提升LVLMs的视觉定位能力并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15183 2026-02-18 cs.LG cs.CL 57%

Seeing to Generalize: How Visual Data Corrects Binding Shortcuts

看见以泛化:视觉数据如何纠正绑定捷径

Nicolas Buzeta, Felipe del Rio, Cristian Hinostroza, Denis Parra, Hans Lobel, Rodrigo Toro Icarte

机构 * Department of Computer Science, Pontificia Universidad Católica, Santiago, Chile(计算机科学系,天主教大学,圣地亚哥,智利)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CL

AI总结 视觉数据训练可增强模型在单模态任务中的推理与泛化能力,通过改变绑定策略提升分布外性能。

Comments Submitted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 4 篇

2602.15758 2026-02-18 cs.CL cs.AI 81%

ChartEditBench: Evaluating Grounded Multi-Turn Chart Editing in Multimodal Language Models

ChartEditBench: 评估多轮视觉引导图表编辑在多模态语言模型中的表现

Manav Nitin Kapadnis, Lawanya Baghel, Atharva Naik, Carolyn Rosé

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 ChartEditBench通过代码进行多轮视觉引导图表编辑,评估多模态语言模型在持续、上下文感知编辑中的表现,揭示了多轮交互中错误累积和共享上下文失效的问题。

Comments 16 pages, 13 figures including Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15650 2026-02-18 cs.CV 79%

Concept-Enhanced Multimodal RAG: Towards Interpretable and Accurate Radiology Report Generation

概念增强的多模态RAG:迈向可解释且准确的放射科报告生成

Marco Salmè, Federico Siciliano, Fabrizio Silvestri, Paolo Soda, Rosa Sicilia, Valerio Guarrasi

机构 * Department of Engineering(工程系) Research Unit of Artificial Intelligence and Computer Systems(人工智能与计算机系统研究单位) Università Campus Bio-Medico of Roma(罗马大学生物医学校园) Department of Computer, Control and Management Engineering(计算机、控制与管理工程系) Sapienza University of Rome(罗马萨皮恩扎大学) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering(诊断与介入、辐射物理、生物医学工程系) Umeå University(乌梅拉大学) UniCamillus-Saint Camillus International University of Health Sciences(UniCamillus-圣卡米卢斯国际健康科学大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 概念增强的多模态RAG通过分解视觉表示为可解释的临床概念,提升放射科报告生成的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15776 2026-02-18 cs.AI 57%

GlobeDiff: State Diffusion Process for Partial Observability in Multi-Agent Systems

GlobeDiff:多智能体系统中部分可观测性的状态扩散过程

Yiqin Yang, Xu Yang, Yuhua Jiang, Ni Mu, Hao Hu, Runpeng Xie, Ziyou Zhang, Siyuan Li, Yuan-Hua Ni, Qianchuan Zhao, Bo Xu

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院) Tsinghua University(清华大学) Moonshot AI Nankai University(南开大学) Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 GlobeDiff通过多模态扩散过程解决多智能体系统中部分可观测性问题,实现高保真度的全局状态推断。

Journal ref ICLR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16594 2026-02-18 cs.CL 57%

A Scoping Review of Synthetic Data Generation by Language Models in Biomedical Research and Application: Data Utility and Quality Perspectives

基于语言模型生成合成数据在生物医学研究与应用中的综述:数据效用和质量视角

Hanshu Rao, Weisi Liu, Haohan Wang, I-Chan Huang, Zhe He, Xiaolei Huang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 本文综述了语言模型在生物医学领域生成合成数据的应用,分析了不同模态下的数据效用与质量挑战,指出需建立标准化评估框架以提升生物医学研究的应用效果。

Journal ref Journal of Healthcare Informatics Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 5 篇

2508.00576 2026-02-18 cs.AI 88%

MultiSHAP: A Shapley-Based Framework for Explaining Cross-Modal Interactions in Multimodal AI Models

MultiSHAP: 一种基于Shapley的框架,用于解释多模态AI模型中的跨模态交互

Zhanliang Wang, Kai Wang

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.AI

AI总结 MultiSHAP是一种基于Shapley的框架,用于解释多模态AI模型中跨模态交互的可解释性方法,能够提供实例和数据集级别的解释,揭示模型预测的协同效应和跨模态整合机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12254 2026-02-18 cs.CV cs.AI cs.LG 81%

MMS-VPR: Multimodal Street-Level Visual Place Recognition Dataset and Benchmark

MMS-VPR:多模态街道级视觉地点识别数据集和基准

Yiwei Ou, Xiaobin Ren, Ronggui Sun, Guansong Gao, Kaiqi Zhao, Manfredo Manfredini

机构 * The University of Auckland(奥克兰大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MMS-VPR提出一个大规模多模态数据集和基准,用于行人环境中的街道级视觉地点识别,整合了多模态数据和统一评估平台。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15349 2026-02-18 cs.CV 79%

CREMD: Crowd-Sourced Emotional Multimodal Dogs Dataset

CREMD:众包情感多模态狗数据集

Jinho Baek, Houwei Cao, Kate Blackwell

机构 * dept. of Computer Science(计算机科学系) New York Institute of Technology(纽约理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 CREMD数据集通过众包方式探索不同多模态呈现模式对狗情绪识别的影响,揭示了情境、音频及标注者特征对情绪识别一致性的作用。

Comments Submitted to arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15757 2026-02-18 cs.CL cs.AI 62%

Beyond Binary Classification: Detecting Fine-Grained Sexism in Social Media Videos

超越二元分类:在社交媒体视频中检测细粒度性别歧视

Laura De Grazia, Danae Sánchez Villegas, Desmond Elliott, Mireia Farrús, Mariona Taulé

机构 * CLiC – Language and Computing Center, University of Barcelona(巴塞罗那大学语言与计算中心) Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FineMuSe数据集和层级分类法,评估LLM在细粒度性别歧视检测中的表现,发现多模态LLM在识别细微性别歧视方面表现优异,但在捕捉视觉线索中的多重歧视类型时存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15039 2026-02-18 hep-ex cs.AI 57%

GRACE: an Agentic AI for Particle Physics Experiment Design and Simulation

GRACE:一个用于粒子物理实验设计和模拟的智能体

Justin Hill, Hong Joo Ryoo

机构 * Data Science Institute, Columbia Engineering(数据科学研究院,哥伦比亚工程学院) Department of Physics and Astronomy, Johns Hopkins University(物理与天文学系,约翰霍普金斯大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 GRACE是一个用于粒子物理实验设计和模拟的智能体,通过自主探索设计修改提升物理性能,引入了新的基准测试和约束搜索方法。

Comments Both authors contributed equally. 43 pages, 12 figures, 6 tables, data can be found in https://github.com/just5034/GRACE_whitepaper_data

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态Agent 4 篇

2502.17812 2026-02-18 cs.CL cs.LG 79%

Can Multimodal LLMs Perform Time Series Anomaly Detection?

多模态大语言模型能否进行时间序列异常检测?

Xiongxiao Xu, Haoran Wang, Yueqing Liang, Philip S. Yu, Yue Zhao, Kai Shu

机构 * Illinois Institute of Technology(伊利诺伊理工学院) Emory University(埃默里大学) University of Illinois Chicago(伊利诺伊大学香槟分校) University of Southern California(南加州大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 本研究提出基于多代理框架的TSAD-Agents,利用多模态大语言模型实现自动时间序列异常检测。

Comments ACM Web Conference 2026 (WWW'26)

详情

展开后加载摘要…

URL PDF HTML 收藏