arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-31 至 2026-08-31 共收录 46 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 5 篇

2608.27531 2026-08-31 cs.CR cs.CV 新提交 79%

Fully Unleashing the Multimodal Attacker: Meta-Adaptive Jailbreaking of Vision-Language Models

充分释放多模态攻击者的潜力:视觉语言模型的元自适应越狱攻击

Benlei Cui, Shen Pang, Yuke Wang, Xuemei Dong, Yuwen Zhai, Jingqun Tang, Haiyang Yu, Hui Xue, Longtao Huang, Haiwen Hong

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出元自适应多模态越狱攻击(MAMJ),通过优化攻击策略提示与攻击者权重提升多模态越狱效果,在MM-SafetyBench上对多款前沿VLMs的攻击成功率显著优于基线,且可迁移至未见过的目标模型。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28145 2026-08-31 cs.CV 新提交 57%

Dual-Stream Semantic Guidance with Prototype Anchor Calibration for Source-Fully-Free Adaptation of Vision-Language Models

用于视觉语言模型无源域适应的带原型锚定校准的双流语义引导

Weiwei Xiang, Shun Peng, Guangyi Xiao, Hao Chen, Lei Yang

机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机与电子工程学院) Huaihua University(怀化学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 针对无源全自由域适应的双语义漂移问题,提出DSSG框架及带原型锚定校准的DSSG-PAC,在多基准上性能优于SOTA且适配时间降低18.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27550 2026-08-31 cs.RO cs.CV 新提交 57%

Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models

超越数据缩放:面向视觉-语言-动作模型的以表示为中心的持续预训练

Senqiao Yang, Chengyao Wang, Yuxin Chen, Zixuan Wang, Longxiang Tang, Haokun Gui, Jinhui Ye, Changsheng Lu, Xiaoyang Wu, Mingkang Zhu, Pengguang Chen, Shu Liu, Zhuotao Tian, Hengshuang Zhao, Bei Yu, Jiaya Jia

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 针对VLA模型数据扩展的瓶颈,提出以表示为中心的持续预训练方法VLAct,在多具身机器人数据上训练后,在多项基准任务中超越现有工业级系统,在未见具身迁移任务中仅用20%数据即优于全数据基线,为VLA进展提供新方向。

Comments All models and training pipelines are publicly available at this https URL (https://starvla.github.io/VLAct)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27549 2026-08-31 cs.CV 新提交 57%

Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning

代码即世界:用于物理推理的可执行世界表征的智能体式发现

Hanyang Wang, Yimo Cai, Weiliang Chen, Jiawei Chi, Haowen Sun, Qiyu Dai, Yi-Hsin Hung, Xingzhuo Guo, Jinshan Ren, Runmao Yao, Ziwei Liu, Mingsheng Long, Yueqi Duan, Jun Gao, Jiangran Lyu, Fangfu Liu, Jialong Wu

机构 * MirroS

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出Code-as-World范式,通过智能体式发现循环构建可执行世界表征,将其用于为视觉-语言模型训练提供物理监督,在QuantiPhy数据集上取得最优性能且超越领先专有模型

Comments Project Page: this https URL (https://mirros-lab.github.io/code-as-world)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27793 2026-08-31 cs.RO 新提交 50%

CAVE-NAV: VLM-Based Autonomous 3D Navigation in Underwater Cave Environments

CAVE-NAV:基于VLM的水下洞穴环境自主三维导航

Zhenqi Wu, Yuanjie Lu, Yisheng Zhang, Miao Yu, Xuesu Xiao, Jaejeong Shin, Xiaomin Lin

机构 * University of South Florida(南佛罗里达大学) George Mason University(乔治梅森大学) University of Maryland(马里兰大学) Seoul National University(首尔大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 该研究针对水下洞穴导航的传统方法局限,提出带CoT推理的VLM导航框架,经仿真验证可完成无碰撞的端到端三维洞穴导航。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 3 篇

2608.27785 2026-08-31 cs.CL cs.AI 新提交 88%

Compositional Failure in Audio-Visual LLMs: Late-Layer Prior Dominance Under Cross-modal Conflict

音频-视觉大型语言模型中的组合式失效:跨模态冲突下的深层先验主导

Adarsh Sudheer, David Li, Omar Elbanna, Ishaan Kodarapu, Arjun Bahuguna, Vasu Sharma

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究针对AV-LLMs,以音频-视觉冲突为组合泛化测试,发现模型存在先验主导的组合式失效,开展可解释性分析并验证时间对齐无法提升冲突解决能力,提供了相关代码与数据。

Comments Accepted to the 2nd Workshop on Compositional Learning at ICML 2026. 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28212 2026-08-31 cs.MM cs.SD 新提交 79%

MuSP-Bench: Advanced Multimodal Benchmarking of Music Understanding across Score and Performance

MuSP-Bench:面向乐谱与演奏的高级多模态音乐理解基准测试

Milan Liessens Dujardin, Song-Ze Yu, Kevin Miao

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 研究人员推出MuSP-Bench基准测试,含490个乐谱与演奏理解问题,评估发现前沿多模态大语言模型理解乐谱困难,推理演奏音频时挑战更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28040 2026-08-31 cs.CL cs.SD 新提交 57%

A Shaky Voice Is Not Always a Dodge: Benchmarking Textual and Vocal Evasion Detection in Earnings Calls

颤抖的声音并非总是遁词:对财报电话会议中文本与声音规避检测的基准测试

Mirae Kim, Seonghun Jeong, Youngjun Kwak

机构 * KakaoBank Corp.(Kakao银行股份有限公司) Yonsei University(延世大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 该研究针对财报电话会议问答环节,构建了含505个问答对的DualEvasion基准,发现现有多模态模型难以检测声音置信度,孤立解读声学线索,与人类性能差距显著。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 7 篇

2608.28008 2026-08-31 cs.CV 新提交 83%

Visual Token Coding for Video Multimodal Large Language Models

面向视频多模态大语言模型的视觉令牌编码

Chenxin Fang, Tao Chen, JunChao You, Jun Peng, Yiyi Zhou, Rongrong Ji

机构 * Xiamen University(厦门大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出面向视频多模态大语言模型的视觉令牌编码VTC,新增动态设计得到$VTC_{Dy}$,在Qwen3-VL等模型上实验显示其在低令牌预算下仍保持高性能,且为即插即用设计无需额外调优。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28383 2026-08-31 cs.CV cs.CL 新提交 81%

Semantic Head Specialization Guides Hybrid ViT Attention for Multimodal LLMs

语义头专业化指导多模态大语言模型的混合视觉Transformer注意力机制

Chenhong He, Lei Li, Shicheng Li, Hanglong Lv, Lingpeng Kong, Qi Liu, Tong Yang, Shuhuai Ren

机构 * Peking University(北京大学) Xiaomi Corporation(小米公司) The University of Hong Kong(香港大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 该研究针对多模态LLM中混合ViT注意力设计不足的问题,提出语义头专业化(SHS)概念,据此设计Ariadne注意力机制,在22项图像视频任务上性能与全注意力相当,计算量降低6.5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28279 2026-08-31 cs.RO 新提交 78%

STEGNav: Spatio-Temporal Event Graph Reasoning for Multimodal Lifelong Object Navigation

STEGNav:面向多模态终身目标导航的时空事件图推理

Yang Chen, Zhenyu Huang, Wenbo Fu, Danyang Peng, Shi-Yu Tian, Kun-Yang Yu, Lan-Zhe Guo

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 针对现有多模态终身导航方法的局限,本文提出无训练框架STEGNav,通过时空事件图的双轴设计优化导航性能,在多个基准数据集上取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28192 2026-08-31 cs.CV 新提交 57%

Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding

在视频中定位任意目标:重新思考高效的生成式时空视频定位

Hanoona Rasheed, Haania Siddiqui, Ming-Hsuan Yang, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of California, Merced(加州大学默塞德分校) Apertix(阿珀蒂克斯公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对时空视频定位的自回归解码存在延迟高、误差易传播的问题,提出并行轨迹解码,在VidSTG等数据集上实现显著的延迟降低与吞吐量提升,且可零样本泛化到多项相关任务

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28144 2026-08-31 cs.AI 新提交 57%

The Shape of Power: A Multilingual Framework for Social Power Reasoning in Dialogues

权力的形态:面向对话中社会权力推理的多语言框架

Farah Atif, Sougata Saha, Monojit Choudhury

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究针对现有社会权力计算研究的语言文化局限,提出基于社会科学理论的多语言对话社会权力推理框架,构建含15836个实例的双语语料库,评估6类大模型并发现其与人类推理的差距,为跨文化社会推理提供评估设置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27871 2026-08-31 cs.CV 新提交 57%

Temporal Tree of Thought: Reasoning-Guided Visual Cue Search for Long-Video Understanding

时序思维树:面向长视频理解的推理引导型视觉线索搜索

Ziling Huang, Shin'ichi Satoh

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对MLLMs长视频理解的时序组织缺失问题,提出无训练的T³框架,通过分层时序树与“回答-检索-探索”循环实现粗到细的线索搜索,在三个基准数据集上提升了Qwen2.5-VL-7B的性能。

Comments Accept by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28273 2026-08-31 cs.LG 新提交 50%

Learning to Transfer Across Modes: Towards Unified Urban Mobility Forecasting

学习跨模式迁移:面向统一的城市交通预测

Yixuan Zhao, Man Luo

机构 * University of Exeter(埃克塞特大学)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 针对城市多模式交通需求联合预测的挑战,提出统一框架TransMod,通过共享空间表示对齐不同粒度交通系统,实现跨模式知识迁移,在真实数据集上表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 1 篇

2608.27865 2026-08-31 cs.PF 新提交 78%

FFSlim: An Efficient and Lightweight Format for Multi-modal Data Storage and Retrieval

FFSlim:一种用于多模态数据存储与检索的高效轻量格式

Long Yang, Yu Mao, Yuchen Shao, Yumiao Zhao, Yaqi Li, Xuan Liu, Xiaolong Shen, Tao Yu, Gezi Li, Jing Wang, Chengcheng Wan, Liang Shi

专题命中 跨模态检索 :multi-modal(title,abstract)

AI总结 针对多模态数据存储检索的I/O瓶颈问题,提出轻量格式FFSlim,通过三个组件提升效率,实现高吞吐量并降低端到端训练时间

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 3 篇

2608.27505 2026-08-31 cs.CL cs.AI 新提交 62%

A Survey on Rubric-Guided Reinforcement Learning for Language Models

面向语言模型的准则引导强化学习综述

Zifei Shan, Fangning Shao

机构 * WeChat, Tencent(腾讯微信)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 该综述针对传统RLHF的缺陷,提出贝叶斯框架并沿先验-后验轴分类准则引导强化学习,分析语言学相关对齐问题,明确未来研究方向。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28086 2026-08-31 cs.IT cs.CV eess.IV 新提交 57%

Ada-TokenCom: Rate-Adaptive Token Communications via Large-Model-Driven Token Compression and Generation

Ada-TokenCom:基于大模型驱动的令牌压缩与生成的速率自适应令牌通信

Zijun Zhang, Li Qiao, Mahdi Boloursaz Mashhadi, Zhen Gao, Mehdi Bennis, Kaibin Huang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出基于大自回归模型的速率自适应令牌通信框架Ada-TokenCom,结合下一个令牌预测与算术编码,通过混合重建/生成方案及李雅普诺夫算法优化,实现优于基线的超低比特率语义通信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27885 2026-08-31 cs.LG 新提交 50%

There and Back Again: Bidirectional Diffusion Bridges for Multimodality Translation

双向扩散桥用于多模态转换:往返之道

Gabe Guo, Elon Litman, Thanawat Sornwanee, Jose Blanchet, Stefano Ermon

机构 * Stanford University(斯坦福大学)

专题命中 多模态生成 :image-text(abstract)

AI总结 针对现有多模态转换方法的不足,提出BIT双向图像-文本扩散桥,实现双向生成且性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 10 篇

2608.27461 2026-08-31 cs.CL cs.AI cs.LG 新提交 86%

SciReC: Diagnostic Evaluation of Multimodal, Multi-Turn Relational Reasoning with Adaptive Interaction

SciReC:基于自适应交互的多模态多轮关系推理诊断评估

Nilay Yilmaz, Naga Sai Abhiram Kusumba, Stella Wenxing Liu, Yezhou Yang

机构 * Arizona State University(亚利桑那州立大学) Capital One(第一资本金融公司)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究构建了多模态学术对话基准SciReC,提出缺陷诊断框架DMRA评估多模态大语言模型的关系推理能力,发现不同模型在各类关系及领域上的表现差异,明确错误的主要来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28062 2026-08-31 cs.AI 新提交 85%

WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents

WeAgent-MMSearch:面向多模态搜索智能体的原生文本-视觉交互

Zongkai Liu, Hui Zhang, Liqiang Niu, Zhen Cao, Han Li, Juntao Liu, Wenchao Chen, Chengduo Zhao, Chao Yu, Fandong Meng

机构 * Weixin AI, Tencent(腾讯微信人工智能) Sun Yat-sen University(中山大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对现有多模态搜索智能体忽略图像、长程交互易失败的问题,提出 WeAgent-MMSearch 系统,通过 WeAgent-Harness 实现文本-视觉交互,经 FA-GSPO 后训练后,模型在多模态搜索基准上性能大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27869 2026-08-31 cs.AI 新提交 83%

See, Hypothesize, Validate: Multimodal Agentic Framework for Discovering Governing PDEs

观测、假设、验证:用于发现控制偏微分方程的多模态智能体框架

Sarang Manoj Pekhale, Amartya Roy, Rajat Sarkar, Souvik Chakraborty

机构 * Indian Institute of Technology Delhi(印度德里理工学院) Robert Bosch GmbH(罗伯特·博世有限公司) TCS Research(塔塔咨询服务公司研究院) Yardi School of Artificial Intelligence (ScAI)(亚迪人工智能学院) Department of Applied Mechanics(应用力学系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 提出多模态智能体框架MAGE,通过四个专业化智能体协作迭代发现控制PDE,在经典PDE套件等测试中实现优异恢复与误差表现,支持无库控制定律发现的结构化智能体推理研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28503 2026-08-31 cs.IR 新提交 82%

SG-UMP: Sequence-Guided Universal Multimodal Prioritization Calculation Framework

SG-UMP:序列引导通用多模态优先级计算框架

Xinyi Zhang, Yutong Li, Peijie Sun

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 针对多模态序列推荐中用户偏好异质性与数据集模态偏差问题,提出即插即用的SG-UMP框架,通过模块组合器与模块路由器适配不同场景,在四个数据集上持续提升推荐性能。

Comments Accepted as a Full Paper at MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28341 2026-08-31 cs.CV cs.AI 新提交 81%

Cross-Spectral Dense Correspondence for Multimodal Spectral Medical Imaging

用于多模态光谱医学成像的跨光谱密集对应

Eric L. Wisotzky, Jost Triller, Simon W. Härtl, Oliver T. Bruns, Peter Eisert, Anna Hilsmann

机构 * Fraunhofer Heinrich Hertz Institute HHI(弗劳恩霍夫海因里希·赫兹研究所) Humboldt University Berlin(柏林洪堡大学) National Center for Tumordiseases(德国肿瘤疾病中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态光谱医学成像中跨光谱密集对应数据不足的问题,提出跨光谱调制协议与合成基准,提升模型在光谱不匹配场景下的性能,支撑高光谱成像的空间一致融合。

Comments Accepted at 2nd Data Curation & Augmentation in Medical Imaging Workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28384 2026-08-31 cs.AI 新提交 79%

MAP: A Benchmark on Multimodal Accessibility Planning for Real World Places

MAP:面向现实场所的多模态可访问性规划基准

Jason Armitage, Ioannis Tsochantaridis, Linda Mazzone, Chuqiao Yan, Srini Narayanan, Sarah Ebling

机构 * University of Zurich(苏黎世大学) Google DeepMind(谷歌DeepMind)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 研究推出首个多模态可访问性规划基准MAP,含声明验证与视觉证据检索两项评估,支持动态信息下的AI系统对比,为服务可访问性需求用户的多模态AI提供评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27795 2026-08-31 cs.CV 新提交 79%

uScenes: A Multimodal RGB and 3D Sonar Dataset for Underwater Robot Perception

uScenes:用于水下机器人感知的多模态RGB与3D声呐数据集

Trung Tien Dong, Zhenqi Wu, Aditya Penumarti, Zi-Hao Zhang, Micaiah Bartlett, Jane Shin, Xiaomin Lin

机构 * University of South Florida(南佛罗里达大学) University of Florida(佛罗里达大学) Seoul National University(首尔大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对水下机器人感知难题,构建了含同步3D多波束声呐点云与RGB图像的uScenes多模态数据集,为水下传感器融合等任务提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27548 2026-08-31 cs.AI 新提交 79%

Nemotron 3.5 Content Safety Moderator: A Compact Multimodal, Multilingual, and Reasoning Enabled Content Safety Moderator

Nemotron 3.5 内容安全审核器:一款紧凑的多模态、多语言且具备推理能力的内容安全审核器

Varun Singh, Anuj Doshi, Makesh Narsimhan Sreedhar, Shaona Ghosh, Katherine Luna

机构 * NVIDIA(英伟达)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究提出紧凑多模态多语言的Nemotron 3.5 CS安全审核器,兼具低计算成本与推理能力,可覆盖多场景安全审核,还发布配套安全数据集,验证其在多维度评估中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27477 2026-08-31 cs.AI cs.CV 新提交 62%

Benchmarking General Mobile Assistants in Challenging Real-World Scenarios

在具有挑战性的真实场景中对通用移动助手进行基准测试

Yiqi Zhu, Feiyu Gao, Jiaxing Fan, Jiahui Zeng, Minggang Wu, Chenliang Li, Haiyang Xu, Peng Li, Ming Yan, Yang Liu

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出名为GMA的移动助手基准,涵盖七个应用与300个不同难度任务,评估八个前沿模型发现其性能随任务复杂度提升而下降,还证实合适的智能体控制设计可显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28339 2026-08-31 cs.CV 新提交 57%

Abstract4D: A Large-Scale Dataset and Framework for Understanding the Visual Language of Abstract Art

Abstract4D:用于理解抽象艺术视觉语言的大规模数据集与框架

Haowei Zhang, Yuanpei Zhao, Ji-Zhe Zhou, Mao Li

机构 * College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 该研究推出Abstract4D数据集,通过人机混合注释流程构建超12万张抽象绘画数据,开展语义结构分析并建立基准任务,助力评估AI对抽象艺术视觉语言的表征与解读能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态Agent 5 篇

2608.28266 2026-08-31 cs.RO 新提交 80%

CoCoBench: A Cooperative Coordination Benchmark for Embodied Multi-Agent Task Planning

CoCoBench:用于具身多智能体任务规划的协作协调基准

Yang Chen, Ye-Xin Xie, Lirong Che, Danyang Peng, Yuzhe Yang, Peiwen Lin, Xu Cao, Chuang Wang, Lei Yuan, Jian Su, Lan-Zhe Guo

机构 * Nanjing University(南京大学) AgiBot Tsinghua University(清华大学)

专题命中 多模态Agent :MLLM(summary_cn,abstract_cn);multimodal(abstract)

AI总结 研究人员提出CoCoBench这一家庭任务多智能体具身协调基准,评估11种MLLM后发现协调能力具构造特异性,为相关模型设计提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏