arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2807 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2807 篇

2608.11458 2026-08-13 cs.CV 新提交 57%

Multi-Agent Target-Existence Verification and Learned Mask Geometry Refinement: Winning Report of the MeViS-Text Track at the 8th LSVOS Challenge 2026

多智能体目标存在性验证与学习型掩码几何优化:2026年第8届LSVOS挑战赛MeViS-Text赛道获胜报告

Jungyoon Lee, Gyuil Lim, Doeon Kim, Seong-heum Kim

机构 * Soongsil University(崇实大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本研究提出SSUPER方案,通过多智能体审计解耦存在性验证、StyleRefiner优化掩码几何,获2026年LSVOS挑战赛MeViS-Text赛道冠军,最终得分0.9081339614。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10976 2026-08-12 cs.AI 新提交 57%

XCoT-VLA: Executable Chain-of-Thought for Vision-Language-Action Driving

XCoT-VLA:面向视觉-语言-动作自动驾驶的可执行思维链

Foundation Model Team, XPeng Inc

机构 * XPeng Inc(小鹏汽车)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 该研究提出XCoT-VLA,用可执行CoT令牌替代自然语言CoT,结合Reason FFN与Control FFN实现轨迹生成,在自动驾驶任务中降低了误差并满足实时规划要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23399 2026-08-12 cs.AI 版本更新 57%

GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning

GAM-Agent:面向复杂视觉推理的博弈论与感知不确定性感知协作框架

Jusheng Zhang, Yijia Fan, Wenjun Lin, Ruiqi Chen, Haoyi Jiang, Wenhao Chai, Jian Wang, Keze Wang

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 该研究提出GAM-Agent博弈论多智能体框架,通过基础感知智能体与关键验证智能体的非零和博弈及不确定性感知协作,在四个视觉推理基准上显著提升了中小及强规模VLM的性能,为可靠可解释多模态推理提供了新路径。

Comments Accepted at NeurIPS 2025. Code available at https://github.com/jushengzhang/Gam-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09876 2026-08-11 cs.RO cs.AI 新提交 57%

Energy-Structured Latent World Models with Neural Time Fields for Physically Constistent Open-World Motion Planning

用于物理一致性开放世界运动规划的能量结构化潜在世界模型与神经时间场

Yapeng Liu, Yuanzhao Zhai, Bo Ding, Huaimin Wang, Lin Wang

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 针对开放世界运动规划的物理一致性挑战,提出能量结构化潜在世界模型ELWM,结合物理条件神经时间场PC-NTF,显著提升了运动预测精度与导航成功率,降低了碰撞率与残差。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08960 2026-08-11 cs.AI 新提交 57%

Reading is not Reasoning: Bridging the Agentic Policy Gap in Vision-Text Compression

阅读并非推理:弥合视觉-文本压缩中的智能体策略差距

Cheng Fan, Junyi Zhou, Tingzhang Luo, RongJian Xu, Qiyanhui Lu, Mingjian Zhu, Hanting Chen, Jianyuan Guo

专题命中 多模态Agent :cross-modal(abstract);分类 cs.AI

AI总结 该研究针对视觉-文本压缩导致的智能体策略差距,提出CAPS跨模态智能体策略自蒸馏框架,在SearchQA、ALFWorld等数据集上显著提升性能并大幅降低上下文成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07959 2026-08-11 cs.AI 新提交 57%

SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning

SCOUT:面向超长时长自我中心视频推理的自检查与恢复感知工具思维智能体

Keyang Zhong, Kuo Wang, Peng Liu, Quanlong Zheng, Junlin Xie, Zhijia Liang, Yanhao Zhang, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Shenzhen Loop Area Institute(深圳河套学院) Guangdong OPPO Mobile Telecommunications Corp., Ltd.(广东欧珀移动通信有限公司) OPPO AI Center(OPPO人工智能中心) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本研究提出SCOUT智能体框架,结合自适应策略与UPS-GRPO方法,解决超长自我中心视频推理的错误传播及信用分配问题,在对应基准上达最优性能且短时长场景仍具竞争力。

Comments Accepted by ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07955 2026-08-11 cs.AI 新提交 57%

Self-Evolving Neuro-Symbolic Skills for Tool-Augmented Spatial Reasoning

面向工具增强空间推理的自演化神经符号技能

Shi-Yu Tian, Zhuo-Xia Wang, Xuan-Yi Zhu, Zhi Zhou, Xinwei Yang, Kun-Yang Yu, Ming Yang, Yang Chen, Yu-Feng Li

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 该研究针对视觉-语言模型在细粒度空间任务上的不可靠问题,提出神经符号框架NeSy-Spatial,通过自演化空间技能提升工具利用精度与空间推理准确率。

Comments 25 pages, 9 figures, 10 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21165 2026-08-11 cs.RO cs.AI 版本更新 57%

OmniV2X: A Generative Foundation Planner for Efficient End-to-End Cooperative Driving

OmniV2X:一种用于高效端到端协同驾驶的生成式基础规划器

Juntong Peng, Juanwu Lu, Yupeng Zhou, Can Cui, Yaobin Chen, Ziran Wang

机构 * Purdue University(普渡大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 提出OmniV2X生成式基础模型,通过端到端监督训练和交叉注意力注入,利用多模态多智能体上下文实现高效协同驾驶,在DAIR-V2X-Seq数据集上以少于10%微调数据和1%通信带宽达到最优性能。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26041 2026-08-11 cs.CV 版本更新 57%

Where and How to Prune: An Empirical Study of Visual Token Pruning for GUI Agent Navigation

重新思考GUI视觉代理中历史截图的标记剪枝:语义、空间和时间视角

Daiqiang Li, Zihao Pan, Zeyu Zhang, Xuyang Liu, Shijia Xu, Ronghao Chen, Huacan Wang, Honggang Chen, Linfeng Zhang, Zhangquan Chen, Haiyun Jiang

机构 * Sichuan University(四川大学) Sun Yat-sen University(中山大学) Australian National University(澳大利亚国立大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态Agent :MLLM(abstract_cn);分类 cs.CV

AI总结 本文从语义、空间和时间角度研究GUI视觉代理中历史截图的标记剪枝,发现背景区域对界面状态转换有重要价值,随机剪枝在空间结构保留上更有效,且GUI代理具有近期效应,通过分配更多预算给近期截图可降低计算成本而不影响性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11741 2026-08-11 cs.AI 版本更新 57%

Collaborative Multi-Agent Scripts Generation for Enhancing Imperfect-Information Reasoning in Murder Mystery Games

协作多智能体脚本生成以增强谋杀谜游戏中的不完全信息推理

Keyang Zhong, Junlin Xie, Hefeng Wu, Haofeng Li, Guanbin Li

机构 * Sun Yat-sen University(中山大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出协作多智能体框架,通过生成丰富多模态上下文提升VLMs在叙事推理和欺骗鲁棒性中的表现,解决多玩家游戏中不完全信息下的复杂推理问题。

Comments 9 pages, 5 figures, Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11868 2026-08-11 cs.CY cs.AI 版本更新 57%

Ethical Framework for Responsible Foundational Models in Medical Imaging

医学影像领域负责任基础模型的伦理框架

Debesh Jha, Gorkem Durak, Abhijit Das, Jasmer Sanjotra, Onkar Susladkar, Suramyaa Sarkar, Ashish Rauniyar, Nikhil Kumar Tomar, Linkai Peng, Sirui Li, Koushik Biswas, Ertugrul Aktas, Elif Keles, Matthew Antalek, Zheyuan Zhang, Bin Wang, Xin Zhu, Hongyi Pan, Deniz Seyithanoglu, Alpay Medetalibeyoglu, Vanshali Sharma, Vedat Cicek, Amir A. Rahsepar, Rutger Hendrix, A. Enis Cetin, Bulent Aydogan, Mohamed Abazeed, Frank H. Miller, Rajesh N. Keswani, Hatice Savas, Sachin Jambawalikar, Daniela P. Ladner, Amir A. Borhani, Concetto Spampinato, Michael B. Wallace, Ulas Bagci

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本研究针对医学影像领域基础模型整合临床实践时的隐私、偏差、可解释性等伦理挑战,提出含隐私保护、偏差应对、人类监督的伦理框架,以平衡创新与医学伦理原则。

Journal ref https://www.frontiersin.org/journals/medicine/articles/10.3389/fmed.2025.1544501/full

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07214 2026-08-10 cs.DB cs.AI cs.SY eess.SY 新提交 57%

Toward a Causal Data Management Ecosystem for Decision Making and Agentic AI

面向决策与智能体AI的因果数据管理生态系统

Dazhuo Qiu, Yingli Zhou, Amedeo Pachera, Angela Bonifati, Andrea Mauri

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文针对AI生态系统决策混杂问题,提出构建共享可查询的因果世界系统(CWS),为面向决策与智能体AI的因果数据管理生态系统提供支持。

Comments Accepted at ACM AI Leadership Summit 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05587 2026-08-07 cs.AI 新提交 57%

StepReflect: Structured UI Transition Reflection for Mobile GUI Agents

StepReflect:面向移动GUI智能体的结构化UI过渡反射

Linqiang Guo, Wei Liu, Li Gu, Yang Wang, Tse-Hsun, Chen

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 针对移动GUI智能体长时序执行的动作反射需求,提出StepReflect模型,在离线和在线实验中均优于GPT-5.2相关方案,成本更低且可本地部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19880 2026-08-07 cs.RO cs.CV 版本更新 57%

EA-Nav: Learning Safe Visual Navigation Policies with Embodiment Awareness

EA-Nav:通过具身感知学习安全的视觉导航策略

Jialu Zhang, Yong Du, Xianda Guo, Shunwang Sun, Xinqi Liu, Yue Sun, Guodong Lu, Wei Sui, Jituo Li

机构 * Zhejiang University(浙江大学) Wuhan University(武汉大学) Hunan University(湖南大学) D-Robotics(D机器人公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 针对跨具身导航挑战,提出基于模仿学习的具身感知导航框架,通过模块化多阶段设计,预训练构建数据集并引入具身几何,微调设计多模态信息注入机制,有效提高不同具身设置下的导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04533 2026-08-06 cs.CV 新提交 57%

EgoAfford: Task-Oriented Affordance Grounding via Egocentric Referring Segmentation

EgoAfford:基于自我中心指称分割的面向任务的可供性定位

Xinyuan Guan, Feifan Chen, Xinyu Zhan, Fu-Cheng Zhang, Cewu Lu, Lixin Yang

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 针对部件级可供性定位难以适配复杂多步桌面任务的问题,提出基准EgoAfford及参考模型EgoLens,验证了下一步推理与动作角色条件部件定位的互补挑战,为感知与规划联合研究提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04530 2026-08-06 cs.CV 新提交 57%

FocusMem: Factorizing Content, Readout, and Trust in Latent GUI Memory

FocusMem:对潜在GUI记忆中的内容、读出和信任进行因子分解

Zhuoran Zhang, Bowen Li, Jingcheng Ju, Yang Shi, Qixun Wang, Haotian Wang, Wei Chen, Tengjiao Wang

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 FocusMem将潜在GUI记忆的内容、读出和信任因子分解,解决现有固定记忆方法的细节丢失、阶段适配差和误导问题,在五个GUI智能体基准测试中性能优于基线与现有方法。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06024 2026-08-06 q-bio.QM cs.AI 交叉投稿 57%

TourSynbio-Search: A Large Language Model Driven Agent Framework for Unified Search Method for Protein Engineering

TourSynbio-Search:一种用于蛋白质工程的统一搜索方法的大语言模型驱动智能体框架

Yungeng Liu, Zan Chen, Yu Guang Wang, Yiqing Shen

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 TourSynbio-Search是TourSynbio-7B驱动的双模块搜索智能体框架,可跨多平台检索文献与蛋白质数据,降低技术门槛,提升蛋白质工程研究的信息检索效率与生产力

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02643 2026-08-05 cs.SE cs.AI 新提交 57%

CUADebug: Diagnosing and Repairing Computer-Use Agent Failures

CUADebug:计算机使用智能体故障的诊断与修复

Weijia Zhang, Kunlun Zhu, Zeyi Liu, Yinting Chen, Tianyi Ma, Jiateng Liu, Jiaxun Zhang, Bingxuan Li, Xiangru Tang, Heng Ji, Jiaxuan You

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本研究提出CUADebug框架,含错误分类、CUAErrorBench基准与CUADebugger工具,可诊断修复计算机使用智能体故障,提升任务完成与重新执行成功率,证明其能提供可操作修复信号。

Comments 23 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02217 2026-08-04 cs.CV 新提交 57%

VC-Tooler: Learning Compositional and Adaptive Visual Tool Use

VC-Tooler:学习组合式与自适应视觉工具使用

Yizheng Wu, Jiashen Hua, Bing Deng, Jieping Ye

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 VC-Tooler是一种学习组合式与自适应视觉工具使用的模型,通过分层合成轨迹库与两阶段训练,在通用和具身基准上达到开源模型最优性能,且具良好迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00548 2026-08-04 cs.CV 新提交 57%

DrawAI: Agentic Benchmark and Workflow for Making Raster Images Editable

DrawAI:用于生成可编辑光栅图像的智能体基准与工作流

Pu Cao, Qingye Kong, Xuedan Yin, Xuekun Zhao, Rupeng Yan, Qing Song, Yao Zhang, Lu Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 DrawAI提出图像到可编辑重建任务,构建含DrawAI-Bench基准与DrawAI-Flow工作流的智能体方案,经实验验证DrawAI-Flow可提升可编辑结构,不同模型-harness配置的重建质量与成本差异显著。

Comments Project URL: https://drawai.renaissancemind.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00540 2026-08-04 cs.CV 新提交 57%

DiffuseAgent-MI: Distributionally-Grounded,Tool-Integrated Self-Evolving Agents for Faithful Visual Reasoning

DiffuseAgent-MI:用于忠实视觉推理的基于分布、集成工具的自进化智能体

An Lanji, Dawei Liu, Jin Li, Haoran Xu, Mei Chen, Yu Tian

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 DiffuseAgent-MI是基于分布、集成工具的自进化视觉推理智能体,通过KL最小能量模型与轨迹级验证器提升忠实性,在多数据集上准确率及相关指标表现优于现有模型。

Comments 11 pages, 9 figures, accepted by ICML 2026 manitrack

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00289 2026-08-04 cs.AI cs.HC cs.RO 新提交 57%

RF-HOI: Recognize Human-Object Interaction with Radio Frequency Signals

RF-HOI:利用射频信号识别人体-物体交互

Lihao Wang, Linlu Gao, Jiacan Yu, Yanyu Lin, Yifan Yin, Jianxin Wang, Tianmin Shu, Renjie Zhao

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 该研究针对视觉HOI识别的隐私与光照问题,提出仅用射频信号的RF-HOI框架,融合毫米波雷达与RFID,结合合成RF数据提升性能,效果优于基线且接近视觉模型。

Comments Accepted by ACM IMWUT

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28242 2026-07-31 cs.SE cs.AI cs.MA 新提交 57%

Agentic Metaverse Services: A New As-a-Service Paradigm

智能体元宇宙服务:一种新的即服务范式

Xiaofei Xu, Quan Z. Sheng, Zhongjie Wang, Boualem Benatallah, Xiao Wang, Ruipeng Han

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 该研究提出智能体元宇宙服务(AMServ)与元宇宙环境下的智能体即服务(Meta-AaaS)新范式,概述其特征、原理、应用实例,指出发展趋势,将推动AI时代新兴服务产业发展。

Comments 11 pages, 5 figures; Accepted at the 2026 IEEE International Conference on Web Services (ICWS 2026); Corresponding author: Prof. Xiaofei Xu

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28225 2026-07-31 cs.CV 新提交 57%

FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification

FaithEyes:通过多智能体过程图像验证实现可信的工具使用

Haoqing Wang, Xingrun Xing, Wei Xia, Ziheng Li, Yehui Tang

机构 * Samsung Research(三星研究院) Peking University(北京大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本研究提出多智能体框架FaithEyes,通过子智能体判断主智能体的工具调用以提升工具使用可信性,在视觉感知与推理基准上实现了更优准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26172 2026-07-31 cs.HC cs.AI cs.SI 版本更新 57%

Linking Heterogeneous Data with Coordinated Agent Flows for Social Media Analysis

通过协调智能体流关联异构数据以开展社交媒体分析

Shifu Chen, Dazhen Deng, Zhihong Xu, Sijia Xu, Linyu Qin, Tai-Quan Peng, Yingcai Wu

机构 * Zhejiang University(浙江大学) Department of Communication, Michigan State University(密歇根州立大学通讯系)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本研究提出LLM智能体系统SIA,通过协调智能体流关联社交媒体异构多模态数据,采用阶段同步策略挖掘洞见,经评估可发现多样有意义的洞见,为社交媒体分析提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24313 2026-07-28 cs.IR cs.CV cs.MA cs.RO 新提交 57%

Energy Constrained Hierarchical Underwater Monitoring via Local Multi-Agent RAG

通过局部多智能体RAG实现能量受限的分层水下监测

Mohamed Amine Janati, Laurent Gautier, Stéphane Barbot

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 针对海洋生物监测受能量等限制的问题,提出结合边缘传感与局部推理的低功耗水下监测架构,采用分层设计,利用特定嵌入、识别层及多智能体框架,经案例研究评估,实现低功耗连续传感与局部多模态智能结合,减少能耗与通信开销。

Comments Contains 25 pages, 11 figures. To be submitted to Elsevier Ocean Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24259 2026-07-28 cs.AI 新提交 57%

Generative Artificial Intelligence (GenAI) to convert images of queuing networks into verifiable simulation models: an open-weight LLM workflow approach

生成式人工智能(GenAI)将排队网络图像转换为可验证的仿真模型:一种开放权重的大语言模型工作流方法

Thomas Monks, Alison Harper, Amy Heather, Navonil Mustafee

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 研究提出Sketch2DES工作流,利用开放权重LLMs将排队网络图像转换为可验证仿真模型,经多阶段处理,在多图表评估中各阶段可靠性高,相比直接代码生成提升多项性能,证明结构化工作流模型生成对LLM辅助仿真建模的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24112 2026-07-28 cs.AI 新提交 57%

Scaling GUI Agents with Visual State Transitions

通过视觉状态转换扩展 GUI 智能体

Xiangyan Liu, Kaixin Li, Haonan Wang, Biao Wu, Meng Fang, Longxu Dou, Chao Du, Michael Qizhe Shieh, Tianyu Pang

机构 * NUS(新加坡国立大学) Sea AI Lab(Sea人工智能实验室) UTS(悉尼科技大学) University of Liverpool(利物浦大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 研究通过状态转换预训练扩展 GUI 智能体,联合优化逆动力学和正向动力学预训练统一多模态模型,在桌面和移动 GUI 场景基准测试中优于基线,联合动力学优化有稳定改进,下游性能随转换数据量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23910 2026-07-28 cs.CV cs.LG cs.MA cs.RO 新提交 57%

SimBEV2X: A Large-Scale Dataset and Data Generation Tool for Multi-Task Vehicle-to-Everything Cooperative Perception

SimBEV2X:用于多任务车联网协同感知的大规模数据集与数据生成工具

Goodarz Mehr, Sepideh Gohari, Montasir Abbas, Azim Eskandarian

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 研究针对V2X协同感知算法发展受限问题,介绍基于CARLA模拟器的SimBEV2X数据生成工具及数据集,通过它建立基线并提出CoBEVFusion架构,实现上下文感知多智能体特征聚合,性能优越。

Comments Submitted to IEEE for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23899 2026-07-28 cs.RO cs.AI 新提交 57%

Embodied GPT-5.1: Evidence of a World Model?

具身化GPT-5.1:世界模型的证据?

Roberto Spinelli, Thiago C. Martins

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 研究探索无实体化训练的GPT-5.1能否控制物理移动机器人,通过低分辨率图像和离散动作集执行任务。它展现出空间推理等新兴能力,但也有效率和感知局限。结果挑战传统观点,促使深入研究大语言模型中物理理解相关问题。

Comments 6 pages, 16 figures. Published in the 2026 Brazilian Conference on Robotics (CROS)

Journal ref R. Spinelli and T. C. Martins, "Embodied GPT-5.1: Evidence of a World Model?," 2026 Brazilian Conference on Robotics (CROS), pp. 394-399, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏