arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-04 至 2026-03-04 共收录 88 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 6 篇

2507.16733 2026-03-04 eess.SP 50%

Generative Diffusion Models for Wireless Networks: Fundamental, Architecture, and State-of-the-Art

生成扩散模型用于无线网络:基础、架构与最新进展

Dayu Fan, Rui Meng, Xiaodong Xu, Yiming Liu, Guoshun Nan, Chenyuan Feng, Shujun Han, Song Gao, Bingxuan Xu, Dusit Niyato, Tony Q. S. Quek, Ping Zhang

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文综述了生成扩散模型在无线网络中的应用,分析了其在感知、传输和应用领域的技术演进,探讨了核心挑战与潜在解决方案。

Comments 46 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 20 篇

2603.02482 2026-03-04 cs.LG cs.CL cs.CV cs.SD eess.AS 85%

MUSE: A Run-Centric Platform for Multimodal Unified Safety Evaluation of Large Language Models

MUSE:一种面向多模态统一安全评估的运行导向平台

Zhongxi Wang, Yueqian Lin, Jingyang Zhang, Hai Helen Li, Yiran Chen

机构 * Duke University(杜克大学) Virtue AI

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、eess.AS

AI总结 MUSE提出一种多模态统一安全评估平台,通过多轮攻击和跨轮模态切换技术,评估大型语言模型在不同模态下的安全性能。

Comments Submitted to ACL 2026 System Demonstration Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03101 2026-03-04 cs.LG cs.AI cs.CV 84%

ALARM: Automated MLLM-Based Anomaly Detection in Complex-EnviRonment Monitoring with Uncertainty Quantification

ALARM: 基于多模态大语言模型的复杂环境监控异常检测与不确定性量化

Congjing Zhang, Feng Lin, Xinyi Zhao, Pei Guo, Wei Li, Lin Chen, Chaoyue Zhao, Shuai Huang

机构 * Department of Industrial and Systems Engineering, University of Washington(华盛顿大学工业与系统工程系) Wyze Labs, Inc.(Wyze实验室)

专题命中 多模态评测 :MLLM(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 ALARM通过结合不确定性量化与多模态大语言模型,实现了复杂环境中的异常检测,展现出在不同领域中的高准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07218 2026-03-04 cs.LG cs.AI cs.CV 84%

Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward

Perception-R1: 通过视觉感知奖励提升多模态大语言模型的多模态推理能力

Tong Xiao, Xin Xu, Zhenya Huang, Hongyu Gao, Quan Liu, Qi Liu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) iFLYTEK AI Research(iFLYTEK人工智能研究院) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 Perception-R1通过引入视觉感知奖励提升多模态大语言模型的多模态推理能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03241 2026-03-04 cs.CV cs.AI 81%

UniG2U-Bench: Do Unified Models Advance Multimodal Understanding?

UniG2U-Bench: 统一模型是否能提升多模态理解?

Zimo Wen, Boxiu Li, Wanbo Zhang, Junxiang Lei, Xiaoyu Chen, Yijia Fan, Qi Zhang, Yujiang Wang, Lili Qiu, Bo Li, Ziwei Liu, Caihua Shan, Yifan Yang, Yifei Shen

机构 * Microsoft Research Asia(微软亚洲研究院) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) University of Oxford(牛津大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 UniG2U-Bench通过系统评估生成到理解的任务,揭示统一模型在多模态理解中的局限性和改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.13139 2026-03-04 cs.CV cs.CL 81%

Multimodal Integration of Human-Like Attention in Visual Question Answering

多模态人类样注意机制在视觉问答中的整合

Ekta Sood, Fabian Kögel, Philipp Müller, Dominike Thomas, Mihai Bace, Andreas Bulling

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 MULAN通过整合文本和图像显著性模型的注意预测,提升了VQA模型的性能,同时减少参数数量,达到新的准确率水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.13116 2026-03-04 cs.CV cs.CL 81%

VQA-MHUG: A Gaze Dataset to Study Multimodal Neural Attention in Visual Question Answering

VQA-MHUG:一个用于研究视觉问答中多模态神经注意机制的注视数据集

Ekta Sood, Fabian Kögel, Florian Strohm, Prajit Dhar, Andreas Bulling

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 VQA-MHUG数据集用于研究视觉问答中多模态神经注意机制,发现文本注意与模型性能的相关性是提升VQA性能的关键因素。

Comments CoNLL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02866 2026-03-04 cs.CV 79%

Multimodal-Prior-Guided Importance Sampling for Hierarchical Gaussian Splatting in Sparse-View Novel View Synthesis

多模态先验引导的重要性采样用于稀疏视图新视图合成中的分层高斯点云

Kaiqiang Xiong, Zhanke Wang, Ronggang Wang

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东超高清沉浸媒体技术重点实验室) Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Peng Cheng Laboratory(鹏城实验室) Migu Culture Technology Co., Ltd.(米果文化科技有限公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出多模态先验引导的重要性采样方法,用于稀疏视图新视图合成中的分层高斯点云,通过融合光度残差、语义和几何先验,提升重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02754 2026-03-04 cs.CV 79%

Seeing Clearly without Training: Mitigating Hallucinations in Multimodal LLMs for Remote Sensing

无需训练即可清晰感知:减轻多模态大语言模型在遥感中的幻觉

Yi Liu, Jing Zhang, Di Wang, Xiaoyu Tian, Haonan Guo, Bo Du

机构 * School of Computer Science, Wuhan University, China(武汉大学计算机学院) Zhongguancun Academy, China(中关村学院) School of Computer Science, Chongqing University, China(重庆大学计算机学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 RADAR通过利用多模态大语言模型的内在注意力,无需训练即可减少遥感视觉问答中的事实性和逻辑性幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00931 2026-03-04 cs.CV 79%

Learning to Weigh Waste: A Physics-Informed Multimodal Fusion Framework and Large-Scale Dataset for Commercial and Industrial Applications

学习称重垃圾:一种融合多模态的物理引导框架和大规模数据集用于商业和工业应用

Md. Adnanul Islam, Wasimul Karim, Md Mahbub Alam, Subhey Sadi Rahman, Md. Abdur Rahman, Arefin Ittesafun Abian, Mohaimenul Azam Khan Raiaan, Kheng Cher Yeo, Deepika Mathur, Sami Azam

机构 * Department of Computer Science and Engineering, United International University(计算机科学与工程系,国际大学) Applied Artificial Intelligence and Intelligent Systems (AAIINS) Laboratory(应用人工智能与智能系统实验室) Department of Data Science and Artificial Intelligence, Monash University(数据科学与人工智能系,墨尔本大学) Faculty of Science and Technology, Charles Darwin University(科学与技术学院,查尔斯达尔文大学) Faculty of Arts and Society, Charles Darwin University(艺术与社会学院,查尔斯达尔文大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种融合多模态的物理引导框架和大规模数据集,用于准确估计商业和工业垃圾的重量,通过结合视觉和物理信息提升预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18264 2026-03-04 cs.CV 79%

MMTok: Multimodal Coverage Maximization for Efficient Inference of VLMs

MMTok: 为VLMs高效推理的多模态覆盖最大化

Sixun Dong, Juhua Hu, Mian Zhang, Ming Yin, Yanjie Fu, Qi Qian

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MMTok通过多模态覆盖准则提升VLMs推理效率,结合视觉和文本信息优化标记选择,实现性能与速度的平衡。

Comments Accepted by ICLR 2026. Code: https://github.com/Ironieser/mmtok , Project Homepage: https://project.ironieser.cc/mmtok

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19373 2026-03-04 cs.CR cs.AI 79%

Doxing via the Lens: Revealing Location-related Privacy Leakage on Multi-modal Large Reasoning Models

通过镜头进行Doxing:揭示多模态大推理模型中的位置相关隐私泄露

Weidi Luo, Tianyu Lu, Qiming Zhang, Xiaogeng Liu, Bin Hu, Yue Zhao, Jieyu Zhao, Song Gao, Patrick McDaniel, Zhen Xiang, Chaowei Xiao

机构 * University of Georgia(佐治亚大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) John Hopkins University(约翰·霍普金斯大学) University of Southern California(南加州大学) University of Maryland, College Park(马里兰大学学院市分校)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文研究了多模态大推理模型中的位置隐私泄露问题,提出DoxBench和GeoMiner框架,揭示模型在推断地理位置信息上的能力及隐私风险。

Comments Camera-ready version. Accepted as a poster at the 14th International Conference on Learning Representations (ICLR 2026). For official ICLR page, see https://iclr.cc/virtual/2026/poster/10006914

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17623 2026-03-04 cs.MM cs.CV 73%

Synthetic Perception: Can Generated Images Unlock Latent Visual Prior for Text-Centric Reasoning?

合成感知:生成图像能否解锁潜在的视觉先验以用于以文本为中心的推理?

Yuesheng Huang, Peng Zhang, Xiaoxin Wu, Riliang Liu, Jiaqi Liang

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文探讨生成图像能否解锁潜在视觉先验以提升文本中心推理,通过多模态融合架构和提示工程策略实现性能提升。

Comments Accepted as a poster at the International Conference on Machine Learning (ICML 2025) NewInML Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19517 2026-03-04 cs.AI cs.CE cs.CL cs.CV 67%

Classroom Final Exam: An Instructor-Tested Reasoning Benchmark

教室期末考试:一个由教师测试的推理基准

Chongyang Gao, Diji Yang, Shuyan Zhou, Xichen Yan, Luchuan Song, Shuo Li, Kezhen Chen

机构 * Northwestern University(西北大学) UC Santa Cruz(加州大学圣克鲁兹分校) Duke University(杜克大学) University of Birmingham(伯明翰大学) University of Rochester(罗切斯特大学) Analogy AI, Inc.(Analogy AI 公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 CFE-Bench是一个由教师测试的多模态推理基准,用于评估大语言模型在STEM领域中的推理能力,发现前沿模型在多步骤解决方案中存在中间状态推导和保持的困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03002 2026-03-04 cs.AI 57%

SpatialText: A Pure-Text Cognitive Benchmark for Spatial Understanding in Large Language Models

SpatialText: 一种纯文本的认知基准,用于大型语言模型中的空间理解

Peiyao Jiang, Zequn Qin, Xi Li

机构 * Zhejiang University(浙江大学) School of Software Technology, Zhejiang University(软件技术学院,浙江大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 SpatialText通过双源方法为大型语言模型提供纯文本空间认知基准,揭示其在空间推理中的系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14197 2026-03-04 cs.CV 57%

Online Data Curation for Object Detection via Marginal Contributions to Dataset-level Average Precision

在线数据整理用于目标检测:通过数据集层面平均精度的边际贡献

Zitang Sun, Masakazu Yoshimura, Junji Otsuka, Atsushi Irie, Takeshi Ohashi

机构 * Sony Group Corporation(索尼集团)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 DetGain是一种针对目标检测的在线数据整理方法,通过估计图像对数据集层面平均精度的边际影响,提升检测性能并增强鲁棒性。

Comments preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16654 2026-03-04 cs.CV 57%

Are VLMs Ready for Lane Topology Awareness in Autonomous Driving?

视觉-语言模型是否准备好在自动驾驶中具备车道拓扑意识?

Xin Chen, Jia He, Maozheng Li, Dongliang Xu, Tianyu Wang, Yixiao Chen, Zhixin Lin, Yue Yao

机构 * Shandong University(山东大学) MBZUAI Sems

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文评估了VLMs在自动驾驶中理解道路拓扑结构的能力,发现尽管闭源模型在部分任务表现良好,但空间推理仍是其主要瓶颈,且模型规模和推理令牌数量对性能有显著影响。

Comments 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00447 2026-03-04 cs.AI 57%

The MERIT Dataset: Modelling and Efficiently Rendering Interpretable Transcripts

MERIT数据集:模型与高效可解释 transcripts 的渲染

I. de Rodrigo, A. Sanchez-Cuadrado, J. Boal, A. J. Lopez-Lopez

机构 * Institute for Research in Technology, ICAI School of Engineering, Comillas Pontifical University(技术研究 institute,ICAI 工程学院,科利马天主教大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 MERIT数据集通过多模态信息和偏见控制,为训练视觉丰富文档理解模型提供挑战性资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05594 2026-03-04 cs.CR 50%

Deep Learning for Contextualized NetFlow-Based Network Intrusion Detection: Methods, Data, Evaluation and Deployment

基于上下文的深度学习网络入侵检测:方法、数据、评估与部署

Abdelkader El Mahdaouy, Issam Ait Yahia, Soufiane Oualil, Ismail Berrada

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出基于上下文的深度学习方法,用于改进网络入侵检测,强调评估和部署的现实性,探讨上下文对检测效果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02535 2026-03-04 cs.HC 50%

Understanding the Effects of Interaction on Emotional Experiences in VR

理解交互对虚拟现实中情感体验的影响

Zheyuan Kuang, Tinghui Li, Weiwei Jiang, Sven Mayer, Flora Salim, Benjamin Tag, Anusha Withana, Zhanna Sarsenbayeva

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文通过扩展VR情绪激发数据集,探讨交互对情感体验的影响,发现交互可增强情绪并调节其在不同情境中的表现。

Comments 20 pages, 17 figures, to be published in the Proceedings of the 2026 ACM CHI Conference on Human Factors in Computing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16858 2026-03-04 cs.RO 50%

Towards an Adaptive Social Game-Playing Robot: An Offline Reinforcement Learning-Based Framework

迈向自适应社交游戏机器人:一种基于离线强化学习的框架

Soon Jynn Chu, Raju Gottumukkala, Alan Barhorst

机构 * Department of Mechanical Engineering, University of Louisiana at Lafayette(路易斯安那州立大学拉法叶分校机械工程系)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出了一种基于离线强化学习的自适应社交游戏机器人框架,通过整合多模态情绪识别与自适应响应,提升机器人在游戏场景中对用户情绪的适应能力。

Comments Submitted to conference

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 13 篇

2603.02888 2026-03-04 cs.CV 79%

LLandMark: A Multi-Agent Framework for Landmark-Aware Multimodal Interactive Video Retrieval

LLandMark:一种用于地标感知多模态交互视频检索的多智能体框架

Minh-Chi Phung, Thien-Bao Le, Cam-Tu Tran-Thi, Thu-Dieu Nguyen-Thi, Vu-Hung Dao

机构 * AI VIETNAM(AI越南)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 LLandMark通过多智能体框架实现地标感知的多模态视频检索,结合LLM和OCR技术提升文化场景下的检索能力与可解释性。

Comments Accepted by AAAI 2026 Workshop on New Frontiers in Information Retrieval

Journal ref AAAI 2026 Workshop on New Frontiers in Information Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02626 2026-03-04 cs.AI 79%

See and Remember: A Multimodal Agent for Web Traversal

见与忆:一种用于网页浏览的多模态代理

Xinjun Wang, Shengyao Wang, Aimin Zhou, Hao Hao

机构 * Shanghai Institute of AI for Education(上海人工智能教育研究院) East China Normal University(华东师范大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 V-GEMS通过视觉 grounding 和显式记忆系统实现精确稳健的网页浏览,实验显示其在导航任务中性能提升28.7%

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02519 2026-03-04 cs.MM cs.IR 79%

Agentic Mixed-Source Multi-Modal Misinformation Detection with Adaptive Test-Time Scaling

具有自适应测试时间缩放的代理混合源多模态虚假信息检测

Wei Jiang, Tong Chen, Wei Yuan, Quoc Viet Hung Nguyen, Hongzhi Yin

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.MM

AI总结 AgentM3D通过自适应测试时间缩放和多代理框架提升零样本多模态虚假信息检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20346 2026-03-04 cs.CR cs.AI cs.LG 79%

Multimodal Multi-Agent Ransomware Analysis Using AutoGen

基于AutoGen的多模态多智能体勒索软件分析

Asifullah Khan, Aimen Wadood, Mubashar Iqbal, Umme Zahoora

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出基于AutoGen的多模态多智能体框架,通过融合静态、动态和网络信息,提升勒索软件分类的准确性和稳定性。

Comments 46 pages, 11 figures and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02635 2026-03-04 cs.LG 78%

SaFeR-ToolKit: Structured Reasoning via Virtual Tool Calling for Multimodal Safety

SaFeR-ToolKit: 通过虚拟工具调用实现多模态安全的结构化推理

Zixuan Xu, Tiancheng He, Huahui Yi, Kun Wang, Xi Chen, Gongli Xi, Qiankun Li, Kang Li, Yang Liu, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) West China Hospital, Sichuan University(四川大学华西医院) Nanyang Technological University(南洋理工大学)

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 SaFeR-ToolKit通过虚拟工具调用实现多模态安全的结构化推理,提升安全性、帮助性和推理严谨性,同时保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02503 2026-03-04 eess.SY cs.SY 78%

Joint Estimation of Dynamic O-D Demand and Choice Models for Dynamic Multi-modal Networks: Computational Graph-Based Learning and Hypothesis Tests

动态多模式网络中动态O-D需求与选择模型的联合估计:基于计算图的学习与假设检验

Xiaoyu Ma, Sean Qian

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 本研究提出基于计算图的学习方法,联合估计多模式网络中动态O-D需求与选择模型,通过假设检验框架提升模型的统计显著性分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02366 2026-03-04 cs.HC cs.AI 74%

PlayWrite: A Multimodal System for AI Supported Narrative Co-Authoring Through Play in XR

PlayWrite: 一种通过XR中的游戏化互动实现AI支持的叙事协作写作的多模态系统

Esen K. Tütüncü, Qian Zhou, Frederik Brudy, George Fitzmaurice, Fraser Anderson

机构 * Institute of Neurosciences of the University of Barcelona(巴塞罗那大学神经科学研究所) Autodesk Research(Autodesk研究)

专题命中 多模态Agent :multimodal(title);分类 cs.AI

AI总结 PlayWrite是一种通过XR中的游戏化互动实现AI支持的叙事协作写作的多模态系统,通过直接操控虚拟角色和道具,结合多智能体AI管道和大型语言模型,促进高度即兴和游戏化的创作过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03198 2026-03-04 cs.RO cs.CL cs.CV 73%

ACE-Brain-0: Spatial Intelligence as a Shared Scaffold for Universal Embodiments

ACE-Brain-0:空间智能作为通用具身化体系的共享框架

Ziyang Gong, Zehang Luo, Anke Tang, Zhe Liu, Shi Fu, Zhi Hou, Ganlin Yang, Weiyun Wang, Xiaofeng Wang, Jianbo Liu, Gen Luo, Haolan Kang, Shuang Luo, Yue Zhou, Yong Luo, Li Shen, Xiaosong Jia, Yao Mu, Xue Yang, Chunxiao Liu, Junchi Yan, Hengshuang Zhao, Dacheng Tao, Xiaogang Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) University of Science(科学技术大学) Fudan University(复旦大学) Xiamen University(厦门大学) East China Normal University(华东师范大学) Wuhan University(武汉大学) Sun Yat-sen University(中山大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 ACE-Brain-0 通过空间智能作为共享框架,统一了自动驾驶、机器人和 UAVs 的具身化任务,采用 SSR 范式和 GRPO 方法实现跨领域泛化和领域精通的平衡。

Comments Code: https://github.com/ACE-BRAIN-Team/ACE-Brain-0 Hugging Face: https://huggingface.co/ACE-Brain/ACE-Brain-0-8B

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23141 2026-03-04 cs.CV 57%

Earth-Agent: Unlocking the Full Landscape of Earth Observation with Agents

Earth-Agent: 解锁地球观测的全貌与潜力

Peilin Feng, Zhutao Lv, Junyan Ye, Xiaolei Wang, Xinjie Huo, Jinhua Yu, Wanghan Xu, Wenlong Zhang, Lei Bai, Conghui He, Weijia Li

专题命中 多模态Agent :cross-modal(abstract);分类 cs.CV

AI总结 Earth-Agent是一种结合RGB和光谱数据的代理框架,通过多模态工具生态系统实现跨模态、多步骤推理,提升地球观测分析的科学性和应用潜力。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏