arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-30 至 2025-12-30 共收录 79 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 11 篇

2512.15560 2025-12-30 cs.CV 57%

GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models

GRAN-TED: 生成稳健、对齐且细腻的文本嵌入以用于扩散模型

Bozhou Li, Sihan Yang, Yushuo Guan, Ruichuan An, Xinlong Chen, Yang Shi, Pengfei Wan, Wentao Zhang, Yuanxing zhang

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Xi’an Jiaotong University(西安交通大学) School of Artificial Intelligence, UCAS(清华大学人工智能学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 GRAN-TED提出了一种生成稳健、对齐且细腻的文本嵌入以用于扩散模型的范式,通过TED-6K基准提升文本编码器性能,显著加快扩散模型训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05621 2025-12-30 cs.CV 57%

A Preliminary Study on GPT-Image Generation Model for Image Restoration

基于GPT图像生成模型的图像修复初步研究

Hao Yang, Yan Yang, Ruikun Zhang, Liyuan Pan

机构 * Beijing Institute of Technology(北京理工大学) Australian National University(澳大利亚国立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本研究探讨GPT图像生成模型在图像修复中的应用,发现其在感知上表现良好但缺乏像素级结构保真度,并展示其作为视觉先验提升修复质量的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22392 2025-12-30 cs.CV 57%

iOSPointMapper: RealTime Pedestrian and Accessibility Mapping with Mobile AI

iOSPointMapper: 基于移动AI的实时行人及可达性制图

Himanshu Naidu, Yuxiang Zhang, Sachin Mehta, Anat Caspi

机构 * University of Washington(华盛顿大学) Paul G. Allen School of Computer Science and Engineering(保罗·G·艾伦计算机科学与工程学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 iOSPointMapper通过移动AI实现实时人行道制图,结合语义分割、LiDAR和GPS数据,提供隐私保护的数据收集与多模式交通数据整合,提升行人基础设施的可达性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22279 2025-12-30 cs.LG cs.CE physics.app-ph 50%

Hierarchical Stacking Optimization Using Dirichlet's Process (SoDip): Towards Accelerated Design for Graft Polymerization

基于Dirichlet过程的分层堆叠优化(SoDip):迈向聚合法的加速设计

Amgad Ahmed Ali Ibrahim, Hein Htet, Ryoji Asahi

专题命中 多模态生成 :multimodal(abstract)

AI总结 基于Dirichlet过程的分层堆叠优化框架通过整合Transformer、TabNet、XGBoost和贝叶斯优化,提升聚合法的可重复性和设计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06153 2025-12-30 q-bio.NC math.AT stat.ME 50%

Topologically Invariant Permutation Test

拓扑不变排列检验

Sixtus Dakurah

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出一种拓扑不变排列检验,用于检测功能脑网络的拓扑不等价性,通过2-瓦瑟斯坦距离和热核扩展实现拓扑结构的稳健比较。

Comments 24 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 18 篇

2512.23219 2025-12-30 cs.CV 83%

MM-UAVBench: How Well Do Multimodal Large Language Models See, Think, and Plan in Low-Altitude UAV Scenarios?

MM-UAVBench: 多模态大语言模型在低空无人机场景中的感知、推理与规划能力如何?

Shiqi Dai, Zizhi Ma, Zhicong Luo, Xuesong Yang, Yibin Huang, Wanyue Zhang, Chi Chen, Zonghao Guo, Wang Xu, Yufei Sun, Maosong Sun

机构 * Tsinghua University(清华大学) Nankai University(南开大学) Northwest Polytechnical University(西北工业大学) Chinese Academy of Sciences(中国科学院) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 MM-UAVBench通过系统评估多模态大语言模型在低空无人机场景中的感知、推理与规划能力,揭示其在复杂任务中的性能瓶颈与改进方向。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03146 2025-12-30 cs.CL 83%

MME-CC: A Challenging Multi-Modal Evaluation Benchmark of Cognitive Capacity

MME-CC:认知能力多模态评估基准

Kaiyuan Zhang, Chenghao Yang, Zhoufutu Wen, Sihang Yuan, Qiuyue Wang, Chaoyi Huang, Guosheng Zhu, He Wang, Huawenyu Lu, Jianing Wen, Jianpeng Jiao, Lishu Luo, Longxiang Liu, Sijin Wu, Xiaolei Zhu, Xuanliang Zhang, Yu Liu, Ge Zhang, Yi Lin, Guang Shi, Chaoyou Fu, Wenhao Huang

机构 * Nanjing University(南京大学)

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 MME-CC提出一个以视觉为基础的多模态评估基准,系统评估大语言模型在空间、几何和知识推理中的认知能力,揭示封闭源模型在总体表现上的优势及空间几何推理的薄弱环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22877 2025-12-30 cs.CV 79%

M-ErasureBench: A Comprehensive Multimodal Evaluation Benchmark for Concept Erasure in Diffusion Models

M-ErasureBench:一种全面的多模态评估基准,用于扩散模型的概念擦除

Ju-Hsuan Weng, Jia-Wei Liao, Cheng-Fu Chou, Jun-Cheng Chen

机构 * National Taiwan University(国立台湾大学) Research Center for Information Technology Innovation, Academia Sinica(学术院资讯技术创新研究中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 M-ErasureBench提出一种多模态评估框架,评估扩散模型的概念擦除方法,并提出IRECE模块提升擦除鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19466 2025-12-30 cs.CV cs.LG 79%

ForgerySleuth: Empowering Multimodal Large Language Models for Image Manipulation Detection

ForgerySleuth: 赋能多模态大语言模型进行图像篡改检测

Zhihao Sun, Haoran Jiang, Haoran Chen, Yixin Cao, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 ForgerySleuth通过多模态大语言模型进行图像篡改检测,利用线索融合和数据集构建提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22689 2025-12-30 cs.CV cs.LG 79%

Multimodal Diffeomorphic Registration with Neural ODEs and Structural Descriptors

基于神经ODE和结构描述符的多模态可微映射注册

Salvador Rodriguez-Sanz, Monica Hernandez

机构 * Aragon Institute for Engineering Research (I3A), University of Zaragoza(阿拉贡工程研究院(I3A)、萨拉戈塔大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于神经ODE和结构描述符的多模态可微映射注册方法,通过整合图像或特征描述符和局部互信息,实现了高精度且高效的多模态注册性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22899 2025-12-30 cs.AI cs.CV 73%

HiSciBench: A Hierarchical Multi-disciplinary Benchmark for Scientific Intelligence from Reading to Discovery

HiSciBench: 一个分层多学科基准,用于从阅读到发现的科学智能

Yaping Zhang, Qixuan Zhang, Xingquan Zhang, Zhiyuan Chen, Wenwen Zhuang, Yupu Liang, Lu Xiang, Yang Zhao, Jiajun Zhang, Yu Zhou, Chengqing Zong

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI

AI总结 HiSciBench是一个分层多学科基准,用于评估从阅读到发现的科学智能,涵盖五个层次,揭示了模型在不同科学推理阶段的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03347 2025-12-30 cs.RO 71%

GrOMP: Grasped Object Manifold Projection for Multimodal Imitation Learning of Manipulation

GrOMP:抓取物体流形投影用于多模态模仿学习的操控

William van den Bogert, Gregory Linkowski, Nima Fazeli

机构 * Mechanical Engineering Department at the University of Michigan(密歇根大学机械工程系) Robotics & Automation Research Department at the Ford Motor Company(福特汽车公司机器人与自动化研究部) Robotics Department at the University of Michigan(密歇根大学机器人系)

专题命中 多模态评测 :multimodal(title)

AI总结 GrOMP通过抓取物体流形投影技术,提升多模态模仿学习中操控任务的精度和鲁棒性,基于累积误差界理论,利用触觉反馈在多个装配任务中验证其有效性。

Comments 8 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22257 2025-12-30 q-bio.QM 67%

LiveProteinBench: A Contamination-Free Benchmark for Assessing Models' Specialized Capabilities in Protein Science

LiveProteinBench: 一种无污染的基准测试,用于评估模型在蛋白质科学中的专用能力

Dingyi Rong, Zijian Chen, Qi Jia, Kaiwei Zhang, Haotian Lu, Guangtao Zhai, Ning Liu

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract)

AI总结 LiveProteinBench通过无污染的多模态基准测试,评估LLM在蛋白质科学中的专用能力,揭示了通用模型在零样本性能上的优势及多模态信息融合的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23078 2025-12-30 q-fin.GN cs.AI cs.CV cs.LG econ.GN q-fin.EC 62%

Deep Learning for Art Market Valuation

深度学习在艺术市场估值中的应用

Jianping Mei, Michael Moses, Jan Waelty, Yucheng Yang

机构 * CKGSB(CKGSB商学院) Art Market Consultancy(艺术市场咨询公司) University of Zurich(苏黎世大学) Swiss Finance Institute(瑞士金融研究所)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过多模态深度学习方法,利用艺术品视觉信息提升艺术市场估值,尤其在缺乏历史参照物的首次销售中展现显著价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22275 2025-12-30 cs.CV cs.AI 62%

The Illusion of Clinical Reasoning: A Benchmark Reveals the Pervasive Gap in Vision-Language Models for Clinical Competency

临床推理的幻觉:一个基准揭示了视觉语言模型在临床能力方面的广泛差距

Dingyu Wang, Zimu Yuan, Jiajun Liu, Shanggui Liu, Nan Zhou, Tianxing Xu, Di Huang, Dong Jiang

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出B&J基准测试,揭示了视觉语言模型在临床推理任务中存在显著的多模态整合能力不足问题,强调需在多模态整合和视觉理解上取得突破才能实现临床应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22218 2025-12-30 cs.CV cs.MM 62%

Towards Signboard-Oriented Visual Question Answering: ViSignVQA Dataset, Method and Benchmark

面向路牌的视觉问答:ViSignVQA数据集、方法与基准

Hieu Minh Nguyen, Tam Le-Thanh Dang, Kiet Van Nguyen

机构 * University of Information Technology, Ho Chi Minh City, Vietnam(胡志明市信息技术大学) Vietnam National University(越南国家大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 ViSignVQA首次提出大规模越南语路牌多模态数据集,结合OCR与预训练语言模型,提升低资源语言VQA性能。

Comments Dataset paper; code and data will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23142 2025-12-30 cs.CV 57%

Domain-Shift Immunity in Deep Deformable Registration via Local Feature Representations

通过局部特征表示实现深度可变形配准的领域偏移免疫

Mingzhen Shao, Sarang Joshi

机构 * Kahlert School of Computing(卡尔伯特计算学校) Scientific Computing and Imaging Institute(科学计算与成像研究所) University of Utah(犹他大学) Department of Biomedical Engineering(生物医学工程系)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出UniReg框架,通过局部特征表示实现深度可变形配准的领域偏移免疫,揭示了局部特征一致性对鲁棒性的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23024 2025-12-30 cs.CV 57%

With Great Context Comes Great Prediction Power: Classifying Objects via Geo-Semantic Scene Graphs

大_context带来大预测能力:通过地-语义场景图进行物体分类

Ciprian Constantinescu, Marius Leordeanu

机构 * National University of Science and Technology(科学与技术国家大学) POLITEHNICA Bucharest(布加勒斯特POLITEHNICA)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种基于地-语义场景图的上下文感知物体分类框架,通过整合深度估计与全景分割模型,显著提升分类准确率至73.4%,优于传统方法和多模态大语言模型。

Comments This paper is a development of the visual riddle game with Human-AI interaction, entitled "GuessWhat - Riddle Eye with AI", developed by Ciprian Constantinescu (POLItEHNICA Bucharest), Serena Stan (Instituto Cervantes Bucarest) and Marius Leordeanu (POLITEHNICA Bucharest), which was the winner (1st place) of the NeoArt Connect NAC 2025 Scholarship Program

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19683 2025-12-30 cs.CV 57%

From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs

从室内到开放世界:揭示MLLMs中的空间推理差距

Mingrui Wu, Zhaozhi Wang, Fangjinhua Wang, Jiaolong Yang, Marc Pollefeys, Tong Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) ETH Zürich(苏黎世联邦理工学院) Microsoft Research Asia(微软亚洲研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种大规模基准测试,通过户外数据集揭示MLLMs在空间推理方面的不足,并证明其依赖语言先验而非真实视觉推理。

Comments Project page: https://mingrui-wu.github.io/openbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14404 2025-12-30 cs.CV 57%

ViC-Bench: Benchmarking Visual-Interleaved Chain-of-Thought Capability in MLLMs with Free-Style Intermediate State Representations

ViC-Bench: 用自由式中间状态表示法对多模态大语言模型的视觉交错链式思维能力进行基准测试

Xuecheng Wu, Jiaxing Liu, Danlei Huang, Yifan Wang, Yunyun Shi, Kedi Chen, Junxiao Xue, Yang Liu, Chunlin Chen, Hairong Dong, Dingkang Yang

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Meituan Inc.(美团公司) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) Research Center for Space Computing System, Zhejiang Lab(浙江实验室空间计算系统研究中心) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) School of Robotics and Automation, Nanjing University(南京大学机器人与自动化学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 ViC-Bench 通过自由式中间状态表示法,系统评估多模态大语言模型的视觉交错链式思维能力,涵盖四个任务并提出新评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22304 2025-12-30 cs.CV 57%

PortionNet: Distilling 3D Geometric Knowledge for Food Nutrition Estimation

PortionNet:基于3D几何知识的食品营养估计

Darrin Bright, Rakshith Raj, Kanchan Keisham

机构 * Vellore Institute of Technology(维捷里尼学院)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 PortionNet通过跨模态知识蒸馏框架,在无需专用硬件的情况下,利用点云学习几何特征,实现单图像食品营养估计的高精度

Comments Accepted at the 11th Annual Conference on Vision and Intelligent Systems (CVIS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22197 2025-12-30 cs.CV 57%

Quadrant Segmentation VLM with Few-Shot Adaptation and OCT Learning-based Explainability Methods for Diabetic Retinopathy

四象限分割视觉语言模型结合少样本适应与基于OCT学习的可解释方法用于糖尿病视网膜病变

Shivum Telang

机构 * Department of Biostatics(生物统计学系) North Allegheny Senior High School(北阿勒格尼高中) University of Pittsburgh Rangos Research Center(匹兹堡大学Rangos研究中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种基于四象限分割和少样本学习的多模态视觉语言模型,利用OCT和视网膜图像生成可解释性热图,提升糖尿病视网膜病变的诊断效果。

Comments 4 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12615 2025-12-30 cs.CV cs.LG 57%

Text-Driven Weakly Supervised OCT Lesion Segmentation with Structural Guidance

基于文本驱动的弱监督OCT病变分割与结构引导

Jiaqi Yang, Nitish Mehta, Xiaoling Hu, Chao Chen, Chia-Ling Tsai

机构 * CUNY Graduate Center(CUNY研究生中心) New York University Department of Ophthalmology(纽约大学眼科系) NYU Langone Health(NYU兰格one健康) Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院) Stony Brook University(石溪大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于文本驱动和结构引导的弱监督OCT病变分割方法,通过融合视觉和文本信息提升分割性能。

Comments 21 pages, 10 figures, 11 tables

Journal ref IEEE Journal of Biomedical and Health Informatics, Early Access, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 10 篇

2512.23343 2025-12-30 cs.CL cs.AI cs.CV 67%

AI Meets Brain: Memory Systems from Cognitive Neuroscience to Autonomous Agents

AI 与大脑:从认知神经科学到自主代理的记忆系统

Jiafeng Liang, Hao Li, Chang Li, Jiaqi Zhou, Shixin Jiang, Zekun Wang, Changkai Ji, Zhihao Zhu, Runxuan Liu, Tao Ren, Jinlan Fu, See-Kiong Ng, Xia Liang, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Fudan University(复旦大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文从认知神经科学到自主代理,系统综合了记忆的跨学科知识,探讨了记忆的定义、功能、分类、存储机制及安全问题,并展望了多模态记忆系统和技能获取的未来研究方向。

Comments 57 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23132 2025-12-30 cs.CR cs.LG cs.MA 67%

Multi-Agent Framework for Threat Mitigation and Resilience in AI-Based Systems

多智能体框架用于AI系统中的威胁缓解与韧性

Armstrong Foundjem, Lionel Nganyewou Tidjon, Leuson Da Silva, Foutse Khomh

机构 * Department of Computer and Software Engineering, Polytechnique Montreal(计算机与软件工程系,蒙特利尔理工学院)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract)

AI总结 本文提出多智能体框架,用于识别和缓解AI系统中的威胁,通过构建威胁图分析漏洞和攻击模式,提升系统韧性。

Comments 56 pages, 18 Figures, 22 Tables, TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20981 2025-12-30 cs.CV cs.CL cs.RO 62%

RefAV: Towards Planning-Centric Scenario Mining

RefAV:面向规划导向的场景挖掘

Cainan Davidson, Deva Ramanan, Neehar Peri

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 RefAV通过视觉-语言模型改进场景挖掘,解决自动驾驶中复杂多智能体交互的定位问题。

Comments Project Page: https://cainand.github.io/RefAV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23424 2025-12-30 cs.AI cs.LG 57%

AKG kernel Agent: A Multi-Agent Framework for Cross-Platform Kernel Synthesis

AKG核代理:跨平台核合成的多智能体框架

Jinye Du, Quan Yuan, Zuyao Zhang, Yanzhi Yi, Jiahui Hu, Wangyi Chen, Yiyang Zhu, Qishui Zheng, Wenxiang Zou, Xiangyu Chang, Zuohe Zheng, Zichun Ye, Chao Liu, Shanni Li, Renwei Zhang, Yiping Deng, Xinwei Hu, Xuefeng Jin, Jie Zhao

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) Hunan University(湖南大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 AKG核代理是一种多智能体系统,通过自动化核生成、迁移和性能调优,提升跨平台核开发效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23217 2025-12-30 cs.AI 57%

TCEval: Using Thermal Comfort to Assess Cognitive and Perceptual Abilities of AI

TCEval:利用热舒适性评估人工智能的认知与感知能力

Jingming Li

专题命中 多模态Agent :cross-modal(abstract);分类 cs.AI

AI总结 TCEval通过热舒适性场景评估AI的跨模态推理、因果关联和适应性决策能力,揭示当前LLM在热舒适性领域存在基础推理能力但缺乏精确因果理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22207 2025-12-30 cs.AI 57%

GamiBench: Evaluating Spatial Reasoning and 2D-to-3D Planning Capabilities of MLLMs with Origami Folding Tasks

GamiBench: 通过折纸任务评估多模态大语言模型的空间推理和2D到3D规划能力

Ryan Spencer, Roey Yaari, Ritvik Vemavarapu, Joyce Yang, Steven Ngo, Utkarsh Sharma

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 GamiBench通过折纸任务评估多模态大语言模型的空间推理和2D到3D规划能力,引入新指标并揭示模型在复杂折叠任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00336 2025-12-30 cs.RO cs.AI 57%

Never-Ending Behavior-Cloning Agent for Robotic Manipulation

永不终止的行为克隆代理用于机器人操作

Wenqi Liang, Gan Sun, Yao He, Yu Ren, Jiahua Dong, Yang Cong

机构 * State Key Laboratory of Robotics, Shenyang Institute of Automation, Chinese Academy of Sciences(机器人国家重点实验室,沈阳自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) School of Automation Science and Engineering, South China University of Technology(自动化科学与工程学院,华南理工大学) Mohamed bin Zayed University of Artificial Intelligence(马斯达尔大学人工智能学院)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文提出NBAgent,通过持续学习技能共享和特定属性,解决具身机器人中3D场景表示和人类水平任务学习的挑战。

Comments 17 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏