arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-02 至 2025-12-02 共收录 122 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 28 篇

2510.22969 2025-12-02 cs.AI cs.MA 57%

Multi-Agent Conditional Diffusion Model with Mean Field Communication as Wireless Resource Allocation Planner

多智能体条件扩散模型与均场通信作为无线资源分配规划器

Kechen Meng, Sinuo Zhang, Rongpeng Li, Xiangming Meng, Yansha Deng, Chan Wang, Ming Lei, Zhifeng Zhao

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Zhejiang University-University of Illinois Urbana-Champaign (ZJU-UIUC) Institute, Zhejiang University(浙江大学-伊利诺伊大学厄巴纳-香槟分校联合研究所) Department of Engineering, King’s College London(伦敦国王学院工程系)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 多智能体条件扩散模型与均场通信用于无线资源分配规划,通过扩散模型和逆动态模型提升样本效率与策略可扩展性,理论保证收敛稳定性,实验显示在无线网络优化中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17655 2025-12-02 cs.RO cs.AI cs.MA 57%

AssistantX: An LLM-Powered Proactive Assistant in Collaborative Human-Populated Environment

AssistantX: 一种基于大语言模型的协作人类 populated 环境中的主动助手

Nan Sun, Bo Mao, Yongchang Li, Di Guo, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 AssistantX 是一种基于大语言模型的主动助手,通过多代理框架实现自主操作,具备高级推理能力和协作意识,能有效响应用户指令并主动寻求帮助以完成任务。

Comments 8 pages, 10 figures, 6 tables

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Hangzhou, China, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00194 2025-12-02 cs.CV cs.LG eess.IV q-bio.QM 57%

AutocleanEEG ICVision: Automated ICA Artifact Classification Using Vision-Language AI

AutocleanEEG ICVision:利用视觉-语言AI实现自动化ICA噪声分类

Zag ElSayed, Grace Westerkamp, Gavin Gammoh, Yanchen Liu, Peyton Siekierski, Craig Erickson, Ernest Pedapati

机构 * School of Information Technology University of Cincinnati Ohio, USA(信息科技学院 奥地利辛辛那提大学 美国俄亥俄州)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 ICVision通过视觉-语言AI实现自动化EEG ICA噪声分类,达到专家级准确度并提供可解释结果。

Comments 6 pages, 8 figures

Journal ref Conference ICMI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00069 2025-12-02 cs.RO cs.AI 57%

Enhancing Cognitive Robotics with Commonsense through LLM-Generated Preconditions and Subgoals

通过LLM生成的先决条件和子目标增强认知机器人

Ohad Bachner, Bar Gamliel

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本研究通过结合大型语言模型与符号规划,利用LLM生成的先决条件和子目标提升机器人任务完成的可靠性与适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00048 2025-12-02 cs.RO cs.AI 57%

Causal Reinforcement Learning based Agent-Patient Interaction with Clinical Domain Knowledge

基于因果强化学习的Agent-患者交互与临床领域知识

Wenzheng Zhao, Ran Zhang, Ruth Palan Lopez, Shu-Fen Wung, Fengpei Yuan

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于因果强化学习的Agent-患者交互框架,通过整合因果发现与推理提升医疗场景中的决策可解释性和适应性。

Comments Accepted by AAAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03543 2025-12-02 cs.AI cs.CY cs.MA 57%

CogniPair: From LLM Chatbots to Conscious AI Agents -- GNWT-Based Multi-Agent Digital Twins for Social Pairing -- Dating & Hiring Applications

CogniPair: 从LLM聊天机器人到有意识的AI代理 -- 基于GNWT的多智能体数字孪生用于社交配对 -- dating与招聘应用

Wanghao Ye, Sihan Chen, Yiting Wang, Shwai He, Bowei Tian, Guoheng Sun, Ziyi Wang, Ziyao Wang, Yexiao He, Zheyu Shen, Meng Liu, Yuning Zhang, Meng Feng, Yang Wang, Siyuan Peng, Yilong Dai, Zhenle Duan, Lang Xiong, Joshua Liu, Hanzhang Qin, Ang Li

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 CogniPair基于GNWT理论,通过整合人类认知架构,创建多智能体数字孪生系统,用于社交配对,提升LLM代理的心理真实性,并应用于约会和招聘场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01681 2025-12-02 cs.CV 50%

Cross-Domain Validation of a Resection-Trained Self-Supervised Model on Multicentre Mesothelioma Biopsies

多中心胸膜间皮瘤活检样本上基于切除样本训练的自监督模型的跨领域验证

Farzaneh Seyedshahi, Francesca Damiola, Sylvie Lantuejoul, Ke Yuan, John Le Quesne

机构 * School of Cancer Sciences, University of Glasgow(格拉斯哥大学癌症科学学院) Cancer Research UK Scotland Institute(癌症研究英国苏格兰研究所) Department of Biopathology, Léon Bérard Cancer Center(生物病理学系,勒内·贝拉尔癌症中心) Grenoble Alpes University(格拉斯哥大学) Queen Elizabeth University Hospital, NHS Greater Glasgow and Clyde(伊丽莎白女王大学医院,格拉斯哥与克莱德国家健康服务)

专题命中 规划推理 :planning(abstract)

AI总结 本研究验证了在切除样本上训练的自监督模型在活检样本上的跨领域应用,通过捕捉形态学模式实现肿瘤亚型分类和生存预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20469 2025-12-02 q-bio.QM cs.CV 50%

Prediction of Distant Metastasis in Head and Neck Cancer Patients Using Tumor and Peritumoral Multi-Modal Deep Learning

利用肿瘤及周围多模态深度学习预测头颈癌患者远端转移

Nuo Tong, Changhao Liu, Zizhao Tang, Feifan Sun, Yingping Li, Shuiping Gou, Mei Shi

专题命中 规划推理 :planning(abstract)

AI总结 本研究提出多模态深度学习模型,结合CT影像、放射组学和临床数据,用于预测头颈癌患者远端转移风险,通过多模态融合显著提高预测性能。

Comments 23 pages, 6 figures, 7 tables. Nuo Tong and Changhao Liu contributed equally. Corresponding Authors: Shuiping Gou and Mei Shi

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01123 2025-12-02 q-fin.CP 50%

A Hybrid Architecture for Options Wheel Strategy Decisions: LLM-Generated Bayesian Networks for Transparent Trading

期权轮动策略决策的混合架构:LLM生成的贝叶斯网络用于透明交易

Xiaoting Kuang, Boken Lin

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出一种结合LLM和贝叶斯网络的混合架构,用于透明化期权轮动策略决策,通过构建可解释的贝叶斯网络实现高风险调整收益和低回撤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00740 2025-12-02 cs.MA 50%

Augmented Runtime Collaboration for Self-Organizing Multi-Agent Systems: A Hybrid Bi-Criteria Routing Approach

增强型运行时协作用于自组织多智能体系统:一种混合双标准路由方法

Qingwen Yang, Feiyu Qu, Tiezheng Guo, Yanyi Liu, Yingyou Wen

专题命中 规划推理 :planning(abstract)

AI总结 本文提出BiRouter,一种混合双标准路由方法,用于自组织多智能体系统,通过平衡重要性和连续性指标提升任务路由性能和鲁棒性。

Comments Accepted at The 40th Annual AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00723 2025-12-02 cs.CV cs.RO 50%

TrajDiff: End-to-end Autonomous Driving without Perception Annotation

TrajDiff: 无需感知标注的端到端自动驾驶

Xingtai Gui, Jianbo Zhao, Wencheng Han, Jikai Wang, Jiahao Gong, Feiyang Tan, Cheng-zhong Xu, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学智能物联网与交通系统研究中心,计算机学院) University of Science and Technology of China(中国科学技术大学) Mach Drive

专题命中 规划推理 :planning(abstract)

AI总结 TrajDiff通过无需感知标注的轨迹导向鸟瞰图扩散框架,实现了端到端自动驾驶,达到领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14551 2025-12-02 cs.AR 50%

Empirically-Calibrated H100 Node Power Models for Reducing Uncertainty in AI Training Energy Estimation

基于经验校准的H100节点功率模型以减少AI训练能耗估计中的不确定性

Alex C. Newkirk, Jared Fernandez, Jonathan Koomey, Imran Latif, Emma Strubell, Arman Shehabi, Constantine Samaras

专题命中 规划推理 :planning(abstract)

AI总结 本文提出基于经验校准的H100节点功率模型,通过结合实测数据和基准测试数据,提高AI训练能耗估计的准确性,减少不确定性。

Comments 4 figures, 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00370 2025-12-02 cs.CE 50%

Multi-Task Temporal Fusion Transformer for Joint Sales and Inventory Forecasting in Amazon E-Commerce Supply Chain

多任务时间融合变换器用于亚马逊电子商务供应链中的联合销售与库存预测

Zheqi Hu, Yiwen Hu, Hanwu Li

专题命中 规划推理 :planning(abstract)

AI总结 本研究提出多任务时间融合变换器,通过整合多源数据提升亚马逊供应链中销售与库存预测的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00313 2025-12-02 cs.IR cs.HC 50%

Evolving Paradigms in Task-Based Search and Learning: A Comparative Analysis of Traditional Search Engine with LLM-Enhanced Conversational Search System

基于任务的搜索与学习范式的演变:传统搜索引擎与LLM增强的对话搜索系统比较分析

Zhitong Guan, Yi Wang

专题命中 规划推理 :reasoning(abstract)

AI总结 本文比较了传统搜索引擎与LLM增强的对话搜索系统,探讨了LLM对搜索策略、查询制定及学习效果的影响,揭示了生成式AI在信息检索中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00089 2025-12-02 cs.CV 50%

TeleViT1.0: Teleconnection-aware Vision Transformers for Subseasonal to Seasonal Wildfire Pattern Forecasts

TeleViT1.0:面向亚季节至季节 wildfire 模式预测的 teleconnection 意识 Vision Transformers

Ioannis Prapas, Nikolaos Papadopoulos, Nikolaos-Ioannis Bountos, Dimitrios Michail, Gustau Camps-Valls, Ioannis Papoutsis

机构 * Orion Lab, National Technical University of Athens(奥里昂实验室,国家技术大学雅典分校) Image Processing Laboratory (IPL), Universitat de València(图像处理实验室(IPL),瓦伦西亚大学) National Technical University of Athens(国家技术大学雅典分校) Department of Informatics and Telematics, Harokopio University of Athens(信息与电信系,哈罗基奥大学雅典分校) Universitat de València(瓦伦西亚大学)

专题命中 规划推理 :planning(abstract)

AI总结 TeleViT1.0 通过整合本地火灾驱动因素、全球场和 teleconnection 指数,提升亚季节至季节 wildfire 预测性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00082 2025-12-02 cs.CV 50%

Exploring Diagnostic Prompting Approach for Multimodal LLM-based Visual Complexity Assessment: A Case Study of Amazon Search Result Pages

探索用于多模态大语言模型视觉复杂性评估的诊断提示方法:亚马逊搜索结果页面案例研究

Divendar Murtadak, Yoon Kim, Trilokya Akula

专题命中 规划推理 :reasoning(abstract)

AI总结 本研究通过对比诊断提示与传统提示方法,发现其在提升多模态大语言模型对亚马逊搜索结果页面视觉复杂性评估的可靠性方面有显著改进,但仍有待进一步优化。

Comments 9 pages, 4 figures, 9 tables. Study on diagnostic prompting for multimodal LLM-based visual complexity assessment of Amazon search result pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00018 2025-12-02 physics.soc-ph cs.MA cs.RO cs.SY eess.SY nlin.AO 50%

X-SYCON: Xylem-Inspired Passive Gradient Control for Communication-Free Swarm Response in Dynamic Disaster Environments

X-SYCON:受木质部启发的被动梯度控制用于无通信蜂群响应在动态灾害环境中

Arthur Ji Sung Baek, Geoffrey Martin

机构 * Independent Researcher(独立研究者) Cornell University(康奈尔大学)

专题命中 规划推理 :planning(abstract)

AI总结 X-SYCON是一种受木质部启发的多智能体架构,通过被动场动态实现协调,无需通信即可在动态灾害环境中高效响应。

Comments Preprint v1. 10 pages, 11 figures. Code and data: https://github.com/arthurbaek/biovascular-swarm-robotics

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 14 篇

2512.01174 2025-12-02 cs.CL 85%

DrawingBench: Evaluating Spatial Reasoning and UI Interaction Capabilities of Large Language Models through Mouse-Based Drawing Tasks

DrawingBench:通过基于鼠标绘制的任务评估大语言模型的空间推理和UI交互能力

Hyunjun Kim, Sooyoung Ryu

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);self-correction(abstract);分类 cs.CL

AI总结 DrawingBench通过基于鼠标绘制的任务评估大语言模型的空间推理和UI交互能力,揭示了模型在复杂场景中的表现及外部监督的重要性。

Comments AAAI 2026 TrustAgent Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00736 2025-12-02 cs.LG cs.AI cs.CV 81%

REM: Evaluating LLM Embodied Spatial Reasoning through Multi-Frame Trajectories

REM:通过多帧轨迹评估大语言模型的具身空间推理

Jacob Thompson, Emiliano Garcia-Lopez, Yonatan Bisk

机构 * Department of Computer Science(计算机科学系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 REM通过多帧轨迹评估大语言模型的空间推理能力,揭示其在复杂空间任务中的不足,推动更 robust 的空间表示研究。

Journal ref Proceedings of the Conference on Language Modeling (COLM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13047 2025-12-02 cs.CV 80%

InsightDrive: Insight Scene Representation for End-to-End Autonomous Driving

InsightDrive: 用于端到端自动驾驶的洞察场景表示

Ruiqi Song, Xianda Guo, Yanlun Peng, Qinggong Wei, Hangbin Wu, Long Chen

机构 * College of Surveying and Geo-informatics, Tongji University(同济大学测绘与地理信息学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Computer Science, Wuhan University(武汉大学计算机学院) The School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Great Wall Motor(长城汽车) IAIR, Xi’an Jiaotong University(西安交通大学IAIR)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 InsightDrive通过结合显式和隐式场景表示,提升自动驾驶轨迹规划的鲁棒性和人类认知一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01223 2025-12-02 cs.CV cs.AI 79%

S$^2$-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance

S$^2$-MLLM:通过结构指导提升多模态大语言模型在3D视觉定位中的空间推理能力

Beining Xu, Siting Zhu, Zhao Jin, Junxian Li, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 S$^2$-MLLM通过隐式空间推理提升多模态大语言模型在3D视觉定位中的空间推理能力,实现高效且准确的3D场景理解。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02139 2025-12-02 cs.AI 74%

The Unified Cognitive Consciousness Theory for Language Models: Anchoring Semantics, Thresholds of Activation, and Emergent Reasoning

语言模型的统一认知意识理论:锚定语义、激活阈值与涌现推理

Edward Y. Chang, Zeyneb N. Kaya, Ethan Chang

机构 * Stanford University(斯坦福大学) UIUC(伊利诺伊大学香槟分校)

专题命中 视觉空间推理 :reasoning(title);分类 cs.AI

AI总结 该研究提出统一认知意识理论,通过语义锚定解释语言模型如何将预训练能力转化为目标导向行为,并通过实验验证了锚定强度对模型性能的影响。

Comments 21 pages, 7 figure, 4 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23907 2025-12-02 cs.CV cs.AI cs.LG 73%

DynaStride: Dynamic Stride Windowing with MMCoT for Instructional Multi-Scene Captioning

DynaStride: 基于MMCoT的动态步长窗多场景描述生成

Eddison Pham, Prisha Priyadarshini, Adrian Maliackel, Kanishk Bandi, Cristian Meo, Kevin Zhu

机构 * Algoverse AI Research(Algoverse人工智能研究)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 DynaStride通过多模态链式思考和动态步长窗算法,实现无需手动分割的多场景教学视频连贯描述生成,提升描述的连贯性和信息量。

Comments 16 pages, 15 figures, 5 Tables, Accepted at NeurIPS 7HVU Workshop, Accepted at AAAI AI4ED Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17808 2025-12-02 cs.LG 70%

Remote Sensing-Oriented World Model

面向遥感的世界模型

Yuxi Lu, Biao Wu, Zhidong Li, Kunqi Li, Chenya Huang, Huacan Wang, Qizhen Lan, Ronghao Chen, Ling Chen, Bin Liang

机构 * University of Technology Sydney (UTS)(悉尼技术大学) University of Chinese Academy of Sciences (UCAS)(中国科学院大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Peking University(北京大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出首个面向遥感的世界模型框架,通过RemoteBAGEL模型在RSWISE基准上实现空间推理的高效外推。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00565 2025-12-02 cs.CV cs.AI cs.RO 57%

Describe Anything Anywhere At Any Moment

在任何地方、任何时间描述任何事物

Nicolas Gorlo, Lukas Schmid, Luca Carlone

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 DAAAM是一种用于大规模实时4D场景理解的空间时间记忆框架,通过优化前端和分层4D场景图实现高效语义描述与实时性能的平衡。

Comments 14 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10044 2025-12-02 cs.CR cs.AI 57%

Large Language Models for Power System Security: A Novel Multi-Modal Approach for Anomaly Detection in Energy Management Systems

用于电力系统安全的大型语言模型:一种用于能源管理系统异常检测的新型多模态方法

Aydin Zaboli, Junho Hong, Alexandru Stefanov, Chen-Ching Liu, Chul-Sang Hwang

机构 * Department of Electrical and Computer Engineering, University of Michigan -- Dearborn, MI, 48128 USA.(电气与计算机工程系,密歇根大学迪尔伯恩分校) Department of Electrical Sustainable Energy, Technische Universiteit Delft, 2628 CD Delft, Netherlands.(可持续能源系,代尔夫特理工大学) Bradley Department of Electrical and Computer Engineering, Virginia Polytechnic Institute and State University, Blacksburg, VA 24061, USA.(布雷德利电气与计算机工程系,弗吉尼亚理工学院和州立大学) Smart Grid Research Division System Reliability Research Team, Korea Electrotechnology Research Institute (KERI), Gwangju-si, 61751, South Korea.(智能电网研究分会系统可靠性研究团队,韩国电力技术研究所(KERI))

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于大型语言模型的多模态方法,用于电力系统中能源管理系统的安全防护和异常检测。

Comments 10 Figures; 6 Tables; Accepted, IEEE ACCESS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00294 2025-12-02 cs.CV cs.AI cs.HC 57%

Words into World: A Task-Adaptive Agent for Language-Guided Spatial Retrieval in AR

词语进入世界:一种任务自适应代理用于增强现实中的语言引导空间检索

Lixing Guo, Tobias Höllerer

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种任务自适应AR代理,结合多模态大语言模型和视觉模型,实现语言引导的空间检索,支持复杂查询和真实世界交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00027 2025-12-02 cs.RO cs.AI cs.CV cs.HC 57%

A Survey on Improving Human Robot Collaboration through Vision-and-Language Navigation

通过视觉-语言导航提升人机协作的综述

Nivedan Yakolli, Avinash Gautam, Abhijit Das, Yuankai Qi, Virendra Singh Shekhawat

机构 * Birla Institute of Technology and Science (BITS)(比拉理工学院和科学学院) Macquarie University(麦考瑞大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文综述了视觉-语言导航在提升人机协作中的最新进展,探讨了多机器人协作中的关键挑战,并提出通过先进NLU技术实现主动澄清和动态角色分配的未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07867 2025-12-02 cs.CV 50%

Continuous Perception Matters: Diagnosing Temporal Integration Failures in Multimodal Models

持续感知至关重要:多模态模型中时间整合失败的诊断

Zeyu Wang, Zhenzhen Weng, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出CP-Bench,通过简单任务揭示多模态模型在持续感知中的时间整合缺陷,指出现有模型无法有效跨时间积累证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00903 2025-12-02 cs.CV cs.RO 50%

SwiftVLA: Unlocking Spatiotemporal Dynamics for Lightweight VLA Models at Minimal Overhead

SwiftVLA: 解锁轻量VLA模型的时空动态以最小的开销

Chaojun Ni, Cheng Chen, Xiaofeng Wang, Zheng Zhu, Wenzhao Zheng, Boyuan Wang, Tianrun Chen, Guosheng Zhao, Haoyun Li, Zhehao Dong, Qiang Zhang, Yun Ye, Yang Wang, Guan Huang, Wenjun Mei

机构 * GigaAI Peking University(北京大学) Moxin (Huzhou) Technology Co., Ltd.(摩西(湖州)科技有限公司) Tsinghua University(清华大学) X-Humanoid Project(X-人形项目)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 SwiftVLA通过4D视觉几何Transformer和Fusion Tokens提升轻量VLA模型的时空推理能力,实现高效且性能优异的视觉-语言-动作处理。

详情

展开后加载摘要…

URL PDF HTML 收藏