arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3389 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3389 篇

2602.23228 2026-03-16 cs.CV cs.AI 57%

MovieTeller: Tool-augmented Movie Synopsis with ID Consistent Progressive Abstraction

MovieTeller: 借助工具的电影概要与ID一致的渐进抽象

Yizhi Li, Xiaohan Chen, Miao Jiang, Wentao Tang, Gaoang Wang

机构 * Central Universities(中央高校) National Natural Science Foundation of China(中国国家自然科学基金委员会) Research Fund for International Scientists of National Natural Science Foundation of China(中国国家自然科学基金委员会国际科学家研究基金)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 MovieTeller通过工具增强的渐进抽象生成电影概要,解决传统VLM在长视频摘要中的身份一致性和叙事连贯性问题,提升事实准确性与一致性。

Comments 6 pages, CSCWD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11640 2026-03-13 cs.CV cs.AI 57%

Tokenization Allows Multimodal Large Language Models to Understand, Generate and Edit Architectural Floor Plans

分词使多模态大语言模型能够理解、生成和编辑建筑平面图

Sizhong Qin, Ramon Elias Weber, Xinzheng Lu

机构 * Tsinghua University(清华大学) UC Berkeley(伯克利大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 HouseMind通过引入离散房间实例标记,实现了建筑平面图的统一理解和生成,具备高效且可控的布局生成能力。

Comments 20 pages, 9 figures. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11515 2026-03-13 cs.AI 57%

Multi-Agent Collaboration for Automated Design Exploration on High Performance Computing Systems

多智能体协作用于高性能计算系统上的自动化设计探索

Harshitha Menon, Charles F. Jekel, Kevin Korner, Brian Gunnarson, Nathan K. Brown, Michael Stees, M. Giselle Fernandez-Godino, Walter Nissen, Meir H. Shachar, Dane M. Sterbentz, William J. Schill, Yue Hao, Robert Rieben, William Quadros, Steve Owen, Scott Mitchell, Ismael D. Boureima, Jonathan L. Belof

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 MADA框架通过多智能体协作实现自动化设计探索,专注于惯性约束聚变中的RMI抑制问题,利用HPC系统和机器学习替代方案提升设计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10052 2026-03-12 cs.RO cs.LG 57%

OmniGuide: Universal Guidance Fields for Enhancing Generalist Robot Policies

OmniGuide: 通用引导场用于增强通用机器人策略

Yunzhou Song, Long Le, Yong-Hyun Park, Jie Wang, Junyao Shi, Lingjie Liu, Jiatao Gu, Eric Eaton, Dinesh Jayaraman, Kostas Daniilidis

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 OMNIGUIDE通过整合多种引导源提升通用机器人策略在复杂任务中的性能

Comments Project Page: $\href{https://omniguide.github.io/}{this\; url}$

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07970 2026-03-10 cs.AI 57%

Advancing Automated Algorithm Design via Evolutionary Stagewise Design with LLMs

通过基于大语言模型的进化分阶段设计推进自动化算法设计

Chen Lu, Ke Xue, Chengrui Gao, Yunqi Shi, Siyuan Xu, Mingxuan Yuan, Chao Qian, Zhi-Hua Zhou

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) Huawei Noah’s Ark Lab, China(华为诺亚实验室)

专题命中 视觉空间推理 :CoT(abstract);分类 cs.AI

AI总结 本文提出EvoStage方法,通过分阶段进化设计提升自动化算法设计效率,实现超越人类专家和现有LLM方法的性能。

Comments 28 pages, 19 figures and 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06704 2026-03-10 cs.CV cs.LG 57%

On the Generalization Capacities of MLLMs for Spatial Intelligence

关于多模态大语言模型在空间智能中的泛化能力

Gongjie Zhang, Wenhao Li, Quanhao Qian, Jiuniu Wang, Deli Zhao, Shijian Lu, Ran Xu

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) HuPan Lab(虎朋实验室) Nanyang Technological University(南洋理工大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出Camera-Aware MLLM框架,通过注入相机内参、数据增强和蒸馏几何先验,提升多模态大语言模型在空间任务中的泛化能力与鲁棒性。

Comments ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06090 2026-03-09 cs.CV cs.CL 57%

DeepSight: Bridging Depth Maps and Language with a Depth-Driven Multimodal Model

DeepSight: 通过深度驱动的多模态模型连接深度图与语言

Hao Yang, Hongbo Zhang, Yanyan Zhao, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 DeepSight通过深度驱动的多模态模型提升三维场景理解,利用深度图像特性增强空间推理能力,并通过新数据集和模型改进实现了深度感知和任务性能的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13386 2026-03-09 cs.RO cs.LG 57%

VEGA: Electric Vehicle Navigation Agent via Physics-Informed Neural Operator and Proximal Policy Optimization

VEGA:基于物理信息神经算子和近端策略优化的电动汽车导航代理

Hansol Lim, Minhyeok Im, Jonathan Boyack, Jee Won Lee, Jongseong Brad Choi

机构 * Department of Mechanical Engineering, State University of New York(机械工程系,纽约州立大学) Department of Computer Science, State University of New York(计算机科学系,纽约州立大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

AI总结 VEGA通过结合物理信息神经算子和近端策略优化,为电动汽车提供高效的能耗感知导航方案,实现快速路径规划和充电站点选择。

Comments This work has been submitted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04128 2026-03-05 cs.CV cs.AI cs.MM 57%

Crab$^{+}$: A Scalable and Unified Audio-Visual Scene Understanding Model with Explicit Cooperation

Crab$^{+}$: 一种可扩展且统一的音频视觉场景理解模型,具有显式合作

Dongnuan Cai, Henghui Du, Chang Zhou, Xi Chen, Dan Guo, Hongyuan Zhang, Xuelong Li, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学耿丽人工智能学院) Institute of Artificial Intelligence of China Telecom (TeleAI)(中国电信人工智能研究院) AI Technology Center, Online Video Business Unit, Tencent PCG(腾讯PCG在线视频业务单元AI技术中心) Hefei University of Technology(合肥工业大学) The University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 Crab$^{+}$通过显式合作解决音频视觉任务异质性问题,实现更广泛的任务覆盖和优于单任务模型的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03946 2026-03-05 cs.LG 57%

Lang2Str: Two-Stage Crystal Structure Generation with LLMs and Continuous Flow Models

Lang2Str: 基于LLM和连续流模型的双阶段晶体结构生成

Cong Liu, Chengyue Gong, Zhenyu Liu, Jiale Zhao, Yuxuan Zhang

机构 * AMLab, AI4Science Lab University of Amsterdam(AMLab、AI4Science Lab 阿姆斯特丹大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 Lang2Str通过结合LLM和流模型,实现灵活且精确的晶体结构生成,提升材料设计的效率和定制性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10833 2026-03-04 cs.LG 57%

SURFACEBENCH: A Geometry-Aware Benchmark for Symbolic Surface Discovery

SURFACEBENCH:一种面向几何的符号表面发现基准

Sanchit Kabra, Shobhnik Kriplani, Parshin Shojaee, Chandan K. Reddy

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 SURFACEBENCH是一个面向几何的符号表面发现基准,通过多变量耦合、坐标变换和几何结构推断,评估不同方法在符号发现中的性能。

Comments TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01426 2026-03-03 cs.CL 57%

Understanding the Physics of Key-Value Cache Compression for LLMs through Attention Dynamics

通过注意力动态理解LLMs中键值缓存压缩的物理原理

Samhruth Ananthanarayanan, Ayan Sengupta, Tanmoy Chakraborty

机构 * IIT Delhi, India(德里印度理工学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 通过分析LLMs中键值缓存压缩的物理机制,揭示了压缩对内部表示和语义可达性的影响,以及不同架构在路由动态上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11758 2026-03-03 q-bio.QM cs.AI 57%

Protein Structure Tokenization via Geometric Byte Pair Encoding

通过几何字对编码进行蛋白质结构分词

Michael Sun, Weize Yuan, Gang Liu, Wojciech Matusik, Marinka Zitnik

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Harvard Medical School(哈佛医学院) Apple(苹果公司) Notre Dame(诺特大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 GeoBPE通过几何字对编码实现蛋白质结构分词,提供压缩、数据效率和泛化能力,支持多架构应用并增强功能解释性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13314 2026-02-25 cs.CV cs.AI 57%

Sim2Radar: Toward Bridging the Radar Sim-to-Real Gap with VLM-Guided Scene Reconstruction

Sim2Radar:通过VLM引导的场景重建弥合雷达仿真到现实的差距

Emily Bejerano, Federico Tondolo, Ayaan Qayyum, Xiaofan Yu, Xiaofan Jiang

机构 * Columbia University(哥伦比亚大学) University of California, Merced(加州大学默塞德分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 Sim2Radar通过VLM引导的场景重建,利用合成数据提升雷达感知性能,实现3D AP提升3.7个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17779 2026-02-24 cs.CV cs.LG 57%

U2-BENCH: Benchmarking Large Vision-Language Models on Ultrasound Understanding

U2-BENCH:在超声理解上评估大视觉-语言模型的基准测试

Anjie Le, Henan Liu, Yue Wang, Zhenyu Liu, Rongkun Zhu, Taohan Weng, Jinze Yu, Boyang Wang, Yalun Wu, Kaiwen Yan, Quanlin Sun, Meirui Jiang, Jialun Pei, Siya Liu, Haoyun Zheng, Zhoujun Li, Alison Noble, Jacques Souquet, Xiaoqing Guo, Manxi Lin, Hongcheng Guo

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 U2-BENCH首次提出评估大视觉-语言模型在超声理解上的基准测试,涵盖分类、检测、回归和文本生成任务,评估23种最新模型,揭示其在图像分类上的优势及在空间推理和临床语言生成上的挑战。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18981 2026-02-24 cs.AI 57%

How Far Can We Go with Pixels Alone? A Pilot Study on Screen-Only Navigation in Commercial 3D ARPGs

仅凭像素能走多远?对商业3DARPG中纯屏幕导航的初步研究

Kaijie Xu, Mustafa Bugti, Clark Verbrugge

机构 * McGill University(麦吉尔大学) Connecticut College(康奈尔学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出纯屏幕导航代理,通过视觉可能性探索3DARPG关卡,初步实验显示其导航能力,但受限于视觉模型的不足,无法实现全面自动导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18884 2026-02-24 cs.AI 57%

TPRU: Advancing Temporal and Procedural Understanding in Large Multimodal Models

TPRU: 推动大型多模态模型中的时序与过程理解

Zhenkun Gao, Xuhong Wang, Xin Tan, Yuan Xie

机构 * East China Normal University(东华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 TPRU通过引入大规模多模态数据集和强化学习微调方法,显著提升大型模型在时序和过程理解上的表现,达到当前最先进的准确率。

Comments Accepted to ICLR 2026. 17 pages. Code, data, and models are available at: https://github.com/Stephen-gzk/TPRU

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18745 2026-02-24 cs.CV cs.AI 57%

Synthesizing Multimodal Geometry Datasets from Scratch and Enabling Visual Alignment via Plotting Code

从零开始合成多模态几何数据集并借助绘图代码实现视觉对齐

Haobo Lin, Tianyi Bai, Chen Chen, Jiajun Zhang, Bohan Zeng, Wentao Zhang, Binhang Yuan

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出GeoCode数据集,通过代码预测实现视觉对齐,提升多模态几何推理性能。

Comments 58 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18630 2026-02-24 cs.HC cs.AI 57%

Lost in Instructions: Study of Blind Users' Experiences with DIY Manuals and AI-Rewritten Instructions for Assembly, Operation, and Troubleshooting of Tangible Products

迷失在指令中:对盲人用户使用DIY手册和AI重写指令进行实物产品组装、操作和故障排除经验的研究

Monalika Padma Reddy, Aruna Balasubramanian, Jiawei Zhou, Xiaojun Bi, IV Ramakrishnan, Vikas Ashok

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨盲人用户在使用DIY手册和AI生成的指令进行实物产品组装、操作和故障排除时的体验,发现现有工具不足,需改进以提供更有效的指导。

Comments 28 pages incl. references, 7 figures. Full paper submission to CHI 2026. IRB-approved semi-structured interview and usability study with 15 blind participants

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01696 2026-02-24 cs.CV cs.AI 57%

Cross-Modal Purification and Fusion for Small-Object RGB-D Transmission-Line Defect Detection

跨模态净化与融合用于小物体RGB-D传输线缺陷检测

Jiaming Cui, Wenqiang Li, Shuai Zhou, Ruifeng Qin, Feng Shen

机构 * School of Mechatronics Engineering, Harbin Institute of Technology(机械电子工程学院,哈尔滨工业大学) School of Instrument Science and Engineering, Harbin Institute of Technology(仪器科学与工程学院,哈尔滨工业大学) Electric Power Research Institute, Yunnan Power Grid Co., Ltd.(电力研究院,云南电网公司)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 CMAFNet通过跨模态净化与融合技术,提升小物体RGB-D传输线缺陷检测的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17116 2026-02-20 cs.AI 57%

Epistemology of Generative AI: The Geometry of Knowing

生成AI的形而上学:认知的几何学

Ilya Levin

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于高维几何空间的指涉认识论,重新定义生成模型为流形导航者,引入导航知识作为知识生产的第三种模式。

Comments 27

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16105 2026-02-19 cs.AI 57%

GPSBench: Do Large Language Models Understand GPS Coordinates?

GPSBench: 大型语言模型是否理解GPS坐标?

Thinh Hung Truong, Jey Han Lau, Jianzhong Qi

机构 * University of Melbourne(墨尔本大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 GPSBench通过评估14种LLMs在地理空间推理中的表现,揭示了其在GPS坐标理解和现实地理推理上的挑战与差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13476 2026-02-17 cs.RO cs.LG 57%

AsyncVLA: An Asynchronous VLA for Fast and Robust Navigation on the Edge

AsyncVLA: 一种异步VLA用于边缘设备上的快速稳健导航

Noriaki Hirose, Catherine Glossop, Dhruv Shah, Sergey Levine

机构 * University of California, Berkeley(加州大学伯克利分校) Toyota Motor North America(丰田汽车北美公司) Princeton University(普林斯顿大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 AsyncVLA通过异步框架结合远程大模型与本地轻量级模块,实现边缘设备上的高效稳健导航,成功率达40%。

Comments 13 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11706 2026-02-13 cs.CV cs.AI cs.RO 57%

LLM-Driven 3D Scene Generation of Agricultural Simulation Environments

基于大语言模型的农业模拟环境3D场景生成

Arafa Yoncalik, Wouter Jansen, Nico Huebel, Mohammad Hasan Rahmani, Jan Steckel

机构 * Faculty of Applied Engineering – Dept. of Electronics and ICT, University of Antwerp(应用工程学院——电子与信息通信技术系,安特卫普大学) Flanders Make Strategic Research Centre(弗拉芒制造战略研究中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于多LLM流水线的农业模拟环境3D场景生成方法,通过模块化设计提升领域特定场景生成的可靠性与精度。

Comments Accepted at IEEE Conference on Artificial Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11598 2026-02-13 cs.RO cs.AI cs.CV 57%

ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation

ABot-N0:关于VLA基础模型在多功能具身导航中的技术报告

Zedong Chu, Shichao Xie, Xiaolong Wu, Yanfen Shen, Minghua Luo, Zhengbo Wang, Fei Liu, Xiaoxu Leng, Junjun Hu, Mingyang Yin, Jia Lu, Yingnan Guo, Kai Yang, Jiawei Han, Xu Chen, Yanqing Zhu, Yuxiang Zhao, Xin Liu, Yirong Yang, Ye He, Jiahang Wang, Yang Cai, Tianlin Zhang, Li Gao, Liu Liu, Mingchao Sun, Fan Jiang, Chiyu Wang, Zhicheng Liu, Hongyu Pan, Honglin Han, Zhining Gu, Kuan Yang, Jianfang Zhang, Di Jing, Zihao Guan, Wei Guo, Guoqing Liu, Di Yang, Xiangpo Yang, Menglin Yang, Hongguang Xing, Weiguo Li, Mu Xu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 ABot-N0通过统一的VLA基础模型实现多功能具身导航,结合认知大脑与动作专家架构,在多个基准测试中超越专用模型,支持动态环境中的长周期任务。

Comments Project Page: https://amap-cvlab.github.io/ABot-Navigation/ABot-N0/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00148 2026-02-13 cs.CV cs.AI 57%

Learning Physics-Grounded 4D Dynamics with Neural Gaussian Force Fields

基于神经高斯力场的学习物理 grounded 4D 动力学

Shiqian Li, Ruihong Shen, Junfeng Ni, Chang Pan, Chi Zhang, Yixin Zhu

机构 * Institute for AI, Peking University(北京大学人工智能研究院) School of Psychological and Cognitive Sciences, Peking University(北京大学心理学与认知科学学院) School of EECS, Peking University(北京大学电子工程学院) Department of Automation, Tsinghua University(清华大学自动化系) Yuanpei College, Peking University(北京大学元培学院) State Key Lab of General AI, Peking University(北京大学通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京行为与心理健康重点实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出神经高斯力场(NGFF),通过结合3D高斯感知与物理动力学建模,从多视角RGB输入生成交互式、物理真实的4D视频,提升视频预测的物理 grounded 性。

Comments 43 pages, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09701 2026-02-11 cs.CV cs.AI 57%

GenSeg-R1: RL-Driven Vision-Language Grounding for Fine-Grained Referring Segmentation

GenSeg-R1: 通过强化学习驱动的视觉-语言接地进行细粒度指称分割

Sandesh Hegde, Jaison Saji Chacko, Debarshi Banerjee, Uma Mahesh

机构 * Camcom Technologies Pvt. Ltd.(Camcom技术有限公司)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 GenSeg-R1 通过强化学习驱动的视觉-语言接地方法,在细粒度指称分割任务中实现了优于基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08448 2026-02-10 cs.CV cs.AI 57%

Vista: Scene-Aware Optimization for Streaming Video Question Answering under Post-Hoc Queries

Vista:面向事后查询的场景感知流视频问答优化

Haocheng Lu, Nan Zhang, Wei Tao, Xiaoyang Qu, Guokuan Li, Jiguang Wan, Jianzong Wang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 Vista通过场景感知分割、压缩和召回技术,实现了高效且可扩展的流视频问答,提升了长上下文推理能力,同时保持低延迟和内存效率。

Comments Accepted to AAAI 2026 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07277 2026-02-10 cs.CV cs.LG 57%

Cross-View World Models

跨视角世界模型

Rishabh Sharma, Gijs Hogervorst, Wayne E. Mackey, David J. Heeger, Stefano Martiniani

机构 * Simons Center for Computational Physical Chemistry(Simon计算物理化学中心) Center for Soft Matter Research, Department of Physics(软物质研究中心,物理系) Statespace Labs, Inc.(Statespace公司) Center for Neural Science, New York University(神经科学中心,纽约大学) Department of Psychology, New York University(心理学系,纽约大学) Courant Institute of Mathematical Sciences, New York University(Courant数学科学研究所,纽约大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

AI总结 本文提出跨视角世界模型,通过多视角预测训练智能体在不同视角下进行规划,提升空间感知与多智能体协作能力。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22894 2026-02-09 cs.CR cs.AI 57%

DECEPTICON: How Dark Patterns Manipulate Web Agents

DECEPTICON:暗模式如何操纵网络代理

Phil Cuvin, Hao Zhu, Diyi Yang

机构 * Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 DECEPTICON研究揭示暗模式通过引导代理轨迹对网络代理构成重大风险,表明需加强防御措施以应对操纵性设计。

详情

展开后加载摘要…

URL PDF HTML 收藏