arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-17 至 2026-02-17 共收录 166 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 48 篇

2602.14225 2026-02-17 cs.AI 57%

Text Before Vision: Staged Knowledge Injection Matters for Agentic RLVR in Ultra-High-Resolution Remote Sensing Understanding

文本优先于视觉:针对超高清遥感理解的代理强化学习在超高清遥感理解中的知识注入至关重要

Fengxiang Wang, Mingshuo Chen, Yueying Li, Yajie Yang, Yuhao Zhou, Di Wang, Yifan Zhang, Haoyu Wang, Haiyan Zhao, Hongda Sun, Long Lan, Jun Song, Yulin Wang, Jing Zhang, Wenlong Zhang, Bo Du

机构 * National University of Defense Technology, China(国防科技大学) Beijing University of Posts and Telecommunications, China(北京邮电大学) University of the Chinese Academy of Sciences, China(中国科学院大学) Sichuan University, China(四川大学) Wuhan University, China(武汉大学) Chinese Academy of Science, China(中国科学院) Tsinghua University, China(清华大学) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室) Renmin University of China, China(中国人民大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出分阶段知识注入方法,利用文本引导提升超高清遥感理解的视觉推理能力,实现XLRS-Bench上的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13802 2026-02-17 cs.LG 57%

Cast-R1: Learning Tool-Augmented Sequential Decision Policies for Time Series Forecasting

Cast-R1:学习工具增强的序列决策策略用于时间序列预测

Xiaoyu Tao, Mingyue Cheng, Chuang Jiang, Tian Gao, Huanjian Zhang, Yaguo Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 Cast-R1通过工具增强的代理工作流程,学习序列决策策略以提升时间序列预测的准确性与适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05354 2026-02-17 cs.AI 57%

PATHWAYS: Evaluating Investigation and Context Discovery in AI Web Agents

PATHWAYS:评估人工智能网络代理中的调查与上下文发现

Shifat E. Arman, Syed Nazmus Sakib, Tapodhir Karmakar Taton, Nafiul Haque, Shahrear Bin Amin

机构 * Robotics and Mechatronics Engineering, University of Dhaka, Dhaka, Bangladesh(机器人与机电工程系,达卡大学,达卡,孟加拉国)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 PATHWAYS评估了人工智能网络代理在多步骤任务中发现和利用隐藏上下文的能力,揭示了当前架构在适应性调查和判断覆盖方面的不足。

Comments 35 pages, 13 figures

Journal ref Under Review in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22391 2026-02-17 cs.CV cs.AI 57%

Top-Down Semantic Refinement for Image Captioning

自上而下语义细化用于图像描述生成

Jusheng Zhang, Kaitong Cai, Jing Yang, Jian Wang, Chengpei Tang, Keze Wang

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 自上而下语义细化通过高效MCTS算法提升图像描述生成的性能与质量

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16730 2026-02-17 cs.CR cs.AI 57%

RapidPen: Fully Automated IP-to-Shell Penetration Testing with LLM-based Agents

RapidPen: 基于大语言模型的完全自动化IP到Shell渗透测试框架

Sho Nakatani

机构 * SecDevLab Inc(SecDevLab公司)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 RapidPen基于大语言模型实现完全自动化IP到Shell渗透测试,通过任务规划与反馈循环高效发现并利用漏洞,降低安全测试成本与门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11047 2026-02-17 cs.RO cs.AI 57%

Enhancing Supermarket Robot Interaction: A Multi-Level LLM Conversational Interface for Handling Diverse Customer Intents

增强超市机器人交互:一种多层级LLM对话接口用于处理多样化客户意图

Chandran Nandkumar, Luka Peternel

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出多层级LLM接口提升超市机器人处理多样化客户意图的效率与性能。

Journal ref Frontiers in Robotics and AI, Volume 12, 1576348, April 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13568 2026-02-17 cs.AI 57%

Who Do LLMs Trust? Human Experts Matter More Than Other LLMs

LLMs信任谁?人类专家比其他LLMs更重要

Anooshka Bajaj, Zoran Tiganj

机构 * Department of Computer Science, Indiana University Bloomington(计算机科学系,印第安纳大学布卢明顿分校) Department of Psychological and Brain Science, Indiana University Bloomington(心理学与脑科学系,印第安纳大学布卢明顿分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究LLMs在面对人类专家与其他LLMs反馈时的可信度影响,发现LLMs更倾向于信任人类专家的反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13312 2026-02-17 cs.MA cs.AI 57%

PeroMAS: A Multi-agent System of Perovskite Material Discovery

PeroMAS:钙钛矿材料发现的多智能体系统

Yishu Wang, Wei Liu, Yifan Li, Shengxiang Xu, Xujie Yuan, Ran Li, Yuyu Luo, Jia Zhu, Shimin Di, Min-Ling Zhang, Guixiang Li

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院) School of Materials Science and Engineering, Southeast University, Nanjing, China(东南大学材料科学与工程学院) School of Artificial Intelligence, Sun Yat-Sen University, Zhuhai, China(中山大学人工智能学院) Information Hub, Hong Kong University of Science and Technology (Guangzhou), Guangzhou, China(香港科技大学(广州)信息中心) School of Computer Science and Engineering, Zhejiang Normal University, Jinhua, China(浙江师范大学计算机科学与工程学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 PeroMAS通过多智能体系统实现钙钛矿材料的多目标优化发现,提升材料发现效率并验证其在现实中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13273 2026-02-17 cs.DB cs.AI cs.DC 57%

MergePipe: A Budget-Aware Parameter Management System for Scalable LLM Merging

MergePipe: 一种面向可扩展大语言模型融合的预算感知参数管理系统

Yuanyi Wang, Yanggan Gu, Zihao Wang, Kunxi Li, Yifan Yang, Zhaoyi Yan, Congkai Xie, Jianmin Wu, Hongxia Yang

机构 * Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 MergePipe通过预算感知的参数管理实现高效的大语言模型融合,减少I/O并提升整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01848 2026-02-17 cs.AI cs.MA 57%

ROMA: Recursive Open Meta-Agent Framework for Long-Horizon Multi-Agent Systems

ROMA:递归开放元代理框架用于长周期多代理系统

Salaheddin Alzu'bi, Baran Nama, Arda Kaz, Anushri Eswaran, Weiyuan Chen, Sarvesh Khetan, Rishab Bala, Tu Vu, Sewoong Oh

机构 * Sentient Virginia Tech(弗吉尼亚理工大学) UC Berkeley(加州大学伯克利分校) UC San Diego(加州大学圣地亚哥分校) University of Maryland(马里兰大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 ROMA通过递归任务分解和结构化聚合,实现长周期多代理系统的高效推理和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14153 2026-02-17 cs.CV 50%

ARport: An Augmented Reality System for Markerless Image-Guided Port Placement in Robotic Surgery

ARport:一种用于无标记图像引导腹腔镜器械放置的增强现实系统

Zheng Han, Zixin Yang, Yonghao Long, Lin Zhang, Peter Kazanzides, Qi Dou

机构 * Cornerstone Robotics Ltd.(Cornerstone Robotics有限公司)

专题命中 规划推理 :planning(abstract)

AI总结 ARport是一种无标记增强现实系统,用于在患者身体表面直观指导腹腔镜器械的术前规划与术中放置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13868 2026-02-17 cs.NI cs.IR 50%

Agentic Assistant for 6G: Turn-based Conversations for AI-RAN Hierarchical Co-Management

6G代理助手:基于回合的对话用于AI-RAN分层协同管理

Udhaya Srinivasan, Weisi Guo

专题命中 规划推理 :planning(abstract)

AI总结 本文提出了一种基于回合的对话助手,用于AI-RAN的分层协同管理,通过三层架构实现高效网络管理和降低运营成本。

Comments submitted to IEEE conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08417 2026-02-17 cs.RO 50%

ORACLE-Grasp: Zero-Shot Affordance-Aligned Robotic Grasping using Large Multimodal Models

ORACLE-Grasp: 基于大多模态模型的零样本 affordance 对齐机器人抓取

Avihai Giuili, Rotem Atari, Avishai Sintov

专题命中 规划推理 :reasoning(abstract)

AI总结 ORACLE-Grasp 利用大多模态模型实现零样本抓取,通过语义对齐提升抓取准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 11 篇

2602.04856 2026-02-17 cs.CL 89%

CoT is Not the Chain of Truth: An Empirical Internal Analysis of Reasoning LLMs for Fake News Generation

CoT并非真理链:对用于虚假新闻生成的推理LLM的实证内部分析

Zhao Tong, Chunlin Gong, Yiping Zhang, Haichao Shi, Qiang Liu, Xingcheng Xu, Shu Wu, Xiao-Yu Zhang

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 研究揭示推理LLM在生成虚假新闻时,即使拒绝有害请求,其内部推理仍可能传播不安全内容,通过分析框架和指标揭示潜在风险并挑战安全假设。

Comments 28 pages, 35 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15987 2026-02-17 cs.LG cs.AI 81%

Algorithmic Primitives and Compositional Geometry of Reasoning in Language Models

语言模型中推理的算法原语与组合几何

Samuel Lippl, Thomas McGee, Kimberly Lopez, Ziwen Pan, Pierce Zhang, Salma Ziadi, Oliver Eberle, Ida Momennejad

机构 * Microsoft Research NYC(微软研究院纽约分部) Center for Theoretical Neuroscience(理论神经科学中心) Department of Psychology(心理学系) University of California Los Angeles(加州大学洛杉矶分校) Institute for Pure and Applied Mathematics(纯粹与应用数学研究所) Emory University(埃默里大学) Rice University(里士满大学) Mount Holyoke College(马里兰霍克学院) Technische Universität Berlin(柏林技术大学) BIFOLD-Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过分析语言模型中的算法原语,揭示其推理过程的组合几何结构,并展示原语在跨任务和跨模型中的可迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10551 2026-02-17 cs.CV cs.AI 79%

C^2ROPE: Causal Continuous Rotary Positional Encoding for 3D Large Multimodal-Models Reasoning

C^2ROPE: 3D 大多模态模型推理中的因果连续旋转位置编码

Guanting Ye, Qiyan Zhao, Wenhao Yu, Xiaofeng Zhang, Jianmin Ji, Yanyong Zhang, Ka-Veng Yuen

机构 * State Key Laboratory of Internet of Things for Smart City, University of Macau(物联网智能城市国家重点实验室,澳门大学) Department of Automation, Shanghai Jiaotong University(上海交通大学自动化系) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) School of Computer Science and Technology, USTC(中国科学技术大学计算机科学与技术学院) School of Artificial Intelligence and Data Science, USTC(中国科学技术大学人工智能与数据科学学院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 C^2ROPE通过引入空间-时间连续位置编码和切比雪夫因果掩码,解决3D多模态模型中视觉特征连续性和因果关系建模问题。

Comments Accepted in ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14119 2026-02-17 cs.CV 78%

GeoFusionLRM: Geometry-Aware Self-Correction for Consistent 3D Reconstruction

GeoFusionLRM: 基于几何的自我校正以实现一致的3D重建

Ahmet Burak Yildirim, Tuna Saygin, Duygu Ceylan, Aysegul Dundar

机构 * Bilkent University(比尔肯特大学) Adobe Research(Adobe研究)

专题命中 视觉空间推理 :self-correction(title,abstract)

AI总结 GeoFusionLRM通过反馈几何信息提升单图像3D重建的几何精度与一致性

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14974 2026-02-17 cs.RO 75%

DM0: An Embodied-Native Vision-Language-Action Model towards Physical AI

DM0:一种面向物理AI的具身原生视觉-语言-动作模型

En Yu, Haoran Lv, Jianjian Sun, Kangheng Lin, Ruitao Zhang, Yukang Shi, Yuyang Chen, Ze Chen, Ziheng Zhang, Fan Jia, Kaixin Liu, Meng Zhang, Ruitao Hao, Saike Huang, Songhan Xie, Yu Liu, Zhao Wu, Bin Xie, Pengwei Zhang, Qi Yang, Xianchi Deng, Yunfei Wei, Enwen Zhang, Hongyang Peng, Jie Zhao, Kai Liu, Wei Sun, Yajun Wei, Yi Yang, Yunqiao Zhang, Ziwei Yan, Haitao Yang, Hao Liu, Haoqiang Fan, Haowei Zhang, Junwen Huang, Yang Chen, Yunchao Ma, Yunhuan Yang, Zhengyuan Du, Ziming Liu, Jiahui Niu, Yucheng Zhao, Daxin Jiang, Wenbin Tang, Xiangyu Zhang, Zheng Ge, Erjin Zhou, Tiancai Wang

机构 * DM0 Team(DM0团队) Dexmal StepFun

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 DM0提出了一种面向物理AI的具身原生视觉-语言-动作模型,通过统一具身操作和导航,结合预训练、中训练和后训练流程,实现对复杂物理任务的高效处理。

Comments Authors are listed in alphabetical order. Code is available at https://github.com/Dexmal/dexbotic

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11858 2026-02-17 cs.CV cs.AI cs.CL cs.LG 67%

Zooming without Zooming: Region-to-Image Distillation for Fine-Grained Multimodal Perception

无需缩放:用于细粒度多模态感知的区域到图像蒸馏

Lai Wei, Liangbo He, Jun Lan, Lingzhong Dong, Yutong Cai, Siyuan Li, Huijia Zhu, Weiqiang Wang, Linghe Kong, Yue Wang, Zhuosheng Zhang, Weiran Huang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Zhongguancun Academy(中关村学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出区域到图像蒸馏方法,通过训练时间内化代理缩放能力,提升细粒度多模态感知性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13476 2026-02-17 cs.RO cs.LG 57%

AsyncVLA: An Asynchronous VLA for Fast and Robust Navigation on the Edge

AsyncVLA: 一种异步VLA用于边缘设备上的快速稳健导航

Noriaki Hirose, Catherine Glossop, Dhruv Shah, Sergey Levine

机构 * University of California, Berkeley(加州大学伯克利分校) Toyota Motor North America(丰田汽车北美公司) Princeton University(普林斯顿大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 AsyncVLA通过异步框架结合远程大模型与本地轻量级模块,实现边缘设备上的高效稳健导航,成功率达40%。

Comments 13 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13909 2026-02-17 cs.RO cs.CV 50%

High-fidelity 3D reconstruction for planetary exploration

高保真行星探测的3D重建

Alfonso Martínez-Petersen, Levin Gerdes, David Rodríguez-Martínez, C. J. Pérez-del-Pulgar

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出了一种结合NeRF和高斯点绘的自动化3D重建管道,用于在极端环境下实现高保真的行星探测

Comments 7 pages, 3 figures, conference paper

Journal ref IEEE Conference on Artificial Intelligence (CAI) 2026, Special Session on AI for Space Exploration

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13479 2026-02-17 cs.CV cs.HC 50%

GLIMPSE : Real-Time Text Recognition and Contextual Understanding for VQA in Wearables

GLIMPSE:面向可穿戴设备的实时文本识别与上下文理解的视频大语言模型

Akhil Ramachandran, Ankit Arun, Ashish Shenoy, Abhay Harpale, Srihari Jayakumar, Debojeet Chatterjee, Mohsen Moslehpour, Pierce Chuang, Yichao Lu, Vikas Bhardwaj, Peyman Heidari

机构 * Meta Reality Labs(Meta现实实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 GLIMPSE通过混合架构在可穿戴设备上实现低功耗的实时文本识别与上下文理解,提升视频大语言模型在资源受限设备上的VQA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04419 2026-02-17 cs.RO 50%

Integrated Exploration and Sequential Manipulation on Scene Graph with LLM-based Situated Replanning

基于场景图的LLM定位再规划集成探索与顺序操作

Heqing Yang, Ziyuan Jiao, Shu Wang, Yida Niu, Si Liu, Hangxin Liu

机构 * Beihang University(北航大学) State Key Laboratory of General Artificial Intelligence(一般人工智能国家重点实验室) University of California, Los Angeles(加州大学洛杉矶分校) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 视觉空间推理 :planning(abstract)

AI总结 EPoG通过结合基于图的全局规划器与LLM的定位局部规划器,实现探索与顺序操作规划的无缝结合,有效提升机器人在部分已知环境中的任务执行效率。

Comments 8 pages, 7 figures; accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10080 2026-02-17 cs.CV 50%

BEVTraj: Map-Free End-to-End Trajectory Prediction in Bird's-Eye View with Deformable Attention and Sparse Goal Proposals

BEVTraj: 无地图端到端鸟瞰图轨迹预测方法,采用可变形注意力和稀疏目标提案

Minsang Kong, Myeongjun Kim, Sang Gu Kang, Hejiu Lu, Yupeng Zhong, Sang Hun Lee

机构 * Department of Automobile and IT Convergence, Kookmin University(汽车与IT融合系,韩国釜山大学) Department of Automotive Engineering, Kookmin University(汽车工程系,韩国釜山大学) Graduate School of Automobile and Mobility, Kookmin University(汽车与移动研究生院,韩国釜山大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 BEVTraj通过可变形注意力和稀疏目标提案实现无地图端到端鸟瞰图轨迹预测,提升自动驾驶的鲁棒性和灵活性。

Comments Submitted to IEEE Transactions on Intelligent Transportation Systems (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 10 篇

2506.08672 2026-02-17 cs.CL cs.AI cs.LG 82%

RuleReasoner: Reinforced Rule-based Reasoning via Domain-aware Dynamic Sampling

RuleReasoner: 基于领域感知动态采样的强化规则推理

Yang Liu, Jiaqi Li, Zilong Zheng

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RuleReasoner通过领域感知动态采样方法提升规则推理性能,优于现有大型推理模型。

Comments ICLR 2026 camera ready, 28 pages, 10 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14428 2026-02-17 cs.CL 79%

LLM-Guided Knowledge Distillation for Temporal Knowledge Graph Reasoning

基于大语言模型的知识蒸馏的时序知识图谱推理

Wang Xing, Wei Song, Siyu Lin, Chen Wu, Man Wang

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) School of Information Science and Engineering, Chongqing Jiaotong University(重庆交通大学信息科学与工程学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一种基于大语言模型的知识蒸馏框架,用于提升时序知识图谱推理性能,通过引入大语言模型作为辅助指导者,实现更高效的模型压缩与训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15005 2026-02-17 cs.CL cs.IR 74%

Learning User Interests via Reasoning and Distillation for Cross-Domain News Recommendation

通过推理和蒸馏学习用户兴趣以实现跨领域新闻推荐

Mengdan Zhu, Yufan Zhao, Tao Di, Yulan Yan, Liang Zhao

机构 * Microsoft(微软公司) Emory University(埃默里大学)

专题命中 测试时计算 :reasoning(title);分类 cs.CL

AI总结 本文提出通过推理和蒸馏学习用户兴趣的方法,提升跨领域新闻推荐的性能和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13248 2026-02-17 cs.AI cs.CL cs.RO 73%

X-Blocks: Linguistic Building Blocks of Natural Language Explanations for Automated Vehicles

X-Blocks: 自然语言解释的语义构建块用于自动驾驶车辆

Ashkan Y. Zadeh, Xiaomeng Li, Andry Rakotonirainy, Ronald Schroeter, Sebastien Glaser, Zishuo Zhu

机构 * Queensland University of Technology (QUT)(昆士兰科技大学) ARC Training Centre for Automated Vehicles in Rural and Remote Regions (AVR3)(农村和偏远地区自动化车辆培训中心)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 X-Blocks框架通过分层分析识别自动驾驶车辆自然语言解释的构建块,提供场景感知解释的设计原则,提升透明性和用户信任。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14910 2026-02-17 cs.AI 70%

Position: Introspective Experience from Conversational Environments as a Path to Better Learning

位置:对话环境中的反思经验作为更好学习的路径

Claudiu Cristian Musat, Jackson Tolins, Diego Antognini, Jingling Li, Martin Klissarov, Tom Duerig

机构 * Google DeepMind(谷歌DeepMind)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 本文提出通过对话环境中的反思经验提升学习效果,强调社会互动对推理能力的培养作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20802 2026-02-17 cs.LG cs.AI 62%

Reinforcement Learning via Self-Distillation

通过自我蒸馏进行强化学习

Jonas Hübotter, Frederike Lübeck, Lejs Behric, Anton Baumann, Marco Bagatella, Daniel Marta, Ido Hakimi, Idan Shenfeld, Thomas Kleine Buening, Carlos Guestrin, Andreas Krause

机构 * ETH Zurich(苏黎世联邦理工学院) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) MIT(麻省理工学院) Stanford(斯坦福大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 通过自我蒸馏策略优化(SDPO)提升强化学习在可验证环境中的样本效率和准确性,利用自身反馈改进策略。

详情

展开后加载摘要…

URL PDF HTML 收藏