arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-18 至 2026-02-18 共收录 57 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3 篇

2505.11824 2026-02-18 cs.LG cs.AI 88%

Latent Veracity Inference for Identifying Errors in Stepwise Reasoning

潜在真实性推断用于识别逐步推理中的错误

Minsu Kim, Jean-Pierre Falet, Oliver E. Richardson, Xiaoyin Chen, Moksh Jain, Sungjin Ahn, Sungsoo Ahn, Yoshua Bengio

机构 * Mila – Québec AI Institute(魁北克人工智能研究所) KAIST(韩国科学技术院) Université de Montréal(蒙特利尔大学) LawZero(法零)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);self-correction(abstract)

AI总结 本文提出通过引入潜在真实性变量和Veracity Search算法,提升语言模型在逐步推理中的准确性和可信度,并通过Amortized Veracity Inference实现零样本真实性推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15260 2026-02-18 cs.LG cs.AI 76%

Fast and Effective On-policy Distillation from Reasoning Prefixes

基于推理前缀的高效在线策略蒸馏

Dongxu Zhang, Zhichao Yang, Sepehr Janghorbani, Jun Han, Andrew Ressler, Qian Qian, Gregory D. Lyng, Sanjit Singh Batra, Robert E. Tillman

专题命中 数学推理 :reasoning(title);分类 cs.AI、cs.LG

AI总结 本文提出基于推理前缀的在线策略蒸馏方法,通过仅对生成输出的前缀应用蒸馏目标并提前终止采样,有效降低训练成本,同时保持与完整OPD相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00539 2026-02-18 cs.CL cs.AI 62%

Intermittent Semi-Working Mask: A New Masking Paradigm for LLMs

间歇半工作掩码:一种新的LLM掩码范式

HaoYuan Hu, Mingcong Lu, Di Luo, XinYa Wu, Jiangcai Zhu, Taoye Yin, Zheng Li, Hao Wang, Shusheng Zhang, KeZun Zhang, KaiLai Shao, Chao Chen, Feng Wang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 间歇半工作掩码通过引入稀疏双向注意力,实现高效多轮对话和上下文密集型任务处理,同时保持推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2506.19923 2026-02-18 cs.AI cs.LG 62%

Prover Agent: An Agent-Based Framework for Formal Mathematical Proofs

Prover Agent:一个基于代理的正式数学证明框架

Kaito Baba, Chaoran Liu, Shuhei Kurita, Akiyoshi Sannai

机构 * The University of Tokyo, Tokyo, Japan(东京大学) National Institute of Informatics, Tokyo, Japan(日本信息处理学会) Research and Development Center for Large Language Models, National Institute of Informatics, Tokyo, Japan(大型语言模型研究开发中心) Kyoto University, Kyoto, Japan(京都大学) Shiga University, Shiga, Japan(滋贺大学) RIKEN Center for Advanced General Intelligence for Science Program, Kobe, Japan(理化学研究所高级一般智能科学项目中心) National Institute of Science Technology Policy (NISTEP), Tokyo, Japan(科学与技术政策国立研究所)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Prover Agent结合大语言模型与Lean,通过生成辅助引理提升形式证明效率,在MiniF2F和PutnamBench上取得新突破。

Comments 49 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 7 篇

2504.06438 2026-02-18 cs.CL cs.AI 85%

Don't Let It Hallucinate: Premise Verification via Retrieval-Augmented Logical Reasoning

不要让它幻觉:通过检索增强的逻辑推理进行前提验证

Yuehan Qin, Shawn Li, Yi Nian, Xinyan Velocity Yu, Yue Zhao, Xuezhe Ma

机构 * University of Southern California(南加州大学)

专题命中 逻辑推理 :reasoning(title);logical reasoning(title);分类 cs.CL、cs.AI

AI总结 本文提出一种基于检索增强的逻辑推理方法,用于在生成前验证用户查询中的前提,从而减少幻觉并提高事实准确性。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15336 2026-02-18 cs.AR 71%

Human-AI Interaction: Evaluating LLM Reasoning on Digital Logic Circuit included Graph Problems, in terms of creativity in design and analysis

人类-人工智能交互:评估LLM在包含图问题的数字逻辑电路中的推理能力,就设计和分析的创造性而言

Yogeswar Reddy Thota, Setareh Rafatirad, Homayoun Houman, Tooraj Nikoubin

专题命中 逻辑推理 :reasoning(title)

AI总结 评估LLM在数字逻辑电路问题中的推理能力,发现其在复杂问题上与官方答案存在差距,且易陷入教科书模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22211 2026-02-18 cs.CL cs.AI 62%

LogiPart: Local Large Language Models for Data Exploration at Scale with Logical Partitioning

LogiPart: 用于大规模数据探索的本地大语言模型与逻辑分区

Tiago Fernandes Tavares

机构 * Tiago Fernandes Tavares(独立研究者)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LogiPart通过本地大语言模型与逻辑分区技术,在大规模数据探索中实现高效、可解释的税目发现,克服传统方法的效率与成本限制。

Comments This version introduces a major architectural shift to Local LLMs and NLI-based assignment, scaling the framework to O(1) generative complexity. Formerly titled 'Question-Driven Analysis and Synthesis'

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15183 2026-02-18 cs.LG cs.CL 62%

Seeing to Generalize: How Visual Data Corrects Binding Shortcuts

看见以泛化:视觉数据如何纠正绑定捷径

Nicolas Buzeta, Felipe del Rio, Cristian Hinostroza, Denis Parra, Hans Lobel, Rodrigo Toro Icarte

机构 * Department of Computer Science, Pontificia Universidad Católica, Santiago, Chile(计算机科学系,天主教大学,圣地亚哥,智利)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 视觉数据训练可增强模型在单模态任务中的推理与泛化能力,通过改变绑定策略提升分布外性能。

Comments Submitted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15311 2026-02-18 cs.AI 57%

Aeon: High-Performance Neuro-Symbolic Memory Management for Long-Horizon LLM Agents

Aeon: 高性能神经符号记忆管理用于长时域大语言模型智能体

Mustafa Arslan

机构 * Independent Researcher(独立研究者)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 Aeon通过神经符号认知操作系统优化长时域大语言模型的记忆管理,实现高效内存压缩和加速,提升推理性能与稳定性。

Comments v3: Production hardening. Added INT8 quantization (5.6x dot product speedup, 3.1x compression), crash recovery via decoupled WAL (<1% overhead), unlimited text storage via sidecar blob arena with generational GC, and epoch-based reclamation for lock-free reads (P99 750ns under 16-thread contention). Revised for systems engineering clarity

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15294 2026-02-18 cs.AI 57%

EAA: Automating materials characterization with vision language model agents

EAA: 用视觉语言模型代理自动化材料表征

Ming Du, Yanqi Luo, Srutarshi Banerjee, Michael Wojcik, Jelena Popovic, Mathew J. Cherukara

机构 * Argonne National Laboratory(阿贡国家实验室) Advanced Photon Source(先进光子源) Data Science and Learning Division(数据科学与学习 division) Department of Radiation Oncology(放射肿瘤学系) Northwestern University(西北大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 EAA利用视觉语言模型代理自动化材料表征,通过多模态推理和工具增强操作提升显微镜实验效率,减少操作负担并降低用户专业门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15228 2026-02-18 cs.SE 50%

An Empirical Study on the Effects of System Prompts in Instruction-Tuned Models for Code Generation

对指令微调模型在代码生成中系统提示效果的实证研究

Zaiyu Cheng, Antonio Mastropaolo

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本研究探讨了系统提示对代码生成模型性能的影响,发现提示具体性与模型规模、编程语言等因素相关,且不同语言对提示敏感性存在差异。

Comments 34 pages, 12 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 15 篇

2602.15460 2026-02-18 cs.LG cs.CV 90%

On the Out-of-Distribution Generalization of Reasoning in Multimodal LLMs for Simple Visual Planning Tasks

在简单视觉规划任务中多模态大语言模型推理的分布外泛化

Yannic Neuhaus, Nicolas Flammarion, Matthias Hein, Francesco Croce

机构 * Tübingen AI Center -- University of Tübingen(图宾根人工智能中心 -- 图宾根大学) EPFL(瑞士联邦理工学院) ELLIS Institute Finland -- Aalto University(芬兰ELLIS研究所 -- 阿尔托大学)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 研究多模态大语言模型在简单视觉规划任务中推理能力的分布外泛化,发现结合多种文本格式的推理方法效果最佳,纯文本模型表现优于图像输入模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15549 2026-02-18 cs.RO cs.AI 83%

VLM-DEWM: Dynamic External World Model for Verifiable and Resilient Vision-Language Planning in Manufacturing

VLM-DEWM:动态外部世界模型用于制造中的可验证和抗毁视觉语言规划

Guoqin Tang, Qingxuan Jia, Gang Chen, Tong Li, Zeyuan Huang, Zihang Lv, Ning Ji

机构 * School of Intelligent Engineering and Automation(智能工程与自动化学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 VLM-DEWM通过动态外部世界模型提升制造中视觉语言规划的可验证性和抗毁性,显著提高状态跟踪精度和恢复成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18579 2026-02-18 cs.LG cs.AI q-bio.QM 81%

DrugReasoner: Interpretable Drug Approval Prediction with a Reasoning-augmented Language Model

DrugReasoner: 基于推理增强的语言模型的可解释药物审批预测

Mohammadreza Ghaffarzadeh-Esfahani, Ali Motahharynia, Nahid Yousefian, Navid Mazrouei, Jafar Ghaisari, Yousof Gheisari

机构 * Regenerative Medicine Research Center, Isfahan University of Medical Sciences(再生医学研究中心,伊斯法罕医科大学) Isfahan University of Medical Sciences(伊斯法罕医科大学) Isfahan Neuroscience Research Center, Isfahan University of Medical Sciences(伊斯法罕神经科学研究中心,伊斯法罕医科大学) Department of Electrical and Computer Engineering, Isfahan University of Technology(电气与计算机工程系,伊斯法罕技术大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 DrugReasoner通过推理增强的语言模型预测药物审批,实现高精度和可解释性,优于传统方法和最新模型。

Comments 13 pages, 2 figures. Corresponding author: alimotahharynia@gmail.com Kaggle notebook: https://www.kaggle.com/code/mohammadgh009/drugreasoner

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15274 2026-02-18 cs.AI cs.LG 81%

When Remembering and Planning are Worth it: Navigating under Change

记忆与规划的价值:在变化中导航

Omid Madani, J. Brian Burns, Reza Eghbali, Thomas L. Dean

机构 * Brown University(布朗大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了在变动环境中,利用记忆和概率学习提升空间导航效率的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15074 2026-02-18 cs.SD cs.AI 79%

Structure-Aware Piano Accompaniment via Style Planning and Dataset-Aligned Pattern Retrieval

通过风格规划和数据集对齐的模式检索实现结构感知的钢琴伴奏

Wanyu Zang, Yang Yu, Meng Yu

机构 * Lewis University(利维斯大学) Nexus Art Foundation(nexus艺术基金会) Governors State University(governors州大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出一种结构感知的钢琴伴奏生成方法,通过风格规划和数据集对齐的模式检索实现多样化的伴奏生成。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02649 2026-02-18 cs.AI 70%

From Prompts to Protection: Large Language Model-Enabled In-Context Learning for Smart Public Safety UAV

从提示到保护:基于大语言模型的上下文学习用于智能公共安全无人机

Yousef Emami, Hao Zhou, Miguel Gutierrez Gaitan, Kai Li, Luis Almeida, Zhu Han

机构 * Real-Time and Embedded Computing Systems Research Centre (CISTER)(实时嵌入式计算系统研究中心) Carnegie Mellon University(卡内基梅隆大学) Pontificia Universidad Católica de Chile(天主教大学) School of Computer Science, McGill University(麦吉尔大学计算机科学学院) Instituto de Telecomunicações, Faculdade de Engenharia, Universidade do Porto(电信研究所,工程学院,葡萄牙里斯本大学) University of Houston(休斯顿大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型的上下文学习提升公共安全无人机的自主决策能力,通过自然语言提示和示例指导实现路径规划和速度控制,减少数据丢失并缓解安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17900 2026-02-18 cs.CL 70%

MedPlan: A Two-Stage RAG-Based System for Personalized Medical Plan Generation

MedPlan: 一种基于RAG的双阶段系统,用于个性化医疗计划生成

Hsin-Ling Hsu, Cong-Tinh Dao, Luning Wang, Zitao Shuai, Thao Nguyen Minh Phan, Jun-En Ding, Chun-Chieh Liao, Pengfei Hu, Xiaoxue Han, Chih-Ho Hsu, Dongsheng Luo, Wen-Chih Peng, Feng Liu, Fang-Ming Hung, Chenwei Wu

机构 * National Chengchi University(国立政治大学) National Yang Ming Chiao Tung University(国立阳明交通大学) Can Tho University(庆坚大学) University of Michigan(密歇根大学) Stevens Institute of Technology(史泰文斯理工学院) Far Eastern Memorial Hospital(东方纪念医院) Florida International University(佛罗里达国际大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 MedPlan通过双阶段RAG框架,结合SOAP方法,提升个性化医疗计划生成的准确性和结构化质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10874 2026-02-18 cs.RO cs.MA 67%

Collaborative Multi-Robot Non-Prehensile Manipulation via Flow-Matching Co-Generation

通过流匹配共生成实现协作多机器人非抓取操作

Yorai Shaoul, Zhe Chen, Mohamed Naveed Gul Mohamed, Federico Pecora, Maxim Likhachev, Jiaoyang Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon Robotics(亚马逊机器人)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出一种统一框架,通过流匹配共生成与匿名多机器人运动规划,实现协作多机器人非抓取操作,提升复杂多物体环境下的操作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17812 2026-02-18 cs.CL cs.LG 62%

Can Multimodal LLMs Perform Time Series Anomaly Detection?

多模态大语言模型能否进行时间序列异常检测?

Xiongxiao Xu, Haoran Wang, Yueqing Liang, Philip S. Yu, Yue Zhao, Kai Shu

机构 * Illinois Institute of Technology(伊利诺伊理工学院) Emory University(埃默里大学) University of Illinois Chicago(伊利诺伊大学香槟分校) University of Southern California(南加州大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出基于多代理框架的TSAD-Agents,利用多模态大语言模型实现自动时间序列异常检测。

Comments ACM Web Conference 2026 (WWW'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15721 2026-02-18 cs.RO cs.AI 57%

Lifelong Scalable Multi-Agent Realistic Testbed and A Comprehensive Study on Design Choices in Lifelong AGV Fleet Management Systems

持续可扩展的多智能体真实测试床及对持续AGV车队管理系统设计选择的全面研究

Jingtian Yan, Yulun Zhang, Zhenting Liu, Han Zhang, He Jiang, Jingkai Chen, Stephen F. Smith, Jiaoyang Li

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出LSMART,一个开源模拟器,用于评估持续AGV车队管理系统的设计选择,并通过实验结果提供设计指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15072 2026-02-18 cs.CV cs.AI 57%

GRAFNet: Multiscale Retinal Processing via Guided Cortical Attention Feedback for Enhancing Medical Image Polyp Segmentation

GRAFNet:通过引导性皮层注意反馈进行多尺度视网膜处理以增强医学图像息肉分割

Abdul Joseph Fofanah, Lian Wen, Alpha Alimamy Kamara, Zhongyi Zhang, David Chen, Albert Patrick Sankoh

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 GRAFNet通过引导性皮层注意反馈模块提升医学图像息肉分割的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15039 2026-02-18 hep-ex cs.AI 57%

GRACE: an Agentic AI for Particle Physics Experiment Design and Simulation

GRACE:一个用于粒子物理实验设计和模拟的智能体

Justin Hill, Hong Joo Ryoo

机构 * Data Science Institute, Columbia Engineering(数据科学研究院,哥伦比亚工程学院) Department of Physics and Astronomy, Johns Hopkins University(物理与天文学系,约翰霍普金斯大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 GRACE是一个用于粒子物理实验设计和模拟的智能体,通过自主探索设计修改提升物理性能,引入了新的基准测试和约束搜索方法。

Comments Both authors contributed equally. 43 pages, 12 figures, 6 tables, data can be found in https://github.com/just5034/GRACE_whitepaper_data

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13209 2026-02-18 q-fin.GN cs.AI 57%

LemonadeBench: Evaluating the Economic Intuition of Large Language Models in Simple Markets

LemonadeBench:评估大语言模型在简单市场中的经济直觉

Aidan Vyas

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 LemonadeBench通过模拟柠檬摊业务评估大语言模型的经济直觉、长期规划和不确定性下的决策能力,揭示模型在局部优化上的表现与全局优化的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21654 2026-02-18 cs.AI 57%

ScholarGym: Benchmarking Large Language Model Capabilities in the Information-Gathering Stage of Deep Research

ScholarGym:在深度研究的信息收集阶段评估大语言模型能力

Hao Shen, Hang Yang, Zhouhong Gu, Weili Han

机构 * Fudan University(复旦大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 ScholarGym通过分解深度研究信息收集阶段,评估大语言模型在查询规划、工具调用和相关性评估中的能力差异,揭示开源与专有模型性能差距的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15237 2026-02-18 cs.HC 50%

Ground-Truth Depth in Vision Language Models: Spatial Context Understanding in Conversational AI for XR-Robotic Support in Emergency First Response

视觉语言模型中的真实深度:用于虚拟现实机器人支持的紧急急救中的空间情境理解

Rodrigo Gutierrez Maquilon, Marita Hueber, Georg Regal, Manfred Tscheligi

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出了一种结合深度传感与视觉语言模型的原型,用于增强紧急急救中的空间情境理解,通过深度增强提高准确性和稳定性,同时降低工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 2 篇

2602.15813 2026-02-18 cs.RO 75%

FAST-EQA: Efficient Embodied Question Answering with Global and Local Region Relevancy

FAST-EQA: 有效体感问答与全局和局部区域相关性

Haochen Zhang, Nirav Savaliya, Faizan Siddiqui, Enna Sachdeva

机构 * Carnegie Mellon University(卡内基梅隆大学) Honda Research Institute USA(本田研究院美国)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 FAST-EQA通过结合全局和局部区域相关性,实现高效体感问答,提升回答可靠性并加快推理速度。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15400 2026-02-18 cs.RO 67%

One Agent to Guide Them All: Empowering MLLMs for Vision-and-Language Navigation via Explicit World Representation

一个引导所有代理:通过显式世界表示增强多模态大语言模型用于视觉-语言导航

Zerui Li, Hongpei Zheng, Fangguo Zhao, Aidan Chan, Jian Zhou, Sihao Lin, Shijie Li, Qi Wu

机构 * Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) The University of Manchester(曼彻斯特大学) Zhejiang University(浙江大学) Agency for Science, Technology and Research (A*STAR)(科技研究局(A*STAR))

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 通过显式世界表示增强多模态大语言模型,实现视觉-语言导航的解耦框架,提升导航性能与现实应用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 2 篇

2509.03581 2026-02-18 cs.AI 83%

Learning When to Plan: Efficiently Allocating Test-Time Compute for LLM Agents

学习何时计划:高效分配测试时计算用于LLM代理

Davide Paglieri, Bartłomiej Cupiał, Jonathan Cook, Ulyana Piterbarg, Jens Tuyls, Edward Grefenstette, Jakob Nicolaus Foerster, Jack Parker-Holder, Tim Rocktäschel

机构 * University of Warsaw(华沙大学) University of Oxford(牛津大学) New York University(纽约大学) Princeton University(普林斯顿大学) University College London(伦敦大学学院)

专题命中 测试时计算 :test-time compute(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一种动态规划框架,通过两阶段训练提升LLM在长周期任务中的样本效率和复杂目标达成能力,同时展示人类计划对代理系统性能的增强作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15156 2026-02-18 cs.AI 70%

Panini: Continual Learning in Token Space via Structured Memory

Panini:通过结构化记忆在令牌空间中实现持续学习

Shreyas Rajesh, Pavan Holur, Mehmet Yigit Turali, Chenda Duan, Vwani Roychowdhury

机构 * ucla(加州大学洛杉矶分校)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 Panini通过结构化记忆在令牌空间中实现持续学习,提升推理效率和准确性。

Comments 35 pages, code available at: https://github.com/roychowdhuryresearch/gsw-memory

详情

展开后加载摘要…

URL PDF HTML 收藏