arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-28 至 2026-08-28 共收录 160 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 11 篇

2608.17512 2026-08-28 cs.RO 版本更新 75%

Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation

具身导航器:指向、思考、记忆与对齐以实现高效导航

Hongyan Feng, Sunlai Chen, Xuanyu Liu, Miao Pan, Yangfan Xie, Yuxiang Cui, Zhongxiang Zhou, Rong Xiong, Wenqi Zhang, Jianwei Yin, Yueting Zhuang, Xuhong Zhang

机构 * ZJU(浙江大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract)

AI总结 本研究提出具身导航框架TAMP-Nav,通过像素转3D动作、选择性推理记忆与GRPO两级对齐,在R2R-CE数据集上实现66.2% SR,仅需90k训练轨迹,达成高效具身导航的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21832 2026-08-28 cs.CL 版本更新 74%

GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding

GUI-Primitives:诊断视觉-语言GUI定位中的空间推理失败

Md Abrar Jahin, Md Rizwan Parvez

机构 * University of Southern California(南加州大学) USC Information Sciences Institute(南加州大学信息科学研究所) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)

专题命中 视觉空间推理 :reasoning(title);分类 cs.CL

AI总结 本文提出GUI-Primitives基准,通过994个含7种空间关系的对比指令对,发现多数视觉-语言GUI定位模型的失败源于候选定位而非关系理解,且标记候选可提升准确率。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04778 2026-08-28 cs.CV cs.AI cs.CL cs.MM 版本更新 62%

CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models

CounterVid: 通过生成反事实视频缓解视频-语言模型中动作和时间幻觉

Tobia Poppi, Burak Uzkent, Amanmeet Garg, Lucas Porto, Garin Kessler, Yezhou Yang, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara, Florian Schiffers

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(帕尔马大学) Amazon Prime Video(亚马逊Prime视频)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CounterVid通过生成反事实视频缓解视频-语言模型中动作和时间幻觉问题,提出反事实视频生成框架和MixDPO方法,提升时间推理和动作识别性能。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27206 2026-08-28 cs.CV cs.AI 新提交 57%

PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference

PACE:用于快速视觉语言模型推理的统一压缩-提取范式

Junjie Liu, Shengyuan Ye, Xu Chen

机构 * Sun Yat-sen University(中山大学) Power Dispatch Control Center, Guangdong Power Grid Co., Ltd.(广东电网有限责任公司电力调度控制中心) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 针对视觉语言模型推理成本随视觉 token 增多而上升的问题,提出无需训练的 PACE 框架,集成到 Qwen2.5-VL-7B 后仅用 10% 视觉 token 保留 93.8% 原性能,TTFT 加速 3.1 倍。

Comments 22 pages, 9 figures, 13 tables. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26587 2026-08-28 cs.CL 新提交 57%

Surgical Alignment in Knowledge Graph Training for Clinical Diagnosis with Large Language Models

面向临床诊断的大语言模型训练中知识图谱的外科式对齐

Saksham Khatwani, He Cheng, Majid Afshar, Dmitriy Dligach, Yanjun Gao

机构 * University of Colorado Anschutz Medical Campus(科罗拉多大学安舒茨医学校区) University of Wisconsin Madison(威斯康星大学麦迪逊分校) Loyola University(洛约拉大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对临床诊断的LLM训练,通过多维度系统研究引入GID和GD,发现KL正则化下KG判断训练的稀疏更新(外科式对齐)可提升推理质量,需结合优化几何诊断评估KG-LLM整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26496 2026-08-28 cs.RO cs.AI cs.CV 新提交 57%

RTNav: Towards Real-Time Zero-Shot Object Navigation

RTNav:迈向实时零样本目标导航

Easop Lee, Lingyu Zhang, Boyuan Chen

机构 * Duke University(杜克大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 针对零样本目标导航方法在现实实时场景下的性能下降问题,提出RTNav架构,在HM3D系列数据集的实时变体上实现了成功率与完成时间加权成功率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26947 2026-08-28 cs.RO cs.CV 新提交 50%

4DSynth: Controllable Procedural World Synthesis for Dynamic Embodied Simulation

4DSynth:面向动态具身模拟的可控程序式世界合成

Zehao Qi, Haochen Luo, Jia-Wang Bian, Zeyu Ma, Shuyang Sun

机构 * Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学) Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出可控程序式4D环境生成系统4DSynth,可将自然语言等输入转化为可编辑4D环境,并构建交互式导航基准4DSynth-Nav,为具身智能体开发评估提供实用基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26744 2026-08-28 cs.CV 新提交 50%

G2D: Generative-to-Discriminative Collaborative Inference for Zero-Shot Image Classification

G2D:用于零样本图像分类的生成式到判别式协同推理框架

Zehua Hao, Fang Liu, Qinliang Wang, Yaoyang Du, Xinyan Huang, Puhua Chen

机构 * Xidian University(西安电子科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 G2D是一种无需训练的零样本图像分类框架,通过生成式VLM验证CLIP检索的候选,在8个基准上平均准确率达68.85%,优于CLIP及独立生成式模型,还可迁移至其他模型。

Comments Accepted at ACM MM 2026. 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 13 篇

2608.26126 2026-08-28 cs.CL cs.IT 新提交 84%

TelecomGPT-R1: A Unified Open-Source Reasoner for the Telecom Stack

TelecomGPT-R1:面向电信栈的统一开源推理器

Bohao Wang, Chenwei Wu, Haoyu Li, Hang Zou, Yu Tian, Lina Bariah, Li Wei, Chongwen Huang, Yongliang Shen, Zhaoyang Zhang, Merouane Debbah

专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);verifier(abstract)

AI总结 该研究发布开源电信推理器TelecomGPT-R1-9B,通过两阶段后训练方案优化,在公开电信基准中表现优于同类开源模型,性能接近闭源前沿推理器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27351 2026-08-28 cs.LG 新提交 83%

Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO

理解用于大语言模型推理的进化策略:比GRPO更广泛的推理覆盖范围

Yunpeng Ba, Zhi Zheng, Yue Xie, Jiaqing Li, Xialiang Tong, Tao Zhong, Mingxuan Yuan, Zhichao Lu, Xuyang Wu, Zhenkun Wang

机构 * Southern University of Science and Technology(南方科技大学) National University of Singapore(新加坡国立大学) Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) City University of Hong Kong(香港城市大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.LG

AI总结 本文研究用于LLM推理的进化策略(ES),发现ES比GRPO有更广泛的推理覆盖范围,开发了结合两者优势的GRPO-ES策略,还揭示了ES的功能稀疏性等特性,确立其为独特的推理后训练范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26787 2026-08-28 cs.MM 新提交 82%

Self-Reflective Multi-modal Reasoning for Short-Video Fake News Detection

用于短视频假新闻检测的自反思多模态推理

Pinjie Xu, Yuzhou Yang, Zhikai Tan, Qichao Ying, Zaiyang Yu, Ce Li, Zhenxing Qian

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 针对短视频假新闻检测的挑战,提出SRM-FND框架,通过自反思多模态推理及相关机制,在FakeSV和FakeTT数据集上实现优于强基线的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03605 2026-08-28 cs.CL 版本更新 79%

AEScorer: An Agentic Evidence-Grounded Framework for Graded Factuality Verification

DiVA: 基于代理-判别验证器的细粒度事实性验证

Hui Huang, Muyun Yang, Yuki Arase

机构 * Harbin Institute of Technology(哈尔滨工业大学) Institute of Science Tokyo(东京科学研究所)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.CL

AI总结 DiVA通过结合生成模型和判别模型的能力,提出了一种细粒度事实性验证方法,并构建了FGVeriBench基准,有效提升了事实性验证的精度和适用性。

Comments Accepted by Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26432 2026-08-28 cs.SD cs.AI cs.CL 新提交 62%

SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning

SpeechGym:一种用于通过强化学习训练语音智能体的原生音频 Gym

Jiajun Fan, Jingyuan Li, Prashanth Gurunath Shivakumar, Jia-Hong Huang, Qi Luo, M. Maruf, Ivan Bulyko, Ge Liu, Roger Ren

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon AGI Foundations(亚马逊AGI基础研究部)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对语音智能体训练中梯度无法流动、难以强化学习的问题,提出原生音频环境 SpeechGym,用每轮过程奖励解决稀疏性问题,使开放权重模型在语音基准上任务成功率翻倍且排名提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26161 2026-08-28 cs.CL cs.AI 新提交 62%

Mutual Debiasing via Dual-Seed Comparison for Probabilistic Sampling in Large Language Models

基于双种子比较的互去偏方法用于大语言模型的概率采样

Zihao Guo, Hongtao Lv, Chaoli Zhang, Laiguo Yin, Lei Liu, Yonghui Xu, Lizhen Cui

机构 * School of Software, Shandong University(山东大学软件学院) School of Computer Science and Technology, Zhejiang Normal University(浙江师范大学计算机科学与技术学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对大语言模型概率采样的系统性偏差问题,提出双种子比较(DSC)协议,通过两个独立种子中和偏差,在多数评估设置中性能优于现有方法,还可适配多项选择问题生成等任务以提升分布控制能力。

Comments 28 pages, 4 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27455 2026-08-28 cs.CL 新提交 57%

CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes

CritICL:基于小语言模型失败模式的推理时弱到强泛化

Yufan Wu, Yinghui He, Zhengyi Hu, Lang Wei, Ruichen Li, Qifan Yang, Ting Zhu

机构 * The Ohio State University(俄亥俄州立大学) Princeton University(普林斯顿大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 CritICL是一种新型推理时框架,利用小语言模型的结构化失败模式,通过两种变体提升推理性能,效率优于标准上下文学习和测试时缩放方法。

Comments this https URL (https://github.com/umwyf/CRITICL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27141 2026-08-28 cs.CR cs.AI 新提交 57%

Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM Agents

安全性无法组合:自主大型语言模型智能体的非衰减循环状态

Chenhao Wu, Haoxuan Jia, Yang Liu, Yingguang Yang, Yuhan Lin, Chongyang Zhang, Hao Zheng, Yulin Huang, Jianshen Zhang, Yongzhi Qi, Shang Luo, Kefu Xu, Jifeng Zhu, Bin Chong

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 该研究发现自主LLM智能体的轨迹级安全保障存在组合性缺陷,提出非衰减循环安全状态的LoopHarness方案,可限制未授权不可逆操作数量,通过Agent-SafetyBench等评估验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26735 2026-08-28 cs.CL 新提交 57%

Preserving General Capabilities during Domain Specialization with Uncertainty-Calibrated MOPD

通过不确定性校准的MOPD在领域专业化过程中保留通用能力

Ziyuan Liu, Jiao Ou, Jian Liang, Ruiming Tang, Cheng Luo

机构 * Kuaishou Technology(快手科技)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对大语言模型领域专业化时通用能力下降的问题,提出不确定性校准的MOPD方法,在角色扮演和医疗领域实验中提升通用能力且保持垂直领域性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26357 2026-08-28 cs.CL 新提交 57%

Cross-lingual Representation Learning via Centroid Intervention Fusion

基于质心干预融合的跨语言表示学习

Wei Sun, Marie-Francine Moens

机构 * KU Leuven(鲁汶大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文针对大语言模型跨语言性能不均的问题,提出CIF框架整合多语言干预投影,在四类基准测试中提升了跨语言性能,尤其优化了低资源语言表现。

Comments EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26556 2026-08-28 cond-mat.dis-nn cond-mat.stat-mech cs.LG 新提交 57%

Dynamical phase selection controls compute scaling in looped transformers

动力学相位选择控制循环Transformer的计算缩放

Gunn Kim

专题命中 测试时计算 :test-time compute(abstract);分类 cs.LG

AI总结 该研究针对循环Transformer,发现架构与准确率相同的网络因初始化不同呈现不同动力学相位,分岔机制决定测试时计算缩放,fold与Neimark–Sacker相位的缩放规律存在差异,表明测试计算由训练解的动力学相位决定。

Comments 5 pages and 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08357 2026-08-28 cs.CL 版本更新 57%

Forward-Free Diffusion Language Models with BPTT-Free Looped Refinement

无前向过程的扩散语言模型

Haotian Sun, Rushi Qiang, Yuqian Zheng, Bo Dai

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 提出FReDA,一种无需人工设计前向过程的扩散语言模型,通过递归分布细化利用模型生成草稿作为隐式中间状态,在推理和编码任务上超越更大模型,并实现1.5-1.8倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21884 2026-08-28 cs.SE 版本更新 50%

Loop Engineering: Building Blocks, Adoption, and Impact

循环工程:构建模块、采用情况及影响

Jai Lal Lulla, Vahram Nersesyan, Seyedmoein Mohsenimofidi, Christoph Treude, Sebastian Baltes

专题命中 测试时计算 :verifier(abstract)

AI总结 本文对新兴循环工程领域开展探索性研究,分析其构建模块、开源项目采用情况,挖掘36710个仓库发现217个存在自主智能体循环,并规划了智能体自主层级的对照研究。

Comments 10 pages, 2 tables, under review

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 14 篇

2608.26386 2026-08-28 cs.CL cs.AI cs.LG 新提交 82%

Co-Evolving Structured Knowledge and Reasoning in Language Models

语言模型中结构化知识与推理的协同演化

Ryan Thomas Noonan, Linxi Zhao, Menghan Xu, Akanksha Sarkar, Mihir Mishra, Dongyoung Go, Kilian Q. Weinberger, Yoav Artzi, Jennifer J. Sun

机构 * Cornell University(康奈尔大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对检索增强方法的局限,提出协同演化框架KBevo,联合学习构建结构化知识库与推理,提升了知识结构质量、答案可达性及推理与可控性。

Comments COLM2026. Code available at this https URL (https://github.com/kilian-group/KBevo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25531 2026-08-28 cs.CL 版本更新 79%

ClueWeaver: Reward-Guided Dual-Agent Evidence Reasoning for Compact LLMs on Literary Long Narratives

ClueWeaver:面向紧凑型大语言模型的、针对文学长篇叙事的奖励引导双智能体证据推理框架

Jihao Zhu, Zhiwei Yang, Wenxiao Zhang, Junqian Zhao, Qi You, Fangqi Wang, Zheyuan Deng, Hanzhe Yang, Yu Liu, Jin B. Hong

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) University of Aberdeen(阿伯丁大学) The University of Western Australia(西澳大学) Brown University(布朗大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 ClueWeaver是用于紧凑型本地模型的双智能体证据推理框架,可提升本地语言模型在长篇叙事问答与声明验证任务中的性能,提供可检查的证据推理轨迹。

Comments Accepted by ICONIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05876 2026-08-28 cs.CL 版本更新 79%

Addressing the Reasoning Gap: Mechanistic Circuit-Based Knowledge Editing in Large Language Models

基于机制电路的知识编辑在大语言模型中

Tianyi Zhao, Yinhan He, Wendy Zheng, Chen Chen

机构 * University of Virginia(弗吉尼亚大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出MCircKE框架,通过识别因果电路实现精准的知识编辑,解决大语言模型在动态环境中更新知识时的推理缺口问题,提升多跳推理能力。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26684 2026-08-28 cs.CV 新提交 78%

Reason in the Words You Speak: Idiolectal Paraphrasing Off-Policy Traces for Reasoning Distillation in VideoLLMs

用你所说的语言推理:为VideoLLM中的推理蒸馏进行个人习语式的离线策略轨迹改写

Ji Soo Lee, Jinyoung Park, Seohyun Lee, Jongha Kim, Joonmyung Choi, Jinsung Yoon, Hyunwoo J. Kim

机构 * KAIST(韩国科学技术院) Korea University(高丽大学) Google Cloud AI Research(谷歌云人工智能研究院)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 该研究针对VideoLLM的推理蒸馏提出Echo-GRPO框架,通过改写教师特权轨迹为学生自身习语实现策略对齐,实例化的VideoEcho-R1在多骨干和基准测试中均获性能提升,且作为插件模块适配多种训练框架。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26480 2026-08-28 cs.MA cs.AI cs.CL cs.SE 新提交 62%

Zero-Shot Self-Orchestration with Ledger-Based Control for Improved LLM Coding Performance

基于账本控制的零样本自编排提升大语言模型的代码生成性能

Victor Gao, Vida Khosrowshahi, Ali Khosrowshahi, Xihao Sun, Juhyun Lee, Simon (Sang Won)Lee

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出基于账本控制的管理者-工作者零样本自编排架构,在9个模型的100个困难代码问题上验证其可提升大语言模型代码生成性能,且成本低于改用更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22963 2026-08-28 cs.AI cs.CL 版本更新 62%

Buried in Textual Debt: Context Pruning with Visual Evidence Preservation for MLLM Agents

被文本债务掩埋:面向多模态大语言模型智能体的保留视觉证据的上下文剪枝

Yuchen Huang, Sijia Li, Jun Zhang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型智能体长轨迹中文本主导上下文、抑制视觉证据的问题,提出基于KL引导的SPARE框架,结合OPSD与SFT实现高效剪枝,在多步视觉工具使用基准中达到最优准确率与剪枝比例的权衡。

Comments 17 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16313 2026-08-28 cs.AI cs.LG 版本更新 62%

Learning to Predict, Discover, and Reason in High-Dimensional Event Sequences

学习预测、发现和推理高维事件序列

Hugo Math

机构 * Faculty of Applied Computer Science(应用计算机科学系) University of Augsburg(艾格堡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出统一事件序列建模、因果发现和大语言模型的框架,用于高维事件流中的自动化故障诊断,解决传统方法在高维数据中的不足。

Comments PhD dissertation, 135 pages of main content, 201 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27038 2026-08-28 cs.CL 新提交 57%

Cascaded Batch Prompting

级联批量提示

Sho Hoshino, Peinan Zhang

机构 * CyberAgent(赛博agent公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 针对批量提示导致大语言模型下游任务性能不可预测的问题,提出级联批量提示方法,在多项选择问答等任务上性能优于单提示基线,且加速效果与批量大小成正比,在帕累托前沿达到新最优。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26530 2026-08-28 cs.AI 新提交 57%

PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents

循环中的PILOT:长智能体的实时自我改进

Yang Xiao, Yusong Sun, Haoyi Wu, Wenyang Hui, Wen Da, Zhaokai Luo, Mu Chuan, Yao Hu, Wenjie Li, Chengyue Jiang

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 该研究针对长智能体自我改进方法无法实时利用经验的问题,提出PILOT框架,通过实时引导与实时自我进化机制,在多基准测试中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏