arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-27 至 2026-08-27 共收录 143 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 12 篇

2608.21265 2026-08-27 cs.CL 版本更新 90%

Memory Augmentation Unlocks Efficient Chain-of-Thought Reasoning

记忆增强解锁高效思维链推理

Simeng Zhang, Yilong Chen, Wenyuan Zhang, Zhenyu Zhang, Yao Chen, Junyuan Shang, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Baidu Inc.(百度公司) Tencent Inc.(腾讯公司)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL

AI总结 该研究提出无需训练的记忆增强压缩框架,构建可复用推理记忆提升思维草稿压缩效果,在多任务上获显著准确率提升并加速推理,兼容多种压缩机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14237 2026-08-27 cs.CL cs.LG 版本更新 82%

Ladder Up, Memory Down: Low-Cost Fine-Tuning With Side Nets

向上爬,记忆下降:低成本微调与侧边网络

Estelle Zheng, Nathan Cerisara, Sébastien Warichet, Emmanuel Helbert, Christophe Cerisara

专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 LST通过轻量级侧边网络实现高效微调,比QLoRA更节省内存,同时在多个任务中保持竞争力。

Comments 24 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02203 2026-08-27 cs.AI cs.CL 版本更新 73%

Tool Verification for Test-Time Reinforcement Learning

测试时强化学习的工具验证

Ruotong Liao, Nikolai Röhrich, Xiaohan Wang, Yuhui Zhang, Yasaman Samadzadeh, Volker Tresp, Serena Yeung-Levy

机构 * Ludwig-Maximilians-University of Munich(慕尼黑路德维希-马克西米利安大学) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 T^3RL通过引入测试时工具验证机制,提升测试时强化学习在复杂问题上的表现,减少错误模式崩溃风险。

Comments 12 pages, 11 figures; Code: this https URL (https://github.com/mayhugotong/T3RL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25981 2026-08-27 cs.CL 版本更新 70%

AgentDiff: Meaning-Bearing Rewrites Trigger Deeper Divergence than Presentation Changes in LLM Agents

LLM 代理何时对表面噪声与语义噪声做出不同处理?一项基于 68 个单元格的测量研究及留出轨迹级验证

Liyun Zhang, Jiayi Guo

机构 * School of Information and Software Engineering, UESTC(信息与软件工程学院,电子科技大学) Jacobs School of Engineering, UC San Diego(工程学院,加州大学圣地亚哥分校)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本研究通过 68 个单元格的测量实验,发现大语言模型驱动的思维链和 ReAct 代理对语义扰动(如释义、同义词)比表现扰动(如格式、重排序)更敏感,并基于留出模型和轨迹级机制分析提出了“隐蔽发散”解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02855 2026-08-27 cs.CL cs.CY 版本更新 70%

IDEAlign: Comparing Ideas of Large Language Models to Domain Expert

IDEAlign:将大语言模型的想法与领域专家进行比较

Hyunji Nam, Lucia Langlois, James Malamut, Mei Tan, Dorottya Demszky

机构 * Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 本研究提出IDEAlign方法,通过“挑出异类”任务评估LLM标注与专家标注的想法层面相似性,发现LLM作为评判者表现最佳但仍不及专家,为开放式LLM标注评估提供了可复用的基准测试协议。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25936 2026-08-27 cs.LG cs.AI cs.CL 新提交 67%

One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation

一种症状,三个杠杆:对在线策略自蒸馏的批判性综述

Justin Robert, Raheel Qader

机构 * OVHai LLM(OVHai大模型)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本综述针对在线策略自蒸馏(OPSD)存在的推理路径崩溃问题,从信号加权、特权信息性质、指导衰减三个杠杆展开分析,以数学推理为范围,提供统一术语并区分已确定与争议内容。

Comments 30 pages, 4 figures. Survey / critical review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24949 2026-08-27 cs.LG cs.AI cs.CL 新提交 67%

Demystifying Reinforcement Learning Post-Training of Language Models

揭秘语言模型的强化学习后训练

Donovan Clay, Saket Gollapudi, Sankar Harilal, Min Jang, Jacob Morrison, Sewoong Oh, Natasha Jaques

机构 * University of Washington(华盛顿大学) Allen Institute for AI(艾伦人工智能研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究拆解语言模型的RL后训练算法,探究各因素对其结果的影响,为NLP领域人员提供RL后训练的入门指南。

Comments Link to website: this https URL (https://minjang10.github.io/demystifying-rl-finetuning-web) Link to code: this https URL (https://github.com/sankarh-1/demystifying-rl-finetuning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25756 2026-08-27 cs.LG cs.AI 新提交 62%

TailSFT: Filtered Fine-Tuning Improves Post-Training Performance

TailSFT:过滤式微调提升后训练性能

Sadhika Malladi, Samy Jelassi, Dylan Foster, Jordan T. Ash, Akshay Krishnamurthy

机构 * University of California San Diego(加州大学圣迭戈分校) Microsoft Research NYC(微软研究院纽约分部)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TailSFT过滤式微调算法,可提升模型后强化学习性能,在OLMo-3 7B上数学与代码评估pass@16最高提17%,后续GRPO的pass@1最高提4%,还引入轻量诊断方法识别适用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15416 2026-08-27 cs.LG cs.AI math.OC 版本更新 62%

StoSignSGD: Unbiased Structural Stochasticity Fixes SignSGD for Training Large Language Models

StoSignSGD:无偏结构随机性修正SignSGD用于训练大语言模型

Dingzhi Yu, Rui Pan, Yuxing Liu, Difan Zou, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出StoSignSGD算法,通过在sign操作中注入结构随机性,解决SignSGD在非光滑目标下的发散问题,理论和实验均证明其在凸和非凸优化中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06346 2026-08-27 cs.LG cs.AI 版本更新 62%

Ban&Pick: Enhancing Performance and Efficiency of MoE-LLMs via Smarter Routing

Ban&Pick:通过更智能的路由提升MoE-LLM的性能与效率

Yuanteng Chen, Peisong Wang, Yuantian Shao, Nanxin Zeng, Chang Xu, Jian Cheng

机构 * Nanjing University of Science and Technology(南京理工大学) C 2 \text{C}^{2} DL, Institute of Automation, Chinese Academy of Sciences(C2 DL,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Computer Science, University of Sydney(悉尼大学计算机学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对MoE-LLM预训练路由的问题,提出即插即用的Ban&Pick策略,通过Pick强化关键专家、Ban修剪冗余专家,在不重新训练或改架构的情况下提升MoE-LLM性能并加速推理。

Comments 26 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25992 2026-08-27 cs.AI cs.MA 新提交 57%

ProgRouter: Online Progress-Guided Orchestration for Multi-Agent LLM Workflows under Quality-Cost Tradeoffs

ProgRouter:面向质量-成本权衡的多智能体大语言模型工作流的在线进度引导编排

Somgyuan Li, Ahmed M. Abdelmoniem, Shiqiang Wang

机构 * Aston University(阿斯顿大学) Queen Mary University of London(伦敦玛丽女王大学) University of Exeter(埃克塞特大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 ProgRouter是一种在线进度引导路由框架,通过多视图任务进度评分器等机制,在多智能体LLM工作流中平衡任务质量与时间、成本预算,在多类任务数据集上较基线降低运营成本且保持性能。

Comments Accepted in Findings of the Association for Computational Linguistics: EMNLP 2026. Index Terms: Collaborative agentic workflows, LLM agent orchestration, Quality-cost trade-off, Task progress prediction, Online decision-making

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25311 2026-08-27 cs.LG 新提交 57%

Prefix-Denoising Consistency: Test-Time Verification for Diffusion Language Models

前缀去噪一致性:扩散语言模型的测试时验证方法

Yuki Ichihara, Naoto Iwase, Mohammad Atif Quamar, Junpei Komiyama

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Nagoya University(名古屋大学) RIKEN AIP(理化学研究所人工智能项目)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究针对扩散语言模型提出测试时自验证方法PDC,通过前缀条件再生的轨迹稳定性差异修正初始生成样本,在两类推理基准中提升性能且具鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 3 篇

2606.17648 2026-08-27 cs.AI 版本更新 79%

From Brewing to Resolution: Tracing the Internal Lifecycle of Code Reasoning in LLMs

从酝酿到解析:追踪LLM中代码推理的内部生命周期

Siyue Chen, Yifu Guo, Yuquan Lu, Zishan Xu, Jiaye Lin, Jianbo Lin, Siyu Zhang, Cheng Yang, Junxin Li, Yujia Li, Yu Huo, Ruixuan Wang

机构 * South China University of Technology(华南理工大学) Sun Yat-sen University(中山大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Hangzhou Dianzi University(杭州电子科技大学) Guangzhou College of Technology and Business(广州工商学院)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 提出双重诊断框架(逐层线性探针与上下文剥离解码),揭示LLM在代码推理中先酝酿答案后进入四种解析结果(已解析、过度处理、错误解析、未解析)的内部生命周期,发现酝酿支架稳定而解析成功随能力变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21516 2026-08-27 cs.SE cs.PL 版本更新 78%

Neuro-Formal Verification: Agentic Language-Agnostic Formal Program Reasoning

神经形式化验证:智能体的语言无关形式化程序推理

Shuvendu K. Lahiri

专题命中 代码与定理证明 :reasoning(title);verifier(abstract)

AI总结 该研究提出神经形式化验证(NFV),让AI编码智能体与成熟验证器结合,为主流语言开发者实现一键式程序验证,在Python编程问题数据集上取得了良好的验证效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25411 2026-08-27 cs.CR cs.SC 版本更新 50%

Heimdall: Formally Verified Automated Migration of Legacy eBPF Programs to Rust

Heimdall: 形式化验证的遗留 eBPF 程序到 Rust 的自动迁移

Vishnu Asutosh Dasu, Monika Santra, Md Rafi Ur Rashid, Ashish Kumar, Saeid Tizpaz-Niari, Gang Tan

专题命中 代码与定理证明 :verifier(abstract)

AI总结 本文提出 Heimdall,一个利用大语言模型将遗留 libbpf C 程序自动翻译为 Aya Rust 的管道,通过静态分析和符号执行确保迁移后程序行为等价,并修复了 eBPF 程序中六类源级漏洞,包括未报告的信息泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 7 篇

2608.24954 2026-08-27 cs.LG physics.ao-ph 新提交 83%

AFDBench: A Reasoning-First AI Scientist for NationalWeather Service Forecast Discussions

AFDBench:面向国家气象局预报讨论的推理优先AI科学家

Manmeet Singh, Somnath Luitel, Prabhjot Singh, Manraaj Banga, Naveen Sudharsan, Josh Durkee

机构 * Western Kentucky University(西肯塔基大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) RediMinds Inc.(睿智公司)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.LG

AI总结 针对LLMs生成高风险气象文本时虚构数值的问题,研究提出AFDBench基准,采用GRPO优化7B参数模型,提升其生成专业气象讨论的风格契合度与数据保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26013 2026-08-27 cs.CL 新提交 57%

VISA: Agentic Self-Evolving Data Synthesis for Multimodal Instruction Following

VISA:用于多模态指令遵循的智能体式自进化数据合成

Min Zeng, Guanxin Tan, Libin Cen, Yawei Wen, Rui Hu, Liuyang Bian, Xiaolong Chen, Xiaoxin Chen

机构 * vivo AI Lab(vivo AI实验室)

专题命中 逻辑推理 :verifier(abstract);分类 cs.CL

AI总结 VISA是一种智能体式自进化数据合成框架,通过自进化循环优化多模态指令合成,在MM-IFEval等基准上提升了多模态指令遵循性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25771 2026-08-27 cs.HC cs.LG 新提交 57%

Large Language Model Few-Shot Prompting with Dilemma Training Outperforms Human Surrogates in Predicting Patient Preferences

采用困境训练的大语言模型少样本提示在预测患者偏好方面优于人类替代者

Natasha Ureyang, Sebastian Porsdam Mann, Yuxin Liu, Zuriel Hassirim, Melanie Almonte, Wenhao Chen, Joyce Ng, Thant Nay Lin, Aung Thiha, Gerald CH Koh, Brian David Earp, Pin Sym Foong

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究提出采用困境训练的P4-DT智能体,通过12组患者-替代者配对实验,其预测患者治疗选择的准确率达81.7%,优于人类替代者及相关方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05545 2026-08-27 cs.CY cs.AI cs.HC 版本更新 57%

Vibe Compiler: A Research-Logic Synthesis Tool That Runs without Prompt Engineering -Toward Enhancing Metacognition for Sustaining Agency in the Age of Generative AI-

Vibe Compiler:无需提示工程即可运行的研究逻辑综合工具——迈向生成式AI时代维持智能体的元认知

Riichiro Mizoguchi, Tomoki Aburatani, Kento Koike, Machi Shimmei

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 针对生成式AI可能侵蚀人类认知智能体的问题,提出基于综合-分析互惠模型的Vibe Compiler工具,通过16个学术参数的本体编译研究想法,以反思性问题引导研究人员,减少对复杂提示的依赖,提升AI辅助推理效果。

Comments 98 pages, 3 figures. English version (pp. 1-54) followed by a Japanese version (pp. 55-98)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25573 2026-08-27 cs.DB cs.SE 新提交 50%

DBcover: A White-box SQL Test Generation Framework for Coverage Improvement

DBcover:一种用于提升覆盖率的白盒SQL测试生成框架

Yankai Rong, Shuang Liu, Jinhao Dong, Qiang Yin, Wei Lu, Jianhua Wang, Xiaoyong Du

专题命中 逻辑推理 :reasoning(abstract)

AI总结 针对RDBMS测试覆盖率提升难题,提出LLM驱动的白盒SQL测试生成框架DBcover,经实验在PostgreSQL、MySQL及KingbaseES上均实现有效覆盖率提升。

Comments Accepted to the ICSE 2026 Industry Challenge Track. 12 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17172 2026-08-27 cs.NE 版本更新 50%

Automating Parent Selection Configuration in Genetic Programming with Agentic AI

用智能体人工智能实现遗传编程中父代选择配置的自动化

Jose Guadalupe Hernandez, Jui-Hsuan Chang, Anil Kumar Saini, Xi Li, Jason H. Moore

专题命中 逻辑推理 :reasoning(abstract)

AI总结 该研究提出智能体AI框架,结合LLM推理与RAG实现遗传编程父代选择配置自动化,经符号回归测试,5 mini--AR配置表现优于锦标赛选择,为进化系统自动化设计提供了新路径。

Comments Updated Benchmarking figure with correct statistical test results

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00894 2026-08-27 cs.AR 版本更新 50%

Rethinking Agentic Kernel Generation for Emerging Accelerators

面向新兴加速器的智能体内核生成方法反思

Ruijie Gao, Jirong Yang, Barry Lyu, Haoran Jin, Nathan Bleier

专题命中 逻辑推理 :reasoning(abstract)

AI总结 针对新兴加速器内核生成的现有方法反复重建无关语义的问题,提出编译器介导的Zomboss框架,将语义编译为可复用接口,在20个Gemmini和36个PLENA工作负载上实现全实例正确,且性能优于基线方法、推理成本更低。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 28 篇

2510.09062 2026-08-27 cs.CL 版本更新 89%

ReFIne: A Framework for Trustworthy Large Reasoning Models with Reliability, Faithfulness, and Interpretability

ReFIne:兼具可靠性、忠实性与可解释性的可信赖大型推理模型框架

Chung-En Sun, Ge Yan, Akshay Kulkarni, Tsui-Wei Weng

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 规划推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);planning(abstract)

AI总结 该研究提出 ReFIne 框架,结合监督微调与 GRPO 训练 Qwen3 模型,使其在数学基准上的推理轨迹可解释性、忠实性、可靠性均显著提升,推动推理模型向多维度可信赖性优化发展。

Comments Accpepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25379 2026-08-27 cs.CL cs.AI 新提交 84%

Adaptive Triggering for Bias Correction in LLM Reasoning

大语言模型推理中用于偏差校正的自适应触发机制

Nayoung Kim, Mickey Mancenido, Huan Liu

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM推理中思维链提示引发的偏差问题,提出基于在线变点检测的自适应触发校正框架,在gpt-4o-mini等模型上验证了其在减少干预次数的同时保留准确率的优势。

Comments 10 pages, 6 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25641 2026-08-27 cs.RO cs.AI 新提交 83%

Leveraging Inter-object Affordances for Efficient Planning in Contact-rich Tasks

利用物体间可供性实现接触密集型任务的高效规划

Pouya P. Niaz, Justus Piater, Alejandro Agostini

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 该研究针对传统TAMP方法在接触密集型任务中规划时间长、成功率低的问题,提出结合VLM与U-TAMP的方法,在模拟厨房场景中实现了更高的规划成功率与更快的规划速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25039 2026-08-27 cs.AI 新提交 83%

LifePlanner: Evaluating LLM Agents for Geo-spatial Planning with Social Media Data

LifePlanner:利用社交媒体数据评估LLM智能体的地理空间规划能力

Zhen Dong, Yuning Peng, Yutao Shi, Lei Zhong, Yongsen Mao, Yuan Liu, Haiping Wang

机构 * Wuhan University(武汉大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 该研究推出LifePlanner基准测试,结合社交媒体数据评估LLM智能体的地理空间规划能力,发现前沿LLM在简单检索中表现好但复杂规划通过率仅40.2%,失败源于证据获取、工具使用及约束整合问题,需改进实际规划能力而非单纯扩大模型规模。

Comments 25 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08603 2026-08-27 cs.AI 版本更新 83%

OSCAR: Optimization-Steered Agentic Planning for Composed Image Retrieval

OSCAR:基于优化的代理规划用于组合图像检索

Teng Wang, Rong Shan, Jianghao Lin, Junjie Wu, Tianyi Xu, Jianping Zhang, Wenteng Chen, Changwang Zhang, Zhaoxiang Wang, Weinan Zhang, Jun Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 OSCAR通过优化引导的代理规划框架,提升组合图像检索的性能,仅用10%训练数据即超越现有最佳方法。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25392 2026-08-27 cond-mat.mtrl-sci 新提交 82%

Interpretable physics-informed retrieval-augmented generation language model for end-to-end inorganic crystal synthesis planning

用于端到端无机晶体合成规划的可解释物理信息增强检索生成语言模型

Wei-Jian Jiang, Ye-Nan Sha, Hui Guo, Jie Chen, Yu-Cai Liang, Ke Zhou, Qi-Long Gao, Dong-Lin Han, Xin-Gao Gong, Wan-Jian Yin

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 本研究开发可解释PIRAG-LM模型,构建含13820种晶体的SSKB,合成方法预测准确率达91.4%,指导合成5种新化合物,为材料发现与实验搭建桥梁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26086 2026-08-27 cs.LG cs.AI 新提交 81%

TraceML: An Empirical Analysis of Human-Agent Planning in Machine Learning Development

TraceML:机器学习开发中人类-智能体规划的实证分析

Jiarui Yan, Weiwei Sun, Sijie Li, Wenhan Li, Yiming Yang

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 TraceML通过构建人类与智能体在Kaggle竞赛中的配对轨迹数据集,实证分析了人类与智能体在机器学习开发规划上的差异,发现智能体存在行为循环问题,提炼的人类规划提示可缩小部分差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18073 2026-08-27 cs.AI cs.CL cs.LG 版本更新 80%

Infer Human's Intentions Before Following Natural Language Instructions

在遵循自然语言指令前推断人类的意图

Yanming Wan, Yue Wu, Yiping Wang, Jiayuan Mao, Natasha Jaques

专题命中 规划推理 :reasoning(abstract,abstract_cn);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对人类指令的歧义问题,提出FISER框架,通过显式推断人类意图改进协作具身任务的指令遵循,在HandMeThat基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏