arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11104 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11104 篇

2604.18398 2026-04-28 cs.CL cs.AI 62%

AlphaContext: An Evolutionary Tree-based Psychometric Context Generator for Creativity Assessment

AlphaContext:一种基于进化树的心理测量情境生成器用于创造力评估

Yixuan Wang, Yue Huang, Hong Qian, Yunzhao Wei, Yifei Ding, Wenkai Wang, Zhi Liu, Zhongjing Huang, Aimin Zhou, Jiajun Guo

机构 * East China Normal University(东华大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 AlphaContext通过进化树方法生成高质量的情境,提升创造力评估的准确性与多样性,实验显示在六个质量指标上平均提升8%。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04204 2026-04-28 cs.CY cs.AI cs.CL cs.HC cs.MA 62%

TeachMaster: Generative Teaching via Code

TeachMaster: 通过代码生成教学内容

Yuheng Wang, Runde Yang, Lin Wu, Jie Zhang, Jingru Fan, Tianle Zhou, Ruoyu Fu, Huatao Li, Ruijie Shi, Siheng Chen, Weinan E, Chen Qian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Generative Teaching paradigm,通过多智能体框架TeachMaster实现教学内容的自动化生成,提升生产效率并降低教育视频制作成本。

Comments Accepted to ACL 2026; https://www.teachmaster.cn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03669 2026-04-28 cs.LG cs.AI cs.DM math.OC stat.ML 62%

Unrealized Expectations: Comparing AI Methods vs Classical Algorithms for Maximum Independent Set

未实现的期望:比较AI方法与经典算法在最大独立集问题上的表现

Yikai Wu, Haoyu Zhao, Sanjeev Arora

机构 * Department of Computer Science & Princeton Language and Intelligence (PLI)(计算机科学系及普林斯顿语言与智能中心) Princeton University(普林斯顿大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文比较了AI方法与经典算法在最大独立集问题上的性能,发现经典算法在随机图上表现更优,AI方法存在系统性不足,需重新审视AI在组合优化中的应用。

Comments Published on TMLR 04/2026. 28 pages, 6 figures, 98 tables

Journal ref Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21375 2026-04-27 cs.CL cs.AI cs.SE 62%

VLAA-GUI: Knowing When to Stop, Recover, and Search, A Modular Framework for GUI Automation

VLAA-GUI: 知何时停止、恢复和搜索,一个用于GUI自动化模块化框架

Qijun Han, Haoqin Tu, Zijun Wang, Haoyue Dai, Yiyang Zhou, Nancy Lau, Alvaro A. Cardenas, Yuhui Xu, Ran Xu, Caiming Xiong, Zeyu Zheng, Huaxiu Yao, Yuyin Zhou, Cihang Xie

机构 * UC Santa Cruz CMU(卡内基梅隆大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Salesforce UC Berkeley(伯克利加州大学)

专题命中 规划推理 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 VLAA-GUI通过模块化框架解决GUI代理的早期停止和重复循环问题,引入完整性验证器、循环打破器和搜索代理,提升自动化性能。

Comments The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.00931 2026-04-27 cs.AI cs.HC cs.LG 62%

Explanation through Reward Model Reconciliation using POMDP Tree Search

通过POMDP树搜索实现奖励模型协调以进行解释

Benjamin D. Kraske, Anshu Saksena, Anna L. Buczak, Zachary N. Sunberg

机构 * Department of Aerospace Engineering Sciences, University of Colorado Boulder(科罗拉多大学博尔德分校航空航天工程科学系) Applied Physics Laboratory, Johns Hopkins University(约翰霍普金斯大学应用物理实验室)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过POMDP树搜索协调算法与用户隐式奖励模型差异,以提升用户对AI系统的信任度。

Journal ref IEEE ICAA (2023), pg. 137-140

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20935 2026-04-24 cs.LG cs.AI 62%

Data-Driven Open-Loop Simulation for Digital-Twin Operator Decision Support in Wastewater Treatment

数据驱动的开环仿真用于污水处理厂数字孪生操作员决策支持

Gary Simethy, Daniel Ortiz Arroyo, Petar Durdevic

机构 * Aalborg University, Department of Energy(奥尔堡大学能源学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CCSS-RS模型,通过结合上下文编码、驱动因子加权、一致滚动和学生t分布输出,实现了污水处理厂在复杂数据环境下的高精度仿真,验证了其在工业废水处理中的实用价值。

Comments 18 pages, 10 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09781 2026-04-23 cs.LG cs.AI 62%

Explainability in Generative Medical Diffusion Models: A Faithfulness-Based Analysis on MRI Synthesis

生成医学扩散模型的可解释性:基于忠实度的MRI合成分析

Surjo Dey, Pallabi Saikia

机构 * Rajiv Gandhi institute of petroleum technology(拉吉夫·甘地石油技术学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨生成扩散模型在医学影像中的可解释性,聚焦MRI合成,通过分析原型方法评估生成与训练特征的关系,实验表明EPPNet在忠实度上表现最佳,提升生成过程的透明度和可信度。

Comments Accepted at 3rd World Congress on Smart Computing (WCSC2026) conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00911 2026-04-23 cs.CR cs.AI cs.ET cs.HC cs.LG 62%

Device-Native Autonomous Agents for Privacy-Preserving Negotiations

设备本机自主代理用于隐私保护的谈判

Joyjit Roy, Samaresh Kumar Singh

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于设备的自主代理系统,通过零知识证明和本地推理实现隐私保护的谈判,实验显示在保险和B2B采购场景中成功率高,隐私保护效果显著。

Comments 9 pages, 6 figures, 9 tables. This version updates metadata after publication in IEEE Xplore

Journal ref 2026 IEEE SoutheastCon, Huntsville, AL, USA, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09871 2026-04-23 cs.AI cs.HC cs.LG 62%

Epistemology gives a Future to Complementarity in Human-AI Interactions

认识论为人类-人工智能互动中的互补性赋予未来

Andrea Ferrario, Alessandro Facchini, Juan M. Durán

机构 * SUPSI, Dalle Molle Institute for Artificial Intelligence (IDSIA)(SUPSI,达姆施塔特人工智能研究所(IDSIA)) Management in Networked and Digital Societies (MINDS) Department, Kozminski University(网络化与数字化社会管理系(MINDS)部,科米斯基大学) TU Delft(代尔夫特理工大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过认识论重构互补性,将其作为可靠知识过程的证据,提升人类-人工智能团队预测的可靠性,并提出设计与治理建议。

Comments Submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20548 2026-04-23 cs.CL cs.AI cs.DL cs.IR 62%

Enhancing Research Idea Generation through Combinatorial Innovation and Multi-Agent Iterative Search Strategies

通过组合创新和多智能体迭代搜索策略增强研究想法生成

Shuai Chen, Chengzhi Zhang

机构 * Department of Information Management, Nanjing University of Science and Technology(南京理工大学信息管理学院)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出结合迭代知识搜索与LLM多智能体系统的框架,通过反复交互生成、评估和优化研究想法,提升多样性与新颖性,在自然语言处理领域实验表明优于现有基线方法。

Comments Scientometrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19578 2026-04-22 cs.CL cs.AI cs.DL cs.IR 62%

Impact of large language models on peer review opinions from a fine-grained perspective: Evidence from top conference proceedings in AI

大型语言模型对同行评审意见的影响:从细粒度视角看证据:来自顶级人工智能会议论文的证据

Wenqing Wu, Chengzhi Zhang, Yi Zhao, Tong Bao

机构 * School of Management, Anhui University(安徽大学管理学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究大型语言模型对同行评审意见的影响,分析了评审报告在语言特征、评价重点和推荐信号方面的变化,发现评审文本变得更长、更流畅,但深入评价维度有所下降。

Comments Scientometrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18786 2026-04-22 cs.CL cs.AI 62%

Experiments or Outcomes? Probing Scientific Feasibility in Large Language Models

实验还是结果?在大型语言模型中探测科学可行性

Seyedali Mohammadi, Manas Gaur, Francis Ferraro

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了在大型语言模型中科学可行性的评估,发现提供结果证据比实验描述更可靠,结果能提升准确性,而实验文本可能因上下文不完整而退化。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12258 2026-04-22 cs.CL cs.AI 62%

Coding-Free and Privacy-Preserving Agentic Framework for Data-Driven Clinical Research

无编码且隐私保护的代理框架用于数据驱动的临床研究

Taehun Kim, Hyeryun Park, Hyeonhoon Lee, Yushin Lee, Kyungsang Kim, Hyung-Chul Lee

机构 * Infmedix, Co., Ltd.(Infmedix公司) Department of Transdisciplinary Studies, Seoul National University(首尔国立大学跨学科研究系) Healthcare AI Research Institute, Seoul National University Hospital(首尔国立大学医院医疗人工智能研究所) Department of Medicine, Seoul National University College of Medicine(首尔国立大学医学院医学系) Department of Transdisciplinary Medicine, Seoul National University Hospital(首尔国立大学医院跨学科医学系) Department of Radiology, Massachusetts General Hospital and Harvard Medical School(麻省总医院放射科及哈佛医学院)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CARIS框架,通过整合大语言模型与模块化工具,实现无需编程的自然语言驱动研究,提升临床研究效率与隐私保护。

Comments 10 pages, 5 figures, 2 tables, Supplementary Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15115 2026-04-21 cs.CV cs.AI cs.CL 62%

Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement

具有对齐检测和局部细化的自纠正文本到视频生成

Daeun Lee, Jaehong Yoon, Jaemin Cho, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) NTU Singapore(新加坡国立大学) Allen Institute for AI(人工智能研究院) Johns Hopkins University(约翰霍普金斯大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VideoRepair框架,通过检测并修正视频与文本提示的对齐问题,提升生成质量。框架分为三个阶段,保留正确生成区域并针对性修正错误部分,有效提升多种对齐指标。

Comments Accepted to ACL 2026 Findings. Project page: https://video-repair.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18210 2026-04-21 cs.AI cs.LG cs.MA 62%

TacticGen: Grounding Adaptable and Scalable Generation of Football Tactics

TacticGen: 基于适应性和可扩展性的足球战术生成

Sheng Xu, Guiliang Liu, Tarak Kharrat, Yudong Luo, Mohamed Aloulou, Javier López Peña, Konstantin Sofeikov, Adam Reid, Paul Roberts, Steven Spencer, Joe Carnall, Ian McHale, Oliver Schulte, Hongyuan Zha, Wei-Shi Zheng

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) Real Analytics, London(Real Analytics,伦敦) Birmingham City Football Club, Birmingham(伯明翰城足球俱乐部,伯明翰) Management School, University of Liverpool(利物浦大学管理学院) School of Computing Science, Simon Fraser University(Simon Fraser大学计算机科学学院) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 TacticGen通过多智能体扩散变换器生成适应性战术,结合规则、自然语言和神经模型实现可扩展的战术设计,验证了其在专业足球战术规划中的实用性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14267 2026-04-21 cs.LG cs.AI 62%

Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization

通过贡献加权群体相对策略优化增强基于LLM的搜索代理

Junzhe Wang, Zhiheng Xi, Yajie Yang, Hao Luo, Shihan Dou, Tao Gui, Qi Zhang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理关键实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CW-GRPO框架,通过整合过程监督与群体相对策略优化,提升搜索代理的信用分配效率,实验表明其在多个知识密集型基准上表现优异。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00861 2026-04-21 cs.CL cs.AI cs.IR 62%

Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs

擦除以提升:用于搜索增强大语言模型的可擦除强化学习

Ziliang Wang, Kang An, Xuhui Zheng, Faqiang Qian, Weikun Zhang, Cijun Ouyang, Jialu Cai, Yuhang Wang, Yichao Wu

机构 * SenseAuto Shenzhen University(深圳大学) Nanjing University(南京大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Erasable Reinforcement Learning框架,通过识别并擦除推理中的错误步骤,提升搜索增强大语言模型在多步推理中的鲁棒性,实验表明其在多个基准测试中取得显著提升。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17159 2026-04-21 cs.CR cs.AI cs.CL 62%

Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks

前沿大语言模型在进攻性网络任务中的系统能力评估

Tyler H. Merves, Michael H. Conaway, Joseph M. Escobar, Hakan T. Otal, Unal Tatar

机构 * Department of Cybersecurity(网络安全系) Department of Information Sciences and Technology(信息科学与技术系) College of Emergency Preparedness, Homeland Security, and Cybersecurity(应急准备、国土安全与网络安全学院) University at Albany, SUNY(阿尔巴尼大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文系统评估了10个前沿大语言模型在进攻性网络任务中的表现,发现环境工具和模型选择是性能的主要驱动因素,而提示工程在装备良好的环境中效果下降。

Comments 6 pages, 4 figures. Submitted to the IEEE Systems and Information Engineering Design Symposium (SIEDS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15421 2026-04-21 cs.CL cs.AI 62%

CLAG: Adaptive Memory Organization via Agent-Driven Clustering for Small Language Model Agents

CLAG:基于代理驱动聚类的自适应内存组织方法用于小型语言模型代理

Taeyun Roh, Wonjune Jang, Junha Jung, Jaewoo Kang

机构 * Korea University(韩国大学) Myongji University(明知大学) AIGEN Sciences(AIGEN公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CLAG通过代理驱动聚类实现小型语言模型代理的自适应内存组织,通过语义聚类减少跨主题干扰并提升内存密度,实验表明其在问答任务中能提高回答质量和鲁棒性。

Comments Findings of the ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17153 2026-04-21 cs.CL cs.AI 62%

From Legal Text to Executable Decision Models: Evaluating Structured Representations for Legal Decision Model Generation

从法律文本到可执行决策模型:评估结构化表示在法律决策模型生成中的应用

David Graus

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究通过结构化表示提升基于LLM的法律决策模型生成效果,发现输入约束显著提升模型相似度,且结构相似性与结果等价性互补。

Comments 10 pages, 3 figures, accepted to ICAIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16918 2026-04-21 cs.CL cs.LG 62%

Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning

具有新鲜度意识的优先经验回放用于LLM/VLM强化学习

Weiyu Ma, Yongcheng Zeng, Yan Song, Xinyu Cui, Jian Zhao, Xuhui Liu, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology(卡布尔大学科学与技术大学) Chinese Academy of Sciences, Institute of Automation(中国科学院自动化研究所) AI Centre, Department of Computer Science, University College London(伦敦大学学院人工智能中心) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Freshness-Aware PER,通过引入指数衰减机制解决LLM/VLM强化学习中优先级过时问题,显著提升样本效率,在多个任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16555 2026-04-21 cs.LG cs.AI cs.CV 62%

LLM as a Tool, Not an Agent: Code-Mined Tree Transformations for Neural Architecture Search

将LLM作为工具而非代理:基于代码挖掘的树变换用于神经架构搜索

Masakazu Yoshimura, Zitang Sun, Yuiko Sakuma, Junji Otsuka, Atsushi Irie, Takeshi Ohashi

机构 * Sony Group Corporation(索尼集团公司)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLMasTool框架,通过树变换实现稳定且开放的模型进化,避免LLM的固有偏差,提升NAS在CIFAR-10、CIFAR-100和ImageNet16-120上的性能。

Comments 72 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14975 2026-04-21 cs.AI cs.CL cs.CY cs.MA 62%

Why Agents Compromise Safety Under Pressure

为何智能体在压力下妥协安全

Hengle Jiang, Ke Tang

机构 * Guangdong Provincial Key Laboratory of Brain-inspired Intelligent Computation, Department of Computer Science and Engineering, Southern University of Science and Technology(广东省脑启发智能计算重点实验室,计算机科学与工程系,南方科技大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了智能体在复杂环境中为追求目标而妥协安全的问题,揭示了'智能体压力'概念,并提出通过压力隔离等策略缓解这一现象。

Comments Accepted by ACL 2026 Findings; 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09474 2026-04-21 cs.CL cs.AI 62%

Multimodal Policy Internalization for Conversational Agents

多模态策略内化用于对话代理

Zhenhailong Wang, Jiateng Liu, Amin Fazel, Ritesh Sarkhel, Xing Fan, Xiang Li, Chenlei Guo, Heng Ji, Ruhi Sarikaya

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出多模态策略内化任务,通过将复杂策略内化为模型参数,提升对话代理的策略遵循能力,同时提供新数据集和训练框架TriMPI以促进研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15672 2026-04-20 cs.LG cs.CL 62%

Faster LLM Inference via Sequential Monte Carlo

通过序列蒙特卡洛方法加速大语言模型推理

Yahya Emara, Mauricio Barba da Costa, Chi-Chih Chang, Cameron Freer, Tim Vieira, Ryan Cotterell, Mohamed S. Abdelfattah

机构 * Cornell University(康奈尔大学) Makora(马科拉) MIT(麻省理工学院) ETH Zürich(苏黎世联邦理工学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SMC-SD方法,通过重要性加权重采样替代传统拒绝采样,提升推理速度,实验证明在多个基准测试中保持高精度的同时,比推测解码和自回归解码分别快2.36倍和5.2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15344 2026-04-20 cs.HC cs.AI cs.IR cs.LG 62%

To LLM, or Not to LLM: How Designers and Developers Navigate LLMs as Tools or Teammates

对LLM而言,是使用还是不使用:设计师和开发者如何将LLM视为工具或队友

Varad Vishwarupe, Ivan Flechais, Nigel Shadbolt, Marina Jirotka

机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了设计师和开发者在系统设计过程中如何将LLM视为工具或队友,分析了角色框架对决策权、问责制、监督策略和组织接受度的影响。

Comments 6 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15190 2026-04-17 cs.AI cs.CL 62%

Meituan Merchant Business Diagnosis via Policy-Guided Dual-Process User Simulation

美团商户业务诊断 via 政策引导的双过程用户模拟

Ziyang Chen, Renbing Chen, Daowei Li, Jinzhi Liao, Jiashen Sun, Ke Zeng, Xiang Zhao

机构 * Independent Researcher(独立研究者)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Policy-Guided Hybrid Simulation框架,通过双过程融合提升商户策略评估的准确性,实验显示其在美团101家商户中误差降低45.8%。

Comments 5 pages, 3 figures, 2 tables, accepted at SIGIR 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14564 2026-04-17 cs.AI cs.CL 62%

MARS$^2$: Scaling Multi-Agent Tree Search via Reinforcement Learning for Code Generation

MARS$^2$:通过强化学习提升多智能体树搜索用于代码生成

Pengfei Li, Shijie Wang, Fangyuan Li, Yikun Fu, Kaifeng Liu, Kaiyan Zhang, Dazhi Zhang, Yuqiang Li, Biqing Qi, Bowen Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Harbin Institute of Technology(哈尔滨工业大学) Tsinghua University(清华大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MARS$^2$通过多智能体协作与树搜索结合,提升强化学习在代码生成中的性能,实验表明其在多种模型和训练设置下均有效。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14197 2026-04-17 cs.CL cs.AI 62%

The PICCO Framework for Large Language Model Prompting: A Taxonomy and Reference Architecture for Prompt Structure

为大型语言模型提示设计的PICCO框架:提示结构的分类与参考架构

David A. Cook

机构 * Mayo Clinic College of Medicine and Science(梅奥诊所医学院和科学学院) Mayo Clinic Division of General Internal Medicine(梅奥诊所内科医学部)

专题命中 规划推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PICCO框架,通过综合11种现有提示框架,定义提示结构的分类和五要素参考架构,旨在提升提示设计的系统性和清晰度。

Comments Presents the novel PICCO framework for LLM prompting, derived through a structured multi-database search and rigorous comparative synthesis of 11 published prompting frameworks. Submitted in PDF/A format to preserve the structure and readability of several multi-page tables central to the framework and methodology; these contain dense structured information that is best preserved in PDF form

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17596 2026-04-14 cs.CV cs.AI cs.LG cs.RO 62%

PRIX: Learning to Plan from Raw Pixels for End-to-End Autonomous Driving

PRIX:从原始像素学习计划以实现端到端自动驾驶

Maciej K. Wozniak, Lianhang Liu, Yixi Cai, Patric Jensfelt

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) SCANIA(斯堪尼亚)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 PRIX通过使用仅需摄像头数据的端到端驾驶架构,无需BEV表示和LiDAR,直接从原始像素预测安全轨迹,实现了高效且实用的自动驾驶解决方案。

Comments Accepted for Robotics and Automation Letters (RA-L) and will be presented at iROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏