arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11104 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11104 篇

2605.08279 2026-05-12 cs.LG cs.AI 62%

LaWM: Least Action World Models for Long-Horizon Physical Consistency from Visual Observations

LaWM:基于视觉观测的最短作用世界模型用于长时间物理一致性

Qixin Xiao, Maani Ghaffari

机构 * University of Michigan(密歇根大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 LaWM通过在视觉潜在空间中实现最小作用原理,提升长horizon视觉预测的物理一致性,改进了物理不变性、背景一致性、运动平滑度和外观几何预测指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08140 2026-05-12 physics.ins-det cs.AI cs.LG 62%

Forecasting Source Stability in Scientific Experiments using Temporal Learning Models: A Case Study from Tritium Monitoring

利用时间学习模型预测科学实验中的源稳定性:氚监测的案例研究

Nicholas Tan Jerome, Nadia Aouadi, Christoph Koehler, Suren Chilingaryan, Andreas Kopmann

机构 * Institute for Data Processing(数据处理研究所) Schmalkalden University of Applied Sciences(施马尔卡尔登应用科学大学) Technical University Munich(慕尼黑技术大学) Max-Planck-Institut für Kernphysik(马克斯·普朗克核物理研究所)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文利用深度学习模型预测氚源稳定性,解决传统方法在稀疏不稳定事件和长预测周期中的不足,通过N-BEATS模型优化大规模物理实验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07677 2026-05-11 cs.IR cs.AI cs.CL 62%

TRACE: Tourism Recommendation with Accountable Citation Evidence

TRACE:基于可问责引用证据的旅游推荐

Zixu Zhao, Sijin Wang, Yu Hou, Yuanyuan Xu, Yufan Sheng, Xike Xie, Wenjie Zhang, Won-Yong Shin, Xin Cao

机构 * UNSW Sydney(新南威尔士大学悉尼分校) University of Adelaide(阿德莱德大学) Yonsei University(延世大学) USTC(中国科学技术大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 TRACE通过多轮对话结合评论引用和显式拒绝机制,解决旅游推荐中信任、可验证性和适应性问题,提出三项能力差距并验证评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07505 2026-05-11 cs.AI cs.LG 62%

LiteGUI: Distilling Compact GUI Agents with Reinforcement Learning

LiteGUI: 通过强化学习蒸馏紧凑的GUI代理

Yubin Wu, Zicheng Cai, Liping Ning, Hua Wang, Zhi Chen, Yaohua Tang, Hao Chen

机构 * Moore Threads AI

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种无需监督微调的训练方法,通过引导在线蒸馏和多解决方案双层GRPO框架,提升小规模模型在GUI任务中的性能和探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07129 2026-05-11 cs.IR cs.AI cs.LG 62%

RRCM: Ranking-Driven Retrieval over Collaborative and Meta Memories for LLM Recommendation

RRCM:基于协作和元记忆的排序驱动检索用于LLM推荐

Shijun Li, Wooseong Yang, Yu Wang, Tianxin Wei, Joydeep Ghosh

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Illinois at Chicago(伊利诺伊大学香槟分校) Capital One AI Foundations(Capital One AI基金会) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 RRCM通过排序驱动的检索与推理框架,解决LLM推荐中构建相关上下文的挑战,利用自然语言表示的协作和元记忆,实现灵活的证据获取,提升推荐质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07042 2026-05-11 cs.AI cs.LG 62%

The Context Gathering Decision Process: A POMDP Framework for Agentic Search

上下文收集决策过程:一种用于代理搜索的POMDP框架

Chinmaya Kausik, Adith Swaminathan, Nathan Kallus

机构 * University of Michigan(密歇根大学) Netflix

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CGDP框架,通过将LLM行为建模为近似汤普森采样,引入谓词方法分解搜索过程,并设计两种干预措施提升多跳推理能力。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06908 2026-05-11 cs.LG cs.AI 62%

Same Signal, Opposite Meaning: Direction-Informed Adaptive Learning for LLM Agents

同信号,异意义:方向感知的自适应学习用于大语言模型代理

Ziming Li, Jiatan Huang, Xiaoguang Guo, Guilin Wang, Chuxu Zhang

机构 * University of Connecticut(康奈尔大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 规划推理 :test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DIAL方法,通过方向感知的自适应学习解决LLM代理中计算需求与计算适宜性差异问题,提升性能-成本平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06716 2026-05-11 cs.AI cs.CL 62%

From Storage to Experience: A Survey on the Evolution of LLM Agent Memory Mechanisms

从存储到经验:LLM代理记忆机制演化的综述

Jinghao Luo, Yuchen Tian, Chuxue Cao, Ziyang Luo, Hongzhan Lin, Kaixin Li, Chuyi Kong, Ruichao Yang, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) South China Normal University(南方中国师范大学) Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) University of Science and Technology Beijing(北京科技大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了LLM代理记忆机制的发展,提出三阶段框架,分析长程一致性、动态环境挑战和持续学习目标,探讨前瞻性探索与跨轨迹抽象等前沿机制,为下一代LLM代理设计提供指导。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24372 2026-05-11 cs.CL cs.AI cs.NE 62%

SeaEvo: Advancing Algorithm Discovery with Strategy Space Evolution

SeaEvo:通过策略空间进化推进算法发现

Sichun Luo, Yi Huang, Haochen Luo, Fengyuan Liu, Guanzhi Deng, Lei Li, Qinghua Yao, Zefa Hu, Junlan Feng, Qi Liu

机构 * The University of Hong Kong(香港大学) JIUTIAN Research, China Mobile(钧天研究院,中国移动) City University of Hong Kong(城市大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SeaEvo通过策略空间进化层,将语言级策略推理转化为群体级进化状态,提升LLM引导的程序搜索效果,实现算法发现、系统优化和智能体设计任务的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21877 2026-05-08 cs.LG cs.AI 62%

P^2O: Joint Policy and Prompt Optimization

P²O:联合策略和提示优化

Xinyu Lu, Kaiqi Zhang, Jinglin Yang, Boxi Cao, Yaojie Lu, Hongyu Lin, Min He, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) National Computer Network Emergency Response Technical Team/Coordination Center of China(中国国家计算机网络应急技术协调中心)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出P²O方法,通过交替更新连续策略与离散提示,解决RLVR在难样本上的优势崩溃问题,提升模型泛化能力并提升性能9.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05329 2026-05-08 cs.AI cs.LG 62%

Understanding Annotator Safety Policy with Interpretability

通过可解释性理解标注者安全政策

Alex Oesterling, Donghao Ren, Yannick Assogba, Dominik Moritz, Sunnie S. Y. Kim, Leon Gatys, Fred Hohman

机构 * Harvard University(哈佛大学) Apple(苹果公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Annotator Policy Models,通过学习标注行为揭示安全政策差异,解决标注分歧根源问题,提升安全政策设计的透明性和包容性。

Comments 38 pages, 13 figures, ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00742 2026-05-08 cs.AI cs.LG stat.ML 62%

Position: agentic AI orchestration should be Bayes-consistent

位置:代理AI协调应具有贝叶斯一致性

Theodore Papamarkou, Pierre Alquier, Matthias Bauer, Wray Buntine, Andrew Davison, Gintare Karolina Dziugaite, Maurizio Filippone, Andrew Y. K. Foong, Vincent Fortuin, Dimitris Fouskakis, Jes Frellsen, Eyke Hüllermeier, Theofanis Karaletsos, Mohammad Emtiyaz Khan, Nikita Kotelevskii, Salem Lahlou, Yingzhen Li, Fang Liu, Clare Lyle, Thomas Möllenhoff, Konstantina Palla, Maxim Panov, Yusuf Sale, Kajetan Schweighofer, Artem Shelmanov, Siddharth Swaroop, Martin Trapp, Willem Waegeman, Andrew Gordon Wilson, Alexey Zaytsev

机构 * ESSEC Business School(ESSEC商学院) VinUniversity(文大学) Imperial College London(伦敦帝国理工学院) Mila - Quebec AI Institute(魁北克人工智能研究所) Technical University of Denmark(丹麦技术大学) Pyramidal Inc.(Pyramidal公司) University of Notre Dame(诺特大学) Cognizant AI Lab(Cognizant人工智能实验室) University College London(伦敦大学学院) KTH Royal Institute of Technology(瑞典皇家理工学院) Ghent University(根特大学) New York University(纽约大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了在代理AI系统中,贝叶斯原则在协调层的应用,而非LLM参数,以提升决策一致性和协作效率。

Comments Accepted for publication at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00938 2026-05-05 cs.LG cs.AI 62%

Fusing Urban Structure and Semantics: A Conditional Diffusion Model for Cross-City OD Matrix Generation

融合城市结构与语义:一种基于条件扩散模型的跨城市OD矩阵生成方法

Bin Chen, Zhuoya Meng, Fang Yang, Runkang Guo, Jingtao Ding, Yin Zhang, Chuan Ai, Zhengqiu Zhu

机构 * Institute of Intelligent Computing, University of Electronic Science and Technology of China (UESTC)(电子科技大学智能计算研究所) College of Systems Engineering, National University of Defense Technology(国防科技大学系统工程学院) Department of Electronic Engineering, Beijing National Research Center for Information Science and Technology (BNRist)(信息科学与技术国家研究中心电子工程系) School of Information and Communication Engineering, University of Electronic Science and Technology of China (UESTC)(电子科技大学信息与通信工程学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SE DAN模型,通过融合城市语义与空间约束生成跨城市OD矩阵,实验显示其在RMSE上优于现有方法,并在不同城市场景中保持鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00909 2026-05-05 cs.AI cond-mat.mtrl-sci cs.LG 62%

Accelerating battery research with an AI interface between FINALES and Kadi4Mat

用AI接口加速电池研究:连接FINALES与Kadi4Mat

Giovanna Tosato, Leon Merker, Monika Vogler, Michael Selzer, Arnd Koeppe

机构 * Institute for Applied Materials - Microstructure Modeling and Simulation (IAM-MMS)(应用材料研究所-微结构建模与模拟研究所) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) TUM School of Natural Sciences, Department of Chemistry, Chair of Digital Catalysis, Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑工业大学自然科学学院,化学系,数字催化学系,慕尼黑机器人与智能机器研究所) Munich Data Science Institute (MDSI)(慕尼黑数据科学研究所) Munich Institute of Integrated Materials, Energy and Process Engineering (MEP)(慕尼黑集成材料、能源与过程工程研究所) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Technical University of Munich(慕尼黑技术大学) Helmholtz Institute Ulm (HIU)(乌尔姆赫尔姆霍尔茨研究所) Institute of Nanotechnology - Research Data Management (INT-RDM)(纳米技术研究所-研究数据管理研究所) Institute of Nanotechnology - Microstructure Simulation (INT-MSS)(纳米技术研究所-微结构模拟研究所)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过AI接口优化电池形成协议,平衡形成时间和EOL性能,建立可互操作的框架促进数据驱动优化。

Comments Main manuscript: 21 pages, 9 figures. Supporting material: 3 pages, 5 figures. Submitted to "Batteries & Supercaps", currently under revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06091 2026-05-05 cs.CL cs.AI cs.MA 62%

Social Dynamics as Critical Vulnerabilities that Undermine Objective Decision-Making in LLM Collectives

社交动态作为削弱LLM集体客观决策的脆弱性

Changgeon Ko, Jisu Shin, Hoyun Song, Huije Lee, Eui Jun Hwang, Jong C. Park

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了社交动态如何影响LLM集体中代表代理的决策准确性,发现社交压力增加时,代理性能显著下降,且修辞策略会影响判断。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11144 2026-05-05 cs.AI cs.CL 62%

$How^{2}$: How to learn from procedural How-to questions

$How^{2}$: 如何从过程性如何问题中学习

Gautier Dagan, Frank Keller, Alex Lascarides

机构 * University of Edinburgh(爱丁堡大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出$How^{2}$框架,使智能体能提问、存储并复用如何问题答案,提升长期学习能力。在Plancraft环境中,抽象化答案对任务完成更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00226 2026-05-04 cs.CL cs.AI cs.GT 62%

Why Do LLMs Struggle in Strategic Play? Broken Links Between Observations, Beliefs, and Actions

为什么LLMs在战略博弈中表现不佳?观察、信念和行动之间的断裂链接

Jan Sobotka, Mustafa O. Karabag, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) EPFL(苏黎世联邦理工学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了LLMs在不完全信息博弈中决策失败的原因,揭示了观察-信念和信念-行动之间的两大内在缺陷,通过实验验证了LLMs在多步推理中的信念不稳定性及行动转换的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17175 2026-05-01 cs.LG cs.AI q-bio.BM 62%

RosettaSearch: Multi-Objective Inference-Time Search for Protein Sequence Design

RosettaSearch:蛋白质序列设计的多目标推理时间搜索

Meghana Kshirsagar, Allen Nie, Ching-An Cheng, Fanglei Xue, Rahul Dodhia, Juan Lavista Ferres, Kevin K. Yang, Frank DiMaio

机构 * AI for Good, Microsoft Redmond(微软红mond AI for Good) Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) Institute for Protein Design University of Washington(蛋白质设计研究所华盛顿大学) Microsoft Research New England(微软新英格兰研究) Department of Biochemistry Institute for Protein Design University of Washington(生物化学系蛋白质设计研究所华盛顿大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 RosettaSearch通过大语言模型作为生成优化器,在受控探索与利用中改进蛋白质序列设计,实现结构保真度提升2.5倍,适用于多种LLM家族和独立结构预测 oracle。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22063 2026-04-30 cs.LG cs.AI 62%

Reliability Auditing for Downstream LLM tasks in Psychiatry: LLM-Generated Hospitalization Risk Scores

精神科下游LLM任务中的可靠性审计:LLM生成的住院风险评分

Shevya Panda, Shinjini Bose, Ananya Joshi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了LLM在精神科住院风险评分中的可靠性问题,通过合成患者数据评估提示设计和非临床信息对预测稳定性的影响,揭示了非临床信息对模型输出的显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23163 2026-04-30 cs.AI cs.CL cs.CR cs.IT cs.MA math.IT 62%

A Decision-Theoretic Formalisation of Steganography With Applications to LLM Monitoring

基于决策理论的隐写术形式化及其在大语言模型监控中的应用

Usman Anwar, Julianna Piskorz, David D. Baek, David Africa, Jim Weatherall, Max Tegmark, Christian Schroeder de Witt, Mihaela van der Schaar, David Krueger

机构 * University of Cambridge(剑桥大学) Massachusetts Institute of Technology(麻省理工学院) UK AI Safety Institute(英国人工智能安全研究所) University of Oxford(牛津大学) Mila, University of Montreal(蒙特利尔大学米尔人工智能实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出决策理论视角下的隐写术形式化方法,通过通用V-信息量定义隐写差距,用于检测和缓解大语言模型中的隐写推理行为。

Comments First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26501 2026-04-30 cs.CL cs.AI cs.HC 62%

Tree-of-Text: A Tree-based Prompting Framework for Table-to-Text Generation in the Sports Domain

树-文本:一种基于树的提示框架,用于体育领域中的表格到文本生成

Shang-Hsuan Chiang, Tsan-Tsung Yang, An-Zi Yen, Wen-Chih Peng

机构 * National Yang Ming Chiao Tung University

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Tree-of-Text框架,通过三阶段生成过程提升表格到文本生成的精度与效率,在多个体育数据集上表现优异。

Comments Accepted by ACL SRW 2025: Long Paper (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26235 2026-04-30 cs.CR cs.AI cs.CL 62%

LATTICE: Evaluating Decision Support Utility of Crypto Agents

LATTICE:评估加密代理决策支持效用的基准

Aaron Chan, Tengfei Li, Tianyi Xiao, Angela Chen, Junyi Du, Xiang Ren

机构 * Sahara AI University of Southern California(南加州大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LATTICE基准,用于评估加密代理在真实用户场景中的决策支持能力,通过六个评估维度、16种任务类型和LLM评委,实现大规模可扩展评估,揭示不同代理在决策支持质量上的显著差异及权衡。

Comments 15 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25982 2026-04-30 cs.LG cs.AI cs.CY cs.ET 62%

Open Problems in Frontier AI Risk Management

前沿人工智能风险管理中的开放问题

Marta Ziosi, Miro Plueckebaum, Stephen Casper, Henry Papadatos, Ze Shen Chin, Peter Slattery, James Gealy, Tim G. J. Rudner, Brian Tse, Ariel Gil, Patricia Paskov, Maximilian Negele, Rokas Gipiškis, Nada Madkour, Vera Lummis, Rupal Jain, Luise Eder, Kristina Fort, Malou C. van Draanen Glismann, Inès Belhadj, Amin Oueslati, Anna K. Wisakanto, Richard Mallah, Koen Holtman, Ranj Zuhdi, Daniel S. Schiff, Jessica Newman, Malcolm Murray, Robert Trager

机构 * Oxford Martin AI Governance Initiative, University of Oxford(牛津大学人工智能治理倡议) MIT Computer Science and Artificial Intelligence Laboratory, MIT(麻省理工学院计算机科学与人工智能实验室) MIT Future Tech(麻省理工学院未来技术) Stanford University(斯坦福大学) Governance and Responsible AI Lab, Purdue University(普渡大学治理与负责任的人工智能实验室) University of Toronto(多伦多大学) Mercatus Center, George Mason University(乔治·马歇尔大学麦卡锡中心) Vilnius University(维尔纽斯大学) Vijil SaferAI AI Standards Lab(人工智能标准实验室) The Future Society(未来社会) Concordia AI(康科德人工智能) Pivotal Research Center for AI Risk Management & Alignment(人工智能风险管理和对齐中心) UC Berkeley Center for Long-Term Cybersecurity(伯克利大学长期网络安全中心) Independent(独立)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨前沿人工智能风险管理中的核心问题,通过文献综述识别未解决的挑战,并分类问题类型以指导未来研究与治理。

Comments 81 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09870 2026-04-30 cs.HC cs.AI cs.CL 62%

Vibe Check: Understanding the Effects of LLM-Based Conversational Agents' Personality and Alignment on User Perceptions in Goal-Oriented Tasks

Vibe Check: 探讨基于大语言模型的对话代理的性格和对齐对用户在目标导向任务中的感知影响

Hasibur Rahman, Smit Desai

机构 * Northeastern University(东北大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了对话代理性格表达水平和用户与代理性格对齐如何影响用户在目标导向任务中的感知,发现中等表达水平在多个维度上表现最佳,性格对齐进一步提升了结果,尤其在外向性和情绪稳定性和方面影响显著。

Comments 30 pages, CHI 2026 conference paper (article no. 371)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25040 2026-04-29 cs.AI cs.CL 62%

Leverage Laws: A Per-Task Framework for Human-Agent Collaboration

利用率法则:一种面向任务的人机协作框架

Stan Loosmore

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种面向任务的利用率比率,用于衡量人机协作中人类工作被代理所替代的比例,结合信息需求的流向和时间成本,探讨了利用率的渐进行为及任务新颖性对规划的影响。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24832 2026-04-29 cs.LG cs.AI 62%

On the Trainability of Masked Diffusion Language Models via Blockwise Locality

通过块级局部性训练掩码扩散语言模型

Yuxiang Wang, Yu Xiang, Baojian Zhou, Qifang Zhao, Keyue Jiang, Yanghua Xiao, Xiaoxiao Xu

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Alibaba Group, China(阿里巴巴集团,中国)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究通过块级局部性改进掩码扩散语言模型,发现其在结构生成任务中稳定性不足,提出Jigsaw和Scatter模型提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12290 2026-04-28 cs.AI cs.CL 62%

Frontier-Eng: Benchmarking Self-Evolving Agents on Real-World Engineering Tasks with Generative Optimization

Frontier-Eng:基于生成优化的现实工程任务中自演化代理的基准测试

Yizhe Chi, Deyao Hong, Dapeng Jiang, Tianwei Luo, Kaisen Yang, Boshi Zhang, Zhe Cao, Xiaoyan Fan, Bingxiang He, Han Hao, Weiyang Jin, Dianqiao Lei, Qingle Liu, Houde Qian, Bowen Wang, Situ Wang, Youjie Zheng, Yifan Zhou, Calvin Xiao, Eren Cai, Qinhuai Na

机构 * Navers Lab(Navers实验室)

专题命中 规划推理 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 Frontier-Eng通过工业级模拟器和验证器,评估生成优化中代理在现实工程任务中的表现,发现GPT 5.4表现最稳健,但所有模型仍面临挑战,分析显示改进频率和幅度呈双幂律衰减。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23988 2026-04-28 cs.LG cs.AI 62%

Hindsight Preference Optimization for Financial Time Series Advisory

金融时间序列建议的 hindsight 偏好优化

Yanwei Cui, Guanghui Wang, Xing Zhang, Peiyang He, Ziyuan Li, Bing Zhu, Wei Qiu, Xusheng Wang, Zheng Yu, Anqi Xin

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) HSBC Holdings Plc(汇丰控股有限公司) HSBC Technology Center China(汇丰技术中心(中国))

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过回顾性偏好优化方法,利用观测结果生成偏好对,提升语言模型在金融时间序列预测中的建议质量。

Comments Accepted at ICLR 2026 TSALM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23837 2026-04-28 cs.CL cs.LG 62%

One Size Fits None: Heuristic Collapse in LLM Investment Advice

一个尺寸无法适配:在LLM投资建议中的启发式崩溃

Jillian Ross, Andrew W. Lo

机构 * Computer Science and Artificial Intelligence Laboratory(计算机科学与人工智能实验室) Massachusetts Institute of Technology(麻省理工学院) Sloan School of Management(斯隆管理学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究发现前沿LLM在投资建议中存在启发式崩溃,决策主要依赖自我报告的风险承受能力而非全面考虑,网络搜索部分缓解但未解决此问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03768 2026-04-28 cs.AI cs.LG 62%

RL-Driven Sustainable Land-Use Allocation for the Lake Malawi Basin

基于强化学习的可持续土地利用分配:马拉维盆地

Ying Yao

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于深度强化学习的框架,用于优化马拉维盆地的土地利用分配以最大化生态系统服务价值,通过空间奖励塑造引导生态友好的土地利用模式。

Comments 9 pages, 11 figures; added baseline comparison under "Result" section; revised limitation and discussion

详情

展开后加载摘要…

URL PDF HTML 收藏