arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1017 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 1017 篇

2605.04568 2026-08-07 cs.LG cs.AI cs.RO 版本更新 62%

Dream-MPC: Gradient-Based Model Predictive Control with Latent Imagination

Dream-MPC:基于梯度与潜在想象的模型预测控制

Jonathan Spieler, Sven Behnke

机构 * Autonomous Intelligent Systems, Computer Science Institute VI - Intelligent Systems(自主智能系统,计算机科学研究所VI - 智能系统) Robotics, Center for Robotics(机器人学,机器人中心) the Lamarr Institute for Machine Learning(拉马尔机器学习研究所) Artificial Intelligence, University of Bonn, Germany(人工智能,波恩大学,德国)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出Dream-MPC方法,通过从展开策略生成少量候选轨迹,并利用学习的世界模型进行梯度上升优化,结合不确定性正则化和时间上的优化迭代摊销,显著提升了底层策略性能,在24个连续控制任务上优于无梯度MPC和现有基线。

Comments Accepted for International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16839 2026-08-07 cs.LG cs.AI 版本更新 62%

Trajectory-guided discharge stratification for heart failure using short-context electronic health record sequence modeling

利用序列建模预测心力衰竭患者一年临床不稳定性和死亡率

Falk Dippel, Yinan Yu, Annika Rosengren, Martin Lindgren, Christina E. Lundberg, Erik Aerts, Martin Adiels, Helen Sjöland

机构 * Sahlgrenska University Hospital(斯德哥尔摩大学医院) Department of Computer Science and Engineering, Chalmers University of Technology and University of Gothenburg(计算机科学与工程系,查尔姆斯理工大学和乌普萨拉大学) Department of Molecular and Clinical Medicine, Sahlgrenska Academy, University of Gothenburg(分子与临床医学系,斯德哥尔摩学院,乌普萨拉大学) Department of Medicine, Geriatrics and Emergency Medicine, Sahlgrenska University Hospital(医学、老年医学和急诊医学系,斯德哥尔摩大学医院) Department of Food and Nutrition, and Sport Science, Faculty of Education, University of Gothenburg(营养学与体育科学系,教育学院,乌普萨拉大学) School of Public Health and Community Medicine, Institute of Medicine, University of Gothenburg(公共卫生与社区医学系,医学院,乌普萨拉大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究通过序列模型预测心力衰竭患者一年内的临床不稳定性和死亡风险,发现Llama模型在有限数据下表现优异,为出院后风险分层提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14407 2026-08-06 cs.IT cs.AI cs.LG math.IT 版本更新 62%

Decision Making Needs Uncertainty Quantification [Lecture Notes]

决策需要不确定性量化[讲义笔记]

Osvaldo Simeone

机构 * Institute for Intelligent Networked Systems, Northeastern University London(智能网络系统研究所,伦敦大学东北学院)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究决策中不确定性量化问题,从基本原理出发,在已知和未知环境分布下,探讨风险中性与厌恶型智能体所需不确定性表示形式,确定解决认知不确定性的三种互补方法,强调可靠决策需匹配不确定性表示及效用保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13028 2026-08-06 cs.LG cs.AI cs.RO 版本更新 62%

TerraZero: Procedural Driving Simulation for Zero-Demonstration Self-Play at Scale

TerraZero:用于大规模零演示自博弈的过程式驾驶模拟

Zhouchonghao Wu, Akshay Rangesh, Weixin Li, Wei-Jer Chang, Zachary Lee, Saeed Bonab, Tim Wang, Wei Zhan

机构 * Applied Intuition(应用直觉)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究旨在训练强大自动驾驶智能体,提出TerraZero过程式驾驶模拟器和自博弈训练堆栈,其速度快、逼真且多样。通过特定方式填充地图生成无限场景,智能体仅靠强化学习训练,能零样本泛化,在多个基准测试中表现出色。

Comments Technical Report from Applied Intuition Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17218 2026-08-04 cs.LG cs.AI 版本更新 62%

Learning Graph-Indexed Trajectory Patterns for Stochastic On-Time Arrival Routing

基于历史感知决策变换器的通用策略梯度用于图信号上的可靠路由

Yuanhang Wang, Xing Wei, Duoxiang Zhao, Zezhou Zhang, Hao Qin, Yuqi Ouyang

机构 * Sichuan University-Pittsburgh Institute(四川大学匹兹堡研究院) Sichuan University(四川大学) College of Computer Science(计算机科学学院) University College Dublin(都柏林大学) School of Electrical and Electronic Engineering(电子与电气工程学院) School of Electronics and Information Engineering(电子与信息工程学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GPG-HT框架,通过整合决策变换器和通用策略梯度优化,解决随机交通网络中考虑不确定和相关旅行时间的问题,提升可靠路由性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11671 2026-08-04 cs.CR cs.AI cs.SE 版本更新 62%

Cochise: A Reference Harness for Autonomous Penetration Testing

Cochise:自主渗透测试的参考框架

Andreas Happe, Jürgen Cito

机构 * TU Wien(维也纳技术大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.SE

AI总结 Cochise提供了一个简洁的自主渗透测试框架,支持通过SSH连接LLM代理与Linux主机,并通过分离的规划-执行架构实现可控环境,同时提供重放和分析工具以支持研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25875 2026-08-03 cs.LG cs.AI 版本更新 62%

A2TTA: Anchored-and-Agile Test-Time Adaptation for Evolving Traffic Sensor Networks

A2TTA:用于不断发展的交通传感器网络的锚定与敏捷测试时自适应

Du Yin, Xiachong Lin, Yue Tan, Jinliang Deng, Estrid He, Hao Xue, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学) Beihang University(北京航空航天大学) RMIT University(皇家墨尔本理工大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对交通传感器网络动态变化致传统预测模型性能下降问题,提出A2TTA框架,将拓扑诱导误差转化为输出校准问题,区分时间自适应,联合应对拓扑演变和多尺度时间偏移,实验证明该框架能有效提升预测性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07699 2026-08-03 cs.CL cs.AI 版本更新 62%

DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity in the Retail Domain

DRIP-R:零售领域决策与推理在现实政策模糊性下的基准测试

Hsuvas Borkakoty, Sebastian Pohl, Cheng Wang, Bei Chen, Yufang Hou

机构 * Interdisciplinary Transformation University Austria(跨学科转型大学奥地利) Amazon Berlin(亚马逊柏林)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 DRIP-R基准测试通过现实零售政策模糊性构建无唯一正确解决方案的场景,评估LLM在模糊政策下的决策与推理能力,揭示其固有的系统性挑战。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13707 2026-07-31 cs.RO cs.AI cs.LG 版本更新 62%

REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning

REFINE-DP:通过强化学习实现人形机器人的动态-操作协调政策微调

Zhaoyuan Gu, Yipu Chen, Zimeng Chai, Alfred Cueva, Thong Nguyen, Yifan Wu, Huishu Xue, Minji Kim, Isaac Legene, Fukang Liu, KyoungMok Kim, Ayan Barula, Yongxin Chen, Ye Zhao

机构 * The Institute for Robotics and Intelligent Machines(机器人与智能机械研究所)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出REFINE-DP框架,通过联合优化扩散政策高层规划器和基于强化学习的低层动态-操作控制器,提升人形机器人在复杂环境中的任务成功率与执行稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20656 2026-07-30 cs.LG cs.AI 版本更新 62%

Adaptive Multi-Horizon Reinforcement Learning

自适应多时间尺度强化学习

Manoosh Samiei, Doina Precup, Paul Masset

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究在复杂环境中强化学习的决策问题,提出自适应多时间尺度方法,能自适应选择和组合时间范围,无需手动调折扣因子,实验证明该方法可提高参数效率及增强适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03273 2026-07-30 cs.CV cs.AI cs.CL 版本更新 62%

VistaHop: Benchmarking Long-Horizon Visual DeepSearch

VistaHop: 视觉深度搜索的多跳视觉推理基准

Hang He, Chuhuai Yue, Chengqi Dong, Chengcheng Wan, Ting Su, Haiying Sun, Jiajun Chai, Xiaohan Wang, Guojun Yin

机构 * East China Normal University(东华大学) Meituan(美团) Shanghai Innovation Institute(上海创新研究院)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出VistaHop基准,通过多跳问答任务评估多模态大推理模型在视觉深度搜索中的迭代图像检查、视觉锚点定位和跨证据链推理能力,实验表明现有模型表现有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14841 2026-07-29 cs.LG cs.AI cs.DC cs.ET 版本更新 62%

Real-Time Driver Safety Scoring Through Inverse Crash Probability Modeling

通过逆事故概率建模实现实时驾驶员安全评分

Joyjit Roy, Samaresh Kumar Singh, Sushanta Das

机构 * Independent Researcher(独立研究员) American Center for Mobility(美国移动中心)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SafeDriver-IQ框架,结合国家事故统计数据和自动驾驶数据,将二分类事故预测模型转化为0-100连续安全评分,提升实时驾驶员反馈的可操作性和解释性。

Comments 10 pages, 13 figures, and 14 tables. Submitted in EIT 2026 Conference hosted by The University of Wisconsin-La Crosse and sponsored by IEEE Region 4 (R4)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24625 2026-07-28 cs.LG cs.AI 版本更新 62%

AutoFed: Personalized Federated Traffic Prediction via Adaptive Prompt

AutoFed: 通过自适应提示实现个性化联邦交通预测

Zijian Zhao, Yitong Shang, Sen Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AutoFed框架,通过自适应提示学习实现个性化联邦交通预测,解决传统联邦学习在非独立同分布数据下的不足,无需手动调参,提升交通预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11912 2026-07-28 cs.LG cs.AI 版本更新 62%

How Transformers Learn to Plan via Multi-Token Prediction

Transformer 如何通过多令牌预测学习规划

Jianhao Huang, Zhanpeng Zhou, Renqiu Xia, Baharan Mirzasoleiman, Weijie Su, Wei Huang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Shanghai Jiao Tong University(上海交通大学) University of Pennsylvania(宾夕法尼亚大学) RIKEN Center for Advanced Intelligence Project(日本理化学研究院先进智能项目中心) The Institute of Statistical Mathematics(统计数学研究所)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究多令牌预测如何促进推理,特别是规划,通过实验和理论分析展示其优于单令牌预测的性能及背后的机制。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01348 2026-07-28 cs.CL cs.LG 版本更新 62%

Does Faithfulness-Guided Alignment Hurt Accuracy? Unlocking Accurate and Faithful Post-Retrieval Reasoning

CRAFT: 通过强化学习进行多跳问答的校准推理与答案忠实轨迹

Yu Liu, Wenxiao Zhang, Diandian Guo, Cong Cao, Fangfang Yuan, Qiang Sun, Yanbing Liu, Jin B. Hong, Zhiyuan Ma

专题命中 规划决策 :planning(abstract);分类 cs.CL、cs.LG

AI总结 CRAFT通过强化学习框架提升多跳问答的推理准确性和答案忠实度,结合确定性奖励和判官奖励,增强推理轨迹的可审计性与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22496 2026-07-28 cs.LG cs.AI 版本更新 62%

Action-Sufficient Goal Representations

动作充分的目标表示

Jinu Hyeon, Woobin Park, Hongjoon Ahn, Taesup Moon

机构 * Department of Electrical and Computer Engineering (ECE), Seoul National University(电子与计算机工程系,首尔国立大学) Interdisciplinary Program in Artificial Intelligence (IPAI), Seoul National University(人工智能交叉项目,首尔国立大学) ASRI / INMC, Seoul National University(ASRI/INMC,首尔国立大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出动作充分性概念,通过信息论框架改进目标表示,使动作学习更有效,实验表明其在离散环境中优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19212 2026-07-27 cs.CL cs.AI cs.CY 版本更新 62%

When Ethics and Payoffs Diverge: LLM Agents in Morally Charged Social Dilemmas

当伦理与收益相悖时:道德两难情境下的大语言模型智能体

Steffen Backmann, David Guzman Piedrahita, Terry Jingchen Zhang, Emanuel Tewolde, Rada Mihalcea, Bernhard Schölkopf, Zhijing Jin

机构 * ETH Zürich(苏黎世联邦理工学院) University of Zurich(苏黎世大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) Max Planck Institute for Intelligent Systems, Tübingen(图宾根人工智能研究所) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究道德要求与利润激励冲突时LLMs在道德两难博弈中的行为,引入\msim评估九个模型,通过ATEs估计因果效应、分析推理轨迹,发现模型道德行为有情境脆弱性,揭示了部署风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21262 2026-07-24 cs.AI cs.CL 版本更新 62%

ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents

ARCO: 基于自适应规则与协同进化的多步LLM智能体

Zihang Tian, Jingsen Zhang, Rui Li, Xiaohe Bo, Yuanzi Li, Xu Chen

机构 * Renmin University of China(中国人民大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出ARCO框架,通过同尺度模型的双头结构(生成头与评分头)实现步骤级规则生成与奖励分配,结合轨迹分解约束和策略协同进化,在多个多跳QA任务上取得最优EM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28282 2026-07-23 cs.LG cs.AI cs.DC 版本更新 62%

Pre-Deployment Complexity Estimation for Federated Perception Systems

联邦感知系统部署前复杂度估计

KMA Solaiman, Shafkat Islam, Ruy de Oliveira, Bharat Bhargava

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Purdue University Northwest(普渡大学西北校区) Purdue University(普渡大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种无需分类器的预部署框架,用于估计联邦学习在分布式环境中的学习复杂度,通过联合建模数据固有属性和环境特征,实验表明该指标与联邦学习性能及通信成本密切相关。

Comments Accepted and presented at Edge AI Research Symposium 2026 (EdgeAI2026), San Diego, CA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13070 2026-07-22 cs.SE cs.AI 版本更新 62%

Falsifiable Release Gates for Self-Improving Systems: Standing Invariants at Scale

用于自我改进系统的可证伪发布门限

Deepak Soni

机构 * AI Architect(人工智能架构师)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究自我改进系统安全声明,提出可证伪发布门限及构建验证方法,在Antahkarana运行时应用,经机器检查确保安全,发布验收结果,明确范围,使结果可重现、门限可在其他框架运行。

Comments 23 pages, 14 figures. Major revision merging the follow-up "Standing Invariants at Scale" into this paper per arXiv moderation: the machine-checked action-safety core preserved across six further releases, six new invariant families with teeth, and real-hardware self-improvement; suite grown from 122 to 563 tests. Software, gate suite, run artifacts, and TLA+ spec are open source

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03087 2026-07-22 cs.RO cs.AI cs.LG 版本更新 62%

Training and Simulation of Quadrupedal Robot in Adaptive Stair Climbing and Descending for Indoor Firefighting: An End-to-End Reinforcement Learning Approach

四足机器人在室内灭火中的自适应爬楼梯训练与仿真:一种端到端强化学习方法

Baixiao Huang, Baiyu Huang, Yu Hou

机构 * Independent Researcher(独立研究者) Department of Construction Management, Western New England University(西雅图新英格兰大学建设管理系)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出一种两阶段端到端强化学习方法,用于四足机器人在复杂室内环境中适应不同楼梯形状的爬行任务。

Comments 8 pages, 9 figures, 43rd International Symposium on Automation and Robotics in Construction

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10946 2026-07-22 cs.RO cs.AI cs.LG 版本更新 62%

ImplicitRDP: An End-to-End Visual-Force Diffusion Policy with Structural Slow-Fast Learning

ImplicitRDP:一种具有结构快慢学习的端到端视觉-力扩散策略

Wendi Chen, Han Xue, Yi Wang, Fangyuan Zhou, Jun Lv, Yang Jin, Shirun Tang, Chuan Wen, Cewu Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Noematrix Ltd.(诺姆矩阵有限公司)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究人类水平接触操作中视觉与力感测信号整合难题,提出ImplicitRDP策略,用结构快慢学习机制及虚拟目标表示正则化,经实验验证其在丰富接触任务中显著优于基线,有卓越反应性与成功率。

Comments Accepted to RA-L 2026. Project page: https://implicit-rdp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08654 2026-07-22 quant-ph cs.AI cs.LG cs.NI 版本更新 62%

Robust Belief-State Policy Learning for Quantum Network Routing Under Decoherence and Time-Varying Conditions

在退相干和时变条件下量子网络路由的鲁棒信念状态策略学习

Amirhossein Taherpour, Abbas Taherpour, Tamer Khattab, Mazen Hasna

机构 * Department of Electrical Engineering, Columbia University(哥伦比亚大学电气工程系) Department of Electrical Engineering, Imam Khomeini International University(伊玛目·霍梅尼国际大学电气工程系) Department of Electrical Engineering, Qatar University(卡塔尔大学电气工程系)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对量子网络路由在复杂条件下的在线决策问题,基于q-POMDP和GNN开发鲁棒信念状态路由框架,通过原子微纪元等方法考虑多种因素,引入多种策略实现可扩展性,经融合与规则提供理论保证,模拟显示该混合控制器性能优于多种基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10203 2026-07-21 cs.LG cs.AI 版本更新 62%

Adaptive Compute in Latent World Models: When Depth Helps, Hurts, or Doesn't Matter

深度在组合中何时得以保留?潜在世界模型中的计算-质量机制

Achyuthan Sivasankar

机构 * New York University(纽约大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨潜在世界模型中深度在组合时的情况,用浅度惩罚ρ测试九个深度思维控制任务,发现三种机制,揭示反转机制由训练产生,其与观察/动作维度等相关,还指出任务机制受多种因素影响及相关注意事项。

Comments 15 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01741 2026-07-21 stat.ML cs.AI cs.LG 版本更新 62%

Full Bayesian Reinforcement Learning via LF-IBIS

基于LF-IBIS的全贝叶斯强化学习

Stefano Masini, Cecilia Viscardi, Michela Baccini

机构 * Department of Computer Science, University of Pisa, Italy(比萨大学计算机科学系) Department of Economics and Statistics, University of Salerno, Italy(萨勒诺大学经济学与统计系) Department of Statistics, Computer Science, Applications ”G.Parenti”, University of Florence, Italy(佛罗伦萨大学统计学、计算机科学与应用G.Parenti系)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出LF-IBIS算法,结合近似贝叶斯计算与迭代批量重要性采样,在似然函数不可得时实现强化学习中的全贝叶斯推断,量化策略不确定性以平衡探索-利用。

Comments 37 pages, 12 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18607 2026-07-17 cs.LG cs.AI 版本更新 62%

Reinforcement Learning in Switching Non-Stationary Markov Decision Processes: Algorithms and Convergence Analysis

切换非平稳马尔可夫决策过程中的强化学习:算法与收敛性分析

Mohsen Amiri, Sindri Magnússon

机构 * Department of Computer and System Science(计算机与系统科学系)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究切换非平稳马尔可夫决策过程,推导固定策略下SNS值函数闭式表达式,证明TD学习、策略迭代及表格Q学习的收敛性,在无线通信网络验证框架,为快速时变系统决策提供有效方法。

Comments Extended version of a paper accepted at the 2026 IEEE Conference on Decision and Control (CDC). Contains complete proofs, background material, and full experimental details

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02023 2026-07-16 cs.CL cs.AI 版本更新 62%

Not All Needles Are Found: How Fact Distribution and Don't Make It Up Prompts Shape Retrieval, Reasoning, and Hallucination in Long-Context LLMs

并非所有线索都能被发现:事实分布和“不要编造”提示如何影响长上下文语言模型中的检索、推理和幻觉

Amirali Ebrahimzadeh, Seyyed M. Salili

机构 * Department of Electrical Engineering & Computer Science University of Michigan(电气工程与计算机科学系 密歇根大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究大语言模型中事实分布和反幻觉提示对检索、推理及幻觉的影响,通过扩展基准评估多个模型,识别出分布崩溃和安全代价两种失败模式,发现许多失败源于无效上下文利用,强调特定模型稳健性和上下文管理的重要性。

Comments 16 pages, 8 figures, 2 tables. Accepted at the FAGEN Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05396 2026-07-16 cs.CL cs.SE 版本更新 62%

FairCoder: Probing LLM Bias in High-Stakes Decision Making via Coding Tasks

FairCoder:通过编码任务探究高风险决策中语言模型的偏差

Yongkang Du, Jen-tse Huang, Jieyu Zhao, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学) University of Southern California(南加州大学)

专题命中 规划决策 :planning(abstract);分类 cs.CL、cs.SE

AI总结 研究通过FairCoder基准将决策制定设为编码任务,探究LLMs在多领域的偏差,针对现有指标不足提出FairScore指标,经实验揭示了此前未充分探索的偏差模式,凸显LLMs作决策代理的风险并提供评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05995 2026-07-15 cs.RO cs.AI cs.LG 版本更新 62%

TADPO: Reinforcement Learning Goes Off-road

TADPO:强化学习走向越野

Zhouchonghao Wu, Raymond Song, Vedant Mundheda, Luis E. Navarro-Serment, Christof Schoenborn, Jeff Schneider

机构 * Robotics Institute, School of Computer Science, Carnegie Mellon University(机器人研究所,计算机科学学院,卡内基梅隆大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 TADPO通过改进的策略梯度方法,首次在全规模越野平台上实现了基于强化学习的自动驾驶解决方案,能够应对复杂地形和低信号奖励环境。

Comments Accepted for Oral Presentation at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16727 2026-07-15 cs.AI cs.LG 版本更新 62%

Mobility-Aware Cache Framework for Scalable LLM-Based Human Mobility Simulation

面向可扩展性的LLM基人类移动模拟移动感知缓存框架

Hua Yan, Heng Tan, Yingxue Zhang, Yu Yang

机构 * Lehigh University(莱维大学) State University of New York at Binghamton(纽约州立大学布法罗分校)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 MobCache通过移动感知缓存框架提升大规模LLM基人类移动模拟的效率和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏