arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 2002 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 2002 篇

2606.18284 2026-06-18 cs.LG cs.AI cs.CL 新提交 67%

Breaking the Solver Bottleneck: Training Task Generators at the Learnable Frontier

打破求解器瓶颈:在可学习前沿训练任务生成器

Lorenz Wolf, Connor Watts, Roger Creus Castanyer, Geoffrey Bradway, Maxwill Lin, Augustine N. Mavor-Parker, Matthew Daborn-Sargent

机构 * Vmax Goodfire AI

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出PROPEL框架,通过训练轻量级激活探针作为求解率代理,在无需重复求解器评估的情况下优化任务生成器,使生成任务集中在可学习前沿,提升数学、代码和软件工程任务的有效性。

Comments 30 pages, 9 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17216 2026-06-17 cs.MA cs.GT cs.RO 新提交 67%

Intermittent Strategic Cooperation of Two Selfish Agents on Graphs

两个自私智能体在图上的间歇性战略合作

Itay Shedlezki, Noa Agmon

机构 * Bar-Ilan University(巴伊兰大学)

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 研究两个自私智能体在时间与空间约束下的战略合作问题,通过IC2PP模型刻画纯纳什均衡结构,证明均衡存在性并提出多项式时间枚举算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16972 2026-06-16 cs.RO cs.SY eess.SY 新提交 67%

When Should a Robot Replan? Regret-Guided Update Scheduling in Time-Varying MDPs

机器人何时应重新规划?时变MDP中的遗憾引导更新调度

Negin Musavi, Gokul Puthumanaillam, Ruben Hernandez, William Schafer, Melkior Ornik

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 针对时变环境下机器人因预算限制无法持续重规划的问题,提出基于动态遗憾的在线更新调度规则,在仿真和实物实验中优于固定预算基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13578 2026-06-16 cs.CL cs.AI cs.LG cs.MM cs.RO 新提交 67%

LabVLA: Grounding Vision-Language-Action Models in Scientific Laboratories

LabVLA:在科学实验室中落地视觉-语言-动作模型

Baochang Ren, Xinjie Liu, Xi Chen, Yanshuo Liu, Chenxi Li, Daqi Gao, Zeqin Su, Jintao Xing, Zirui Xue, Rui Li, Xiangyu Zhao, Shuofei Qiao, Minting Pan, Wangmeng Zuo, Lei Bai, Dongzhan Zhou, Ningyu Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对科学实验室中机器人执行协议面临的数据和实体瓶颈,提出模拟数据引擎RoboGenesis和两阶段训练策略LabVLA,在LabUtopia基准上取得最高平均成功率。

Comments Work in progress. Project website at https://zjunlp.github.io/LabVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12900 2026-06-12 cs.AI cs.CL cs.LG 新提交 67%

Zero-source LLM Hallucination Detection with Human-like Criteria Probing

零源大语言模型幻觉检测:类人类标准探测

Jiahao Yang, Shuhai Zhang, Hailong Kang, Feng Liu, Qi Chen, Mingkui Tan

机构 * South China University of Technology(华南理工大学) The University of Melbourne(墨尔本大学) Pazhou Laboratory(帕乔实验室) Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出HCPD范式,通过类人类标准探测机制模拟人类评估者的多面推理,结合奖励对齐和多样本聚合,实现零源条件下的有效可解释幻觉检测。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10651 2026-06-10 cs.CV 新提交 67%

Kwai Keye-VL-2.0 Technical Report

Kwai Keye-VL-2.0 技术报告

Kwai Keye Team, Bin Wen, Changyi Liu, Chengru Song, Chongling Rao, Guowang Zhang, Han Li, Haonan Fan, Hengrui Ju, Jiankang Chen, Jiapeng Chen, Jiawei Yuan, Kaixuan Yang, Kaiyu Jiang, Kun Gai, Lingzhi Zhou, Na Nie, Sen Na, Tianke Zhang, Tingting Gao, Xuanyu Zheng, Yulong Chen, Fan Yang, Haixuan Gao, Lele Yang, Mingqiao Liu, Muxi Diao, Qi Zhang, Qile Su, Wei Chen, Wentao Hong, Xingyu Lu, Yancheng Long, Yankai Yang, Yingxin Li, Yiyang Fan, Yu Xia, Yuzhe Chen, Ziliang Lai, Chuan Yi, Haonan Jia, Tianming Liang, Weixin Xu, Xiaoxiao Ma, Yang Tian, Yufei Han, Feng Han, Hang Li, Jing Wang, Jinghui Jia, Junmin Chen, Junyu Shi, Ruilin Zhang

机构 * Kuaishou Group(快手集团)

专题命中 规划决策 :agent(abstract);agentic(abstract)

AI总结 提出开源MoE多模态基础模型Keye-VL-2.0,首次将DeepSeek稀疏注意力适配到GQA架构,支持无损256K上下文处理,并通过跨模态多教师策略蒸馏和上下文/视频强化学习解决多任务对齐中的灾难性遗忘,在长视频理解和智能体任务上达到同类最优。

Comments 31 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09890 2026-06-10 cs.LG cs.AI cs.CL 新提交 67%

PreAct-Bench: Benchmarking Predictive Monitoring in LLMs

PreAct-Bench:大语言模型中的预测性监控基准

Hainiu Xu, Italo Luis da Silva, Jiangnan Ye, Yuhao Wang, Wei Liu, Linyi Yang, Jonathan Richard Schwarz, Nicola Paoletti, Yulan He, Hanqi Yan

机构 * King’s College London(伦敦国王学院) National University of Singapore(新加坡国立大学) Southern University of Science and Technology(南方科技大学) Thomson Reuters Foundational Research(汤姆森路透基础研究) Imperial College London(伦敦帝国学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 规划决策 :autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出预测性监控任务,在动作执行前判断是否会导致不道德行为,并构建PreActBench基准,评估多种模型发现该任务具有挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08876 2026-06-09 physics.geo-ph 新提交 67%

RO-LiDAR GeoQuickView: A Web Platform for Exploring Public LiDAR-Derived Elevation Data in Romania

RO-LiDAR GeoQuickView:探索罗马尼亚公共LiDAR衍生高程数据的Web平台

Alexandru Hegyi

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 提出一个非商业Web-GIS平台RO-LiDAR GeoQuickView,整合公共LiDAR衍生数字地形模型等高程数据,提供标准化山体阴影可视化、参与式景观记录和空间索引,以解决数据碎片化和专业处理限制问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07720 2026-06-09 cs.AI cs.CL cs.LG 新提交 67%

Why Limit the Residual Stream to Layers and Not Tokens? Persistent Memory for Continuous Latent Reasoning

为什么将残差流限制在层而不是令牌?用于连续潜在推理的持久记忆

Mujtaba Farhan, Maheep Chaudhary

机构 * University of Cambridge(剑桥大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对CoCoNuT在潜在空间推理中因中间隐藏状态被覆盖导致概念瓶颈的问题,提出AGCLR模型,通过门控概念流持久记忆机制,在GSM8K、HotpotQA和ProsQA上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07054 2026-06-08 cs.CL cs.AI cs.CR cs.LG 新提交 67%

TRACE: Trajectory Reasoning through Adaptive Cross-Step Evidence Aggregation for LLM Agents

TRACE: 通过自适应跨步骤证据聚合的LLM智能体轨迹推理

Vijitha Mittapalli, Shreyaa Jayant Dani, Satya Srujana Pilli, Snigdha Ansu, Mohammadreza Teymoorianfard, Franck Dernoncourt, Hongjie Chen, Yu Wang, Ryan A. Rossi, Nesreen K. Ahmed

机构 * University of Massachusetts at Amherst(马萨诸塞大学阿默斯特分校) Adobe Research(Adobe研究) Dolby Labs(杜比实验室) University of Oregon(俄勒冈大学) Cisco(思科)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出TRACE框架,通过TIJ循环识别高信号区域、累积跨步骤证据并合成轨迹级判决,在SHADE-Arena的十个任务域上F1达0.713,召回率0.844,尤其擅长长距离证据链接。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12626 2026-08-14 cs.CL cs.AI cs.MA 新提交 66%

LLMs Are Not Good Strategists, Yet Memory-Enhanced Agency Boosts Reasoning

大型语言模型(LLMs)并非优秀的战略家,然而记忆增强的智能体可提升推理能力

Yi Wu, Zhimin Hu

机构 * University of Chicago(芝加哥大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL;planning(journal_ref)

AI总结 该研究针对LLM在长时环境中战略推理的缺陷,提出EpicStar框架,结合跨回合记忆与动态门控机制,在星际争霸II测试中实现更高胜率且令牌消耗大幅减少。

Journal ref Published at Reasoning and Planning for LLMs at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03606 2026-08-05 cs.AI cs.LG 新提交 66%

Learning Clinical-Trial Strategy: Offline Policy Training for Decision Agents

临床试验策略学习:面向决策智能体的离线策略训练

William Bolton, Philip Torr

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG;agentic(comments)

AI总结 本研究将肿瘤学临床开发建模为离线决策问题,构建时间数据集,对比4种离线目标与4种LLM智能体,发现奖励加权行为克隆表现最优,证明结构化离线学习可用于规划临床实验。

Comments Accepted for a spotlight at the ICML 2026 Workshop on Generative and Agentic AI for Biology (GenBio) and as a poster at the ICML 2026 Workshop on Decision-Making from Offline Datasets to Online Adaptation: Black-Box Optimization to Reinforcement Learning (DEMO). 15 pages, 3 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00181 2026-08-04 cs.SE cs.AI 新提交 66%

Cross-Benchmark Generalization in Long-Horizon Agents

长视野智能体的跨基准泛化

Sushant Mehta, Logan Ritchie, Liudas Panavas, Edwin Chen

专题命中 规划决策 :agent(abstract,comments);分类 cs.AI、cs.SE

AI总结 本研究针对长视野智能体,通过两阶段SFT-再-RL流程后训练Qwen3.5-122B-A10B模型,在5项外部基准实现性能提升,证明长视野多工具后训练的工作方式可跨领域迁移。

Comments Accepted at the COLM 2026 Workshop on Agent Behavior. 11 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20661 2026-08-24 cs.AI cs.CE cs.CL cs.IR 新提交 62%

Auditable by Construction: An Ontology-Driven Framework for Trustworthy LLM Analytics in Enterprise Finance

可审计性原生:面向企业金融领域可信大语言模型分析的本体驱动框架

Sergiy Lunyakin

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 本文针对企业金融大语言模型应用的信任问题,提出知识驱动分析框架KDAF,结合本体与CARP技术,在FinanceBench评估中,其可审计性优于基线方法,表明可审计性是该框架的核心优势。

Comments 20 pages, 1 figure, 4 tables, 1 algorithm. Artifact deposit with configurations, ontology schema, prompts, audit reports and reconstruction scripts: this https URL (https://doi.org/10.5281/zenodo.22022068)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20402 2026-08-24 cs.CL cs.AI 新提交 62%

LingShu: A Large-Scale Symptom-Centric Contextualized Knowledge Graph Bridging Traditional Chinese Medicine and Modern Biomedicine

灵枢(LingShu):连接中医与现代生物医学的大规模以症状为中心的上下文知识图谱

Rui Hua, Zixin Shu, Kai Chang, Dengying Yan, Jianan Xia, Hui Zhu, Shujie Song, Shurui Yang, Tongxin Wang, Yue Yin, Yu Wei, Lijuan Pei, Yunhui Hu, Hao Xu, Mingzhong Xiao, Xiaodong Li, Haibin Yu, Runshun Zhang, Wenjia Wang, Baoyan Liu, Xuezhong Zhou

机构 * Beijing Jiaotong University(北京交通大学) Hubei Provincial Hospital of Traditional Chinese Medicine(湖北省中医院) Hubei University of Chinese Medicine(湖北中医药大学) Hubei Province Academy of Traditional Chinese Medicine(湖北省中医药研究院) China Academy of Chinese Medical Sciences(中国中医科学院) Xiyuan Hospital(西苑医院) National Clinical Research Center for Chinese Medicine Cardiology(国家中医心血管病临床医学研究中心) Hubei Provincial Clinical Research Center for Acupuncture and Moxibustion in Obesity Treatment(湖北省肥胖病针灸临床研究中心) Hubei Shizhen Laboratory(湖北时珍实验室) Tianjin Ta(天津(此处原文未完整,按原文提取))

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出以症状为中心的LingShu知识图谱,整合多源数据构建混合数据模型,连接中医与现代生物医学,开发集成图可视化等功能的网络平台,为跨医学领域知识关联提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18952 2026-08-20 cs.IR cs.AI cs.CL 新提交 62%

rEDMRec: Distilling Large Language Model Reasoning into an Editable Experience Memory for Recommendation

rEDMRec:将大语言模型推理提炼为可编辑的体验记忆用于推荐

Minh Hoang Nguyen, Tung Le, Huy Tien Nguyen

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 rEDMRec将教师LLM推理提炼为四类可编辑体验记忆,轻量级学生LLM通过检索记忆排序,在多数据集和主干模型上优于零样本、少样本、RAG及GraphRAG,记忆优化可提升推荐性能并降低重复率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18495 2026-08-20 cs.LG cs.AI 新提交 62%

Physics-Unrolled Neural Operator for Wireless Field Modeling

用于无线场建模的物理展开神经算子

Rafid Umayer Murshed, Saif Ur Rahman, Mingyue Tang, Elahe Soltanaghai

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出物理展开混合神经算子(PU-HNO),通过三级级联结构逐步捕捉无线传播效应,在不同平面图上的实验中,其在图像质量和无线部署指标上均优于多种基线模型。

Comments 37 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18136 2026-08-20 cs.AI cs.LG 新提交 62%

FraudBench: Stress-Testing Policy-Grounded Banking Agents Against Adaptive Fraud

FraudBench:针对自适应欺诈的基于政策的银行智能体压力测试

Dheeraj Mohandas Pai, Lu Xian

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究人员推出基于τ²-bench框架和τ-Knowledge环境的可执行基准FraudBench,测试银行智能体应对自适应欺诈的安全性,评估发现4款智能体攻击安全性为49%-65%,资金骡和第一方欺诈是主要薄弱点。

Comments 9 Pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17959 2026-08-19 cs.AI cs.LG 新提交 62%

Towards Zero-Shot Task Transfer with Neurosymbolic World Models

面向基于神经符号世界模型的零样本任务迁移

Isidoro Tamassia, Lennert De Smet, Giuseppe Marra

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出一种神经符号世界模型,通过解耦观测重构与奖励预测,实现无需额外环境交互的零样本任务迁移,其泛化能力优于纯神经方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17542 2026-08-19 cs.LG cs.AI 新提交 62%

No Gaussian Required: Contrastive Inverse Dynamics for JEPA World Models

无需高斯:用于JEPA世界模型的对比逆动力学

Jack Boylan, Chris Hokamp

机构 * Quantexa(昆泰克萨公司)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出AC-MTM,用对比逆动力学替代JEPA世界模型的高斯型抗坍塌机制,在多目标视觉任务上性能优于SIGReg,且训练稳定无额外复杂组件

Comments 17 pages, 5 figures. Code: https://github.com/jackboyla/action-contrastive-jepa

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16831 2026-08-18 cs.AI cs.CL 新提交 62%

Policy Iteration with Human Feedback: Bringing Post-Training RL to In-context Learning

结合人类反馈的策略迭代:将后训练强化学习应用于上下文学习

Minh-Ha Nguyen, Cathy Shyr

机构 * Vanderbilt University(范德堡大学) Vanderbilt University Medical Center(范德堡大学医学中心)

专题命中 规划决策 :tool-use(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出结合人类反馈的策略迭代(PIHF)方法,采用预训练语言模型为基底,经实验使其在罕见疾病诊断相关任务中显著提升了多个执行器的Recall@1指标,验证了其可行性。

Comments PIHF method paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16333 2026-08-18 cs.CL cs.AI 新提交 62%

Step-Level On-Policy Distillation: Interpolating Between On-Policy Distillation and Supervised Fine-Tuning

步骤级在线策略蒸馏:在线策略蒸馏与监督微调的插值方法

Changhui Sun, Lanbo Liu, Hang Lei, Tong Ling, Jiahang Xie, Zhiyong Zheng, Yujia Wang, Hao Liu, Feng Xiao, Lu Liu, Yanlong Du, Zifeng Cheng, Ziwei Jiang, Qing Gu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学现代软件技术国家重点实验室) XingYun Lab, HUJING Digital Media & Entertainment Group(星云实验室,沪景数字媒体娱乐集团) University of Chinese Academy of Sciences(中国科学院大学) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究针对令牌级在线策略蒸馏的局限,提出步骤级在线策略蒸馏SOPD,结合监督微调与在线策略蒸馏的优势,在推理和智能体任务上显著优于传统方法,为蒸馏研究提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14660 2026-08-18 cs.LG cs.AI cs.CY 新提交 62%

Ring-based Spatial Transformer: Learning Non-linear Spatial Interactions between Building Distribution and Pedestrian Flow

基于环的空间Transformer:学习建筑分布与行人流量之间的非线性空间相互作用

Shun Nakayama, Takahiro Kanamori, Wanglin Yan

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出基于环的SpatialTransformer模型,利用东京100个火车站的环缓冲区数据学习建筑分布与行人流量的非线性空间相互作用,其预测准确率优于GWR,挑战了紧凑城市假设,为城市规划提供了新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14205 2026-08-17 cs.AI cs.LG 新提交 62%

FreeBalance: Pre-Routing Online Moe Load Balancing via Residual Workload Prediction

FreeBalance:基于残差 workload 预测的预路由在线 MoE 负载均衡

Pengfei Chen, Yize Wu, Shouxu Kuang, Ke Gao, Ling Li

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 FreeBalance 是一种 MoE 模型在线负载均衡框架,通过残差 workload 预测实现专家迁移与预路由计算重叠,降低负载失衡与推理延迟,提升分布式推理效率。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12959 2026-08-14 cs.LG cs.AI 新提交 62%

The Objective Is the Bottleneck: Latent World Models Encode What Their Planners Cannot Use

目标是瓶颈:潜在世界模型编码了其规划器无法使用的内容

Joyjeet Singh

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究发现潜在世界模型的规划瓶颈在于规划器目标而非预测器,通过替换目标无需额外训练即可大幅提升长视野规划性能,揭示模型编码了规划器未利用的可达性信息。

Comments Follow-up to arXiv:2608.10145. All experiments run on a laptop CPU; no model was trained or fine-tuned. Code, checkpoints and every measurement: github.com/joyjeet-singh/tinylab

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12078 2026-08-13 cs.CV cs.AI cs.LG 新提交 62%

Better Slots, Better Worlds: Representation Quality & Robustness in Object-Centric World Models

更好的槽,更好的世界:以对象为中心的世界模型中的表示质量与鲁棒性

Shukrullo Nazirjonov, Sai Prasanna, Anna Manasyan, Georg Martius

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究通过受控实验分析以对象为中心的世界模型,发现槽质量与规划成功率正相关,槽绑定良好时可减少辅助输入,且在分布偏移下其鲁棒性优于LeWM,预训练特征是鲁棒性关键因素。

Comments Published at Model-Based RL in the Era of Generative World Models Workshop at RLC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12001 2026-08-13 cs.LG cs.AI cs.CV 新提交 62%

Remote Sensing and Machine Learning-Based Analysis of Land Use and Vegetation Change in Dhaka District, Bangladesh

基于遥感与机器学习的孟加拉国达卡区土地利用及植被变化分析

Muhammad Masud Tarek, Md. Alamgir Hossain, Md. Samiul Islam, Muntasir Hasan Kanchan

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本研究结合遥感与机器学习,分析孟加拉国达卡区2019-2024年土地利用与植被变化,发现建成区大幅扩张、植被与水体缩减,随机森林分类精度最高,为城市可持续发展提供数据支撑。

Comments 16 Pages, 8 Figures, 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11674 2026-08-13 cs.LG cs.AI 新提交 62%

GCPO: Diagnosing and Constraining Subspace Geometry in Rollout RL for LLMs

GCPO:针对大语言模型的rollout强化学习中子空间几何的诊断与约束

Kai Yang, Jingwei Xu, Wanyu Wang, Kai-Yuan Guo, Zhenbo Yu, Yi Wang, Yu Qiao

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 规划决策 :tool-use(abstract);分类 cs.AI、cs.LG

AI总结 GCPO通过几何约束策略优化方法,诊断rollout强化学习的子空间几何问题,在大语言模型后训练中提升了多任务性能并解决了训练不稳定等问题

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11511 2026-08-13 cs.LG cs.AI 新提交 62%

Let it Cook: Learning to Wait in Sequential Decision Making

顺其自然:序贯决策中的等待学习

Christopher Watson, Arjun Krishna, Dinesh Jayaraman, Rajeev Alur

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对序贯决策中智能体频繁感知决策的问题,提出采用带字典序目标的强化学习训练等待策略,在7类任务上实现了可观的等待时长,且不牺牲任务性能。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11361 2026-08-13 cs.LG cs.CL cs.PF 新提交 62%

Lifecycle-Optimal Tokenization: Vocabulary Size as a Deployment-Regime-Dependent Infrastructure Parameter

生命周期最优分词:词汇表大小作为与部署 regime 相关的基础设施参数

Rima Mittal, Ankit Gubrani, Satyanarayana Kakollu

专题命中 规划决策 :planning(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现 LLM 分词器的最优词汇表大小随部署 regime 变化,提出生命周期部署成本模型,经实验证实其与训练最优值差异最高达 16 倍,且最优范围内质量损失极小,为 LLM 部署提供词汇表容量规划指导。

Comments 6 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏