arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 7434 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 2137 篇

2608.24300 2026-08-26 cs.LG cs.AI 新提交 62%

Contrastive Branch Policy Optimization

对比分支策略优化

Ying Wang, Changlin Qiu, Bang Lin, Linbo Jin, Wen Jiang, Zhe Sun, Jingli Yang

机构 * Alibaba Group(阿里巴巴集团) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对工具集成智能体训练的细粒度信用分配问题,提出CBPO解耦分支采样的预算分配与信用转化,在十个基准上优于现有方法,获两个领域及两种模型规模下最高宏平均准确率。

Comments 10 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24087 2026-08-26 cs.LG cs.AI stat.ML 新提交 62%

Knowing When to Ask for Help: Bayesian Self-Escalation in Hierarchical LLM Agents

何时请求帮助:分层大语言模型智能体中的贝叶斯自我升级

Nadeem Shaikh

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对LLM智能体提出贝叶斯自我升级策略,将生成中委派建模为贝叶斯最优停止问题,经模拟和真实代码级联验证,其升级机制在同等成本下优于事后路由,能力信念区分度随生成提升。

Comments 21 pages, 5 figures. Code and data: https://github.com/nadeem-shaikh/llm-self-escalation . Associated record: https://doi.org/10.5281/zenodo.21330787

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23452 2026-08-25 cs.RO cs.AI cs.LG 新提交 62%

Reward-Free Continual Adaptation for Resilient Space Robots

面向弹性空间机器人的无奖励持续适应

Andrej Orsula, Miguel Olivares-Mendez, Carol Martinez

机构 * University of Luxembourg(卢森堡大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对空间机器人硬件退化导致传统控制策略失效的问题,提出无奖励持续学习框架,利用隐态世界模型使智能体无需奖励即可适应环境,在三类模拟任务中验证了方法有效性。

Comments Accepted for publication at the Third Conference on AI in and for Space (SPAICE 2026) | The source code is available at https://github.com/AndrejOrsula/space_robotics_bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22549 2026-08-25 cs.AI cs.LG 新提交 62%

Scaling Curriculum Learning For Autonomous Driving

扩展自动驾驶的课程学习方法

Cevahir Koprulu, David Paz, Feng Tao, Yuliang Guo, Xinyu Huang, Ufuk Topcu, Liu Ren

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Bosch Center for AI(博世人工智能中心)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出CL4AD,将课程学习集成到批量自动驾驶模拟器中,在GPUDRIVE实验中使自动驾驶RL智能体的训练效率大幅提升,提前10亿步达到99%成功率,减少77%的时间,样本效率提升67%。

Comments 31 pages, 18 figures. Under review at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22479 2026-08-25 cs.CL cs.LG 新提交 62%

GTA-RAG: Graph-Trajectory-Augmented Reinforcement Learning for Multi-Turn Retrieval-Augmented Reasoning

GTA-RAG:用于多轮检索增强推理的图轨迹增强强化学习

Jun Chen, Yongchao Liu, Pengyu Qiu, Jiajun Zheng, Juelu Zhang, Yujie Zeng, Qin Zhang, Ziyue Qiao, Xiao Luo

机构 * Shenzhen University(深圳大学) Great Bay University(大湾区大学) Ant Group(蚂蚁集团)

专题命中 规划决策 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 GTA-RAG是一种图轨迹增强强化学习框架,通过轨迹级监督优化检索策略,在多跳和简单问答基准上,相比RL-based RAG基线提升了性能与证据链覆盖率。

Comments 11 pages, 5 figures. Accepted to EMNLP 2026 Fundings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21969 2026-08-25 cs.CL cs.HC cs.LG 新提交 62%

ToSCA: Leveraging Hierarchical Reinforcement Learning on Temporal and Strategic Abstractions of Conversational Agents

ToSCA:利用对话智能体的时间与策略抽象实现分层强化学习

Xiaoyu Wang, Qingqing Gu, Yue Zhao, Teng Chen, Yuqi Cao, Xiaokai Chen, Hongyan Li, Luo Ji

机构 * Geely AI Lab(吉利AI实验室) Beijing Institute of Technology(北京理工大学) Peking University(北京大学)

专题命中 规划决策 :planning(abstract);分类 cs.CL、cs.LG

AI总结 该研究受人类多层时间抽象启发,提出ToSCA框架,采用两级分层强化学习结合双粒度奖励机制,在两类对话任务中性能优于基线方法。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21863 2026-08-25 cs.CL cs.AI 新提交 62%

HiDiffTIR: Hierarchical Difficulty-Aware Policy Optimization for Multi-Turn Tool-Integrated Reasoning

HiDiffTIR:面向多轮工具集成推理的分层难度感知策略优化

Yucan Guo, Xiaohan Wang, Miao Su, Saiping Guan, Zhongni Hou, Jiajun Chai, Wei Lin, Guojun Yin, Xiaolong Jin, Jiafeng Guo, Xueqi Cheng

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Meituan(美团)

专题命中 规划决策 :tool-use(abstract);分类 cs.AI、cs.CL

AI总结 HiDiffTIR是面向多轮工具集成推理的分层难度感知策略优化框架,通过在轨迹和轮次两级执行难度感知信用分配,无需额外监督即可提升工具集成推理性能。

Comments Accepted by EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20661 2026-08-24 cs.AI cs.CE cs.CL cs.IR 新提交 62%

Auditable by Construction: An Ontology-Driven Framework for Trustworthy LLM Analytics in Enterprise Finance

可审计性原生:面向企业金融领域可信大语言模型分析的本体驱动框架

Sergiy Lunyakin

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 本文针对企业金融大语言模型应用的信任问题,提出知识驱动分析框架KDAF,结合本体与CARP技术,在FinanceBench评估中,其可审计性优于基线方法,表明可审计性是该框架的核心优势。

Comments 20 pages, 1 figure, 4 tables, 1 algorithm. Artifact deposit with configurations, ontology schema, prompts, audit reports and reconstruction scripts: https://doi.org/10.5281/zenodo.22022068

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20402 2026-08-24 cs.CL cs.AI 新提交 62%

LingShu: A Large-Scale Symptom-Centric Contextualized Knowledge Graph Bridging Traditional Chinese Medicine and Modern Biomedicine

灵枢(LingShu):连接中医与现代生物医学的大规模以症状为中心的上下文知识图谱

Rui Hua, Zixin Shu, Kai Chang, Dengying Yan, Jianan Xia, Hui Zhu, Shujie Song, Shurui Yang, Tongxin Wang, Yue Yin, Yu Wei, Lijuan Pei, Yunhui Hu, Hao Xu, Mingzhong Xiao, Xiaodong Li, Haibin Yu, Runshun Zhang, Wenjia Wang, Baoyan Liu, Xuezhong Zhou

机构 * Beijing Jiaotong University(北京交通大学) Hubei Provincial Hospital of Traditional Chinese Medicine(湖北省中医院) Hubei University of Chinese Medicine(湖北中医药大学) Hubei Province Academy of Traditional Chinese Medicine(湖北省中医药研究院) China Academy of Chinese Medical Sciences(中国中医科学院) Xiyuan Hospital(西苑医院) National Clinical Research Center for Chinese Medicine Cardiology(国家中医心血管病临床医学研究中心) Hubei Provincial Clinical Research Center for Acupuncture and Moxibustion in Obesity Treatment(湖北省肥胖病针灸临床研究中心) Hubei Shizhen Laboratory(湖北时珍实验室) Tianjin Ta(天津(此处原文未完整,按原文提取))

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出以症状为中心的LingShu知识图谱,整合多源数据构建混合数据模型,连接中医与现代生物医学,开发集成图可视化等功能的网络平台,为跨医学领域知识关联提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18952 2026-08-20 cs.IR cs.AI cs.CL 新提交 62%

rEDMRec: Distilling Large Language Model Reasoning into an Editable Experience Memory for Recommendation

rEDMRec:将大语言模型推理提炼为可编辑的体验记忆用于推荐

Minh Hoang Nguyen, Tung Le, Huy Tien Nguyen

机构 * Faculty of Information Technology, University of Science(胡志明市科学大学信息学院) Vietnam National University(越南国家大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 rEDMRec将教师LLM推理提炼为四类可编辑体验记忆,轻量级学生LLM通过检索记忆排序,在多数据集和主干模型上优于零样本、少样本、RAG及GraphRAG,记忆优化可提升推荐性能并降低重复率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18495 2026-08-20 cs.LG cs.AI 新提交 62%

Physics-Unrolled Neural Operator for Wireless Field Modeling

用于无线场建模的物理展开神经算子

Rafid Umayer Murshed, Saif Ur Rahman, Mingyue Tang, Elahe Soltanaghai

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出物理展开混合神经算子(PU-HNO),通过三级级联结构逐步捕捉无线传播效应,在不同平面图上的实验中,其在图像质量和无线部署指标上均优于多种基线模型。

Comments 37 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18136 2026-08-20 cs.AI cs.LG 新提交 62%

FraudBench: Stress-Testing Policy-Grounded Banking Agents Against Adaptive Fraud

FraudBench:针对自适应欺诈的基于政策的银行智能体压力测试

Dheeraj Mohandas Pai, Lu Xian

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究人员推出基于τ²-bench框架和τ-Knowledge环境的可执行基准FraudBench,测试银行智能体应对自适应欺诈的安全性,评估发现4款智能体攻击安全性为49%-65%,资金骡和第一方欺诈是主要薄弱点。

Comments 9 Pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17542 2026-08-19 cs.LG cs.AI 新提交 62%

No Gaussian Required: Contrastive Inverse Dynamics for JEPA World Models

无需高斯:用于JEPA世界模型的对比逆动力学

Jack Boylan, Chris Hokamp

机构 * Quantexa(昆泰克萨公司)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出AC-MTM,用对比逆动力学替代JEPA世界模型的高斯型抗坍塌机制,在多目标视觉任务上性能优于SIGReg,且训练稳定无额外复杂组件

Comments 17 pages, 5 figures. Code: https://github.com/jackboyla/action-contrastive-jepa

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16831 2026-08-18 cs.AI cs.CL 新提交 62%

Policy Iteration with Human Feedback: Bringing Post-Training RL to In-context Learning

结合人类反馈的策略迭代:将后训练强化学习应用于上下文学习

Minh-Ha Nguyen, Cathy Shyr

机构 * Vanderbilt University(范德堡大学) Vanderbilt University Medical Center(范德堡大学医学中心)

专题命中 规划决策 :tool-use(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出结合人类反馈的策略迭代(PIHF)方法,采用预训练语言模型为基底,经实验使其在罕见疾病诊断相关任务中显著提升了多个执行器的Recall@1指标,验证了其可行性。

Comments PIHF method paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16333 2026-08-18 cs.CL cs.AI 新提交 62%

Step-Level On-Policy Distillation: Interpolating Between On-Policy Distillation and Supervised Fine-Tuning

步骤级在线策略蒸馏:在线策略蒸馏与监督微调的插值方法

Changhui Sun, Lanbo Liu, Hang Lei, Tong Ling, Jiahang Xie, Zhiyong Zheng, Yujia Wang, Hao Liu, Feng Xiao, Lu Liu, Yanlong Du, Zifeng Cheng, Ziwei Jiang, Qing Gu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学现代软件技术国家重点实验室) XingYun Lab, HUJING Digital Media & Entertainment Group(星云实验室,沪景数字媒体娱乐集团) University of Chinese Academy of Sciences(中国科学院大学) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究针对令牌级在线策略蒸馏的局限,提出步骤级在线策略蒸馏SOPD,结合监督微调与在线策略蒸馏的优势,在推理和智能体任务上显著优于传统方法,为蒸馏研究提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14660 2026-08-18 cs.LG cs.AI cs.CY 新提交 62%

Ring-based Spatial Transformer: Learning Non-linear Spatial Interactions between Building Distribution and Pedestrian Flow

基于环的空间Transformer:学习建筑分布与行人流量之间的非线性空间相互作用

Shun Nakayama, Takahiro Kanamori, Wanglin Yan

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出基于环的SpatialTransformer模型,利用东京100个火车站的环缓冲区数据学习建筑分布与行人流量的非线性空间相互作用,其预测准确率优于GWR,挑战了紧凑城市假设,为城市规划提供了新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14205 2026-08-17 cs.AI cs.LG 新提交 62%

FreeBalance: Pre-Routing Online Moe Load Balancing via Residual Workload Prediction

FreeBalance:基于残差 workload 预测的预路由在线 MoE 负载均衡

Pengfei Chen, Yize Wu, Shouxu Kuang, Ke Gao, Ling Li

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 FreeBalance 是一种 MoE 模型在线负载均衡框架,通过残差 workload 预测实现专家迁移与预路由计算重叠,降低负载失衡与推理延迟,提升分布式推理效率。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12959 2026-08-14 cs.LG cs.AI 新提交 62%

The Objective Is the Bottleneck: Latent World Models Encode What Their Planners Cannot Use

目标是瓶颈:潜在世界模型编码了其规划器无法使用的内容

Joyjeet Singh

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究发现潜在世界模型的规划瓶颈在于规划器目标而非预测器,通过替换目标无需额外训练即可大幅提升长视野规划性能,揭示模型编码了规划器未利用的可达性信息。

Comments Follow-up to arXiv:2608.10145. All experiments run on a laptop CPU; no model was trained or fine-tuned. Code, checkpoints and every measurement: github.com/joyjeet-singh/tinylab

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12078 2026-08-13 cs.CV cs.AI cs.LG 新提交 62%

Better Slots, Better Worlds: Representation Quality & Robustness in Object-Centric World Models

更好的槽,更好的世界:以对象为中心的世界模型中的表示质量与鲁棒性

Shukrullo Nazirjonov, Sai Prasanna, Anna Manasyan, Georg Martius

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究通过受控实验分析以对象为中心的世界模型,发现槽质量与规划成功率正相关,槽绑定良好时可减少辅助输入,且在分布偏移下其鲁棒性优于LeWM,预训练特征是鲁棒性关键因素。

Comments Published at Model-Based RL in the Era of Generative World Models Workshop at RLC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12001 2026-08-13 cs.LG cs.AI cs.CV 新提交 62%

Remote Sensing and Machine Learning-Based Analysis of Land Use and Vegetation Change in Dhaka District, Bangladesh

基于遥感与机器学习的孟加拉国达卡区土地利用及植被变化分析

Muhammad Masud Tarek, Md. Alamgir Hossain, Md. Samiul Islam, Muntasir Hasan Kanchan

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本研究结合遥感与机器学习,分析孟加拉国达卡区2019-2024年土地利用与植被变化,发现建成区大幅扩张、植被与水体缩减,随机森林分类精度最高,为城市可持续发展提供数据支撑。

Comments 16 Pages, 8 Figures, 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11674 2026-08-13 cs.LG cs.AI 新提交 62%

GCPO: Diagnosing and Constraining Subspace Geometry in Rollout RL for LLMs

GCPO:针对大语言模型的rollout强化学习中子空间几何的诊断与约束

Kai Yang, Jingwei Xu, Wanyu Wang, Kai-Yuan Guo, Zhenbo Yu, Yi Wang, Yu Qiao

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 规划决策 :tool-use(abstract);分类 cs.AI、cs.LG

AI总结 GCPO通过几何约束策略优化方法,诊断rollout强化学习的子空间几何问题,在大语言模型后训练中提升了多任务性能并解决了训练不稳定等问题

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11511 2026-08-13 cs.LG cs.AI 新提交 62%

Let it Cook: Learning to Wait in Sequential Decision Making

顺其自然:序贯决策中的等待学习

Christopher Watson, Arjun Krishna, Dinesh Jayaraman, Rajeev Alur

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对序贯决策中智能体频繁感知决策的问题,提出采用带字典序目标的强化学习训练等待策略,在7类任务上实现了可观的等待时长,且不牺牲任务性能。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11361 2026-08-13 cs.LG cs.CL cs.PF 新提交 62%

Lifecycle-Optimal Tokenization: Vocabulary Size as a Deployment-Regime-Dependent Infrastructure Parameter

生命周期最优分词:词汇表大小作为与部署 regime 相关的基础设施参数

Rima Mittal, Ankit Gubrani, Satyanarayana Kakollu

专题命中 规划决策 :planning(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现 LLM 分词器的最优词汇表大小随部署 regime 变化,提出生命周期部署成本模型,经实验证实其与训练最优值差异最高达 16 倍,且最优范围内质量损失极小,为 LLM 部署提供词汇表容量规划指导。

Comments 6 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11242 2026-08-13 cs.CL cs.AI 新提交 62%

Lost in Compaction: Evaluating Side-Constraint Loss under Context Compaction

在压缩中迷失:评估上下文压缩下的侧约束损失

Zhiqi Wang, Yichi Zhang, Dongwon Lee, Yuchen Yang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文针对长上下文场景下压缩器丢失会话约束(SCs)的问题,提出COMPINT评估套件量化损失,并开发即插即用的SCs感知提取器,使SCs保留率超90%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10337 2026-08-12 cs.HC cs.AI cs.CL 新提交 62%

Narrative Keyframing for Generative Creative Writing

用于生成式创意写作的叙事关键帧技术

Chao Zhang, Abe Davis

机构 * Cornell University(康奈尔大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出叙事关键帧技术,作为AI辅助创意写作的交互方法,通过三种关键帧类型实现对生成文本的精细控制,经用户研究验证其可控性、透明性与趣味性更优。

Comments UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09638 2026-08-11 cs.AI cs.CL cs.CY cs.GT 新提交 62%

Avalon-ToM-Bench: Evaluating Fine-Grained Theory of Mind via Asymmetric Game Mechanics

Avalon-ToM-Bench:通过非对称游戏机制评估细粒度心理理论

Yen-Shan Chen, Yu Chian Duan, Chih-En Kuo, Jian-Bin Wu, Yun-Nung Chen

机构 * National Taiwan University(台湾大学) CyCraft AI Lab(CyCraft人工智能实验室)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Avalon-ToM-Bench基准,基于阿瓦隆游戏机制评估大语言模型的细粒度心理理论,发现模型ToM能力不足源于推理策略而非知识或表征,推理训练比测试时思维链增益更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07418 2026-08-10 cs.AI cs.CL 新提交 62%

ResidencyRL: Reinforcement Learning in Simulated Clinical Environments

ResidencyRL:在模拟临床环境中开展的强化学习

Valentin Liévin, Samuel Schmidgall, Tim Strother, Alex Bijamov, Akshay Goel, Anil Palepu, Chunjong Park, Vahid Balazadeh, Min Woo Sun, Marius Guerard, Justin Chen, Dave Steiner, Vikram Dhillon, Ibrahim Azar, Akhil Mehta, Nicholas Spetsieris, Shilpan Shah, Maen Abdelrahim, Amit Dahiya, Yun Liu, Katherine Chou, Yossi Matias, Avinatan Hassidim, Dale R. Webster, Quoc V. Le, Raia Hadsell, Joelle Barral, Carey Radebaugh, Aleksandra Faust, Shekoofeh Azizi, Mike Schaekermann, Po-Hsuan Cameron Chen, Tao Tu, David Racz, Lin Yang

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究院) Houston Methodist Hospital(休斯顿卫理公会医院) Trinity Health Group(三一健康集团) Stanford Oncology Partners(斯坦福肿瘤学伙伴) St. Luke Hospital(圣卢克医院)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出 ResidencyRL,通过多轮强化学习训练临床 AI 智能体,在模拟临床环境中提升诊断准确性、降低漏报率,且能力可迁移至多个医学基准测试,为临床 AI 发展提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07317 2026-08-10 cs.SE cs.AI 新提交 62%

Towards Assurance Closure in AI-Native Large-Scale Agile Software Development

面向AI原生大规模敏捷软件开发中的保证闭合

Ricardo Britto

机构 * Ericsson(爱立信) Blekinge Institute of Technology(布莱金厄理工学院)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.SE

AI总结 针对AI原生大规模敏捷软件开发中保证推理机器可操作的缺口,提出基于共享语义保证层的高层架构及六项对应能力,以实现保证闭合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07077 2026-08-10 cs.AI cs.LG 新提交 62%

Transformers Struggle to Use Their Emergent World Models: Revisiting the Tower of Hanoi, and the Illusion of Thinking

Transformer难以利用其涌现的世界模型:重新审视汉诺塔与思维的错觉

Devin Pereira, Willem Zuidema

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究发现,Qwen3.6-27B等大型推理模型虽能编码汉诺塔的谢尔宾斯基世界模型,但因表示衰减导致圆环数超3时失败,注入提示词时间表示可部分恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07037 2026-08-10 cs.LG cs.AI 新提交 62%

Accounting Graph Transformer for Short-History Multi-KPI Forecasting in Small Businesses

用于小企业短历史多KPI预测的会计图变换器

Shrutendra Harsola, Vignesh Subrahmaniam

机构 * Foresight-AI, Intuit(富睿特远见人工智能实验室,Intuit公司)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出Accounting Graph Transformer模型,针对小企业短历史数据完成13项财务KPI的12个月联合预测,在多组测试集上均优于LightGBM等基准模型,为企业财务分析提供集成预测层。

详情

展开后加载摘要…

URL PDF HTML 收藏