arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-09-01 至 2026-09-01 共收录 481 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 115 篇

2508.13073 2026-09-01 cs.RO cs.CV 版本更新 75%

Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey

用于机器人操作的基于大型VLM的视觉-语言-动作模型:综述

Rui Shao, Wei Li, Lingsen Zhang, Renshan Zhang, Zhiyang Liu, Ran Chen, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(计算机科学与技术学院,哈尔滨工业大学(深圳))

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 本综述首次系统分类梳理用于机器人操作的基于大型VLM的VLA模型,明确其定义与两类架构,考察其与先进领域的集成等内容,整合进展并提供更新项目页面

Comments Under Minor Revision at IEEE TPAMI, Project Page: https://github.com/JiuTian-VL/Large-VLM-based-VLA-for-Robotic-Manipulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30730 2026-09-01 cs.LG cs.CL 新提交 73%

E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation

电商基准测试集:评估大语言模型智能体在长周期自主商业运营中的表现

Wei Fan, Xinjie Shen, Xudong Guo, Jianhong Tu, Yang Su, Yinger Zhang, Lianghao Deng, Fengyu Wang, Baohua Dong, Yangqiu Song, Dayiheng Liu

机构 * Qwen Team, Alibaba Group(通义千问团队,阿里巴巴集团) Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系) Taobao & Tmall Group, Alibaba Group(阿里巴巴集团淘宝天猫集团)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG

AI总结 该研究推出首个开源电商长周期自主商业运营基准E-Commerce Bench,评估18个前沿LLM智能体,发现无单一模型占优,GPT-5.6 Sol盈利最高,Qwen3.8-Max-Preview为开源模型最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27505 2026-09-01 cs.CL cs.AI 版本更新 73%

A Survey on Rubric-Guided Reinforcement Learning for Language Models

面向语言模型的准则引导强化学习综述

Zifei Shan, Fangning Shao

机构 * WeChat, Tencent(腾讯微信)

专题命中 规划决策 :agentic(abstract,abstract_cn);分类 cs.AI、cs.CL

AI总结 该综述针对传统RLHF的缺陷,提出贝叶斯框架并沿先验-后验轴分类准则引导强化学习,分析语言学相关对齐问题,明确未来研究方向。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30676 2026-09-01 cs.AI 新提交 70%

MedAgent-R1: Faithfulness-Aware Reinforcement Learning for Evidence-Grounded Medical Reasoning

MedAgent-R1:面向证据 grounded 医疗推理的忠实性感知强化学习

Jiangwang Chen, Chenghao Zhang, Hengxing Cai

机构 * Tsinghua University(清华大学) DP Technology(第四范式)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 MedAgent-R1 针对医疗推理智能体的自信幻觉问题,采用忠实性门控奖励设计,大幅降低引用编造率、提升证据完整性,在 HealthBench Safety 上表现优于 GPT-4o,实现了证据 grounded 的医疗推理优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30396 2026-09-01 cs.AI cs.RO 新提交 70%

Scaffolding Foundation Models into Physical-World Agents Pushes the Frontier of Long-Horizon Navigation

将基础模型搭建为物理世界智能体以推动长时程导航前沿

Zixing Lei, Gengze Zhou, Xiong-Hui Chen, Jiazhao Zhang, Yiyang Huang, Hang Yin, Haoqi Yuan, Qi Wu, Weixin Li, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Inc(阿里巴巴集团) Zhongguancun Academy(中关村学院) Adelaide University(阿德莱德大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出NavMCP框架,结合VLM推理智能体与NFM执行器实现长时程导航,在多个具身问答基准及Unitree Go2机器人上取得优于基线的性能,验证了该方法的有效性。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29953 2026-09-01 cs.AI 新提交 70%

SearchWiki: Learning to Build and Navigate Knowledge Wikis for Active Information Seeking

SearchWiki:学习构建与导航知识Wiki以支持主动信息检索

Guransh Singh, Vishwajeet Kumar, Arkadeep Acharya, Adnan Qidwai, Jaydeep Sen, Sachindra Joshi

机构 * IBM(国际商业机器公司)

专题命中 规划决策 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 该研究提出SearchWiki框架,将语料库合成分层可导航Wiki,训练WikiResearcher-9B智能体经强化学习优化导航策略,在多基准测试中表现优于同规模模型,证实结构化语料库学习式导航优于扁平检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29685 2026-09-01 cs.LG 新提交 70%

Last Step Matters: Early Uncertainty Cannot Predict Failure in Long-Horizon Agents

最后一步很重要:早期不确定性无法预测长视界智能体的失败

Zongyue Li, Chengyue Yu, Lei Zang, Chenyi Zhuang, Linjian Mo, Leilei Gan

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 规划决策 :agent(abstract);tool-use(abstract);分类 cs.LG

AI总结 该研究发现长视界智能体的早期不确定性无法预测失败,仅最后一步的语言置信度可可靠区分失败,建议用最后一步置信度决定是否重启,其效果优于轨迹内干预。

Comments Accepted to the Main Conference of the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30125 2026-09-01 cs.SD cs.AI cs.CL cs.CV cs.LG 新提交 67%

VIBE: Video Instruction-aligned Background music gEneration

VIBE:视频指令对齐背景音乐生成模型

Aryan Vijay Bhosale, Vaibhavi Lokegaonkar, Vishnu Raj, Gouthaman KV, Sreyan Ghosh, Ramani Duraiswami, Lie Lu, Dinesh Manocha

机构 * Dolby Laboratories(杜比实验室) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 VIBE是一种新型文本与视频生成音乐模型,通过深度跨层条件机制与五阶段奖励建模优化,提升了音乐生成的可控性与指令依从性,在生成保真度上与多数基准模型相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30067 2026-09-01 cs.LG cs.AI cs.CL 新提交 67%

How do World Models and Policies Compose in LLM Agents? A Joint Spectral and Behavioral Account

世界模型与策略如何在大语言模型智能体中结合?一种联合谱分析与行为学解释

Ruize Xu, Xiao Yu, Yujin Tang, Chenming Shang, Nikhil Singh

机构 * Dartmouth College(达特茅斯学院) Columbia University(哥伦比亚大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究通过受控实验探究LLM智能体中世界模型与策略的结合机制,从几何与行为角度揭示二者的互补特性,并提出提升策略训练保留世界知识能力的方法。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29896 2026-09-01 cs.RO 新提交 67%

EMERGE-Policy: A Robot Mind Emerges Beyond a Single Policy

EMERGE-Policy:超越单一策略的机器人心智涌现

Zhirui Fang, Qingchi Yu, Ziyang Chen, Longfei Li, Haoran Ma, Keru Zhou, Xinrun Xu, Samith Va, Yuxuan Hu, Peixuan Song, Qiang Du, Bin Qian, Yongkang Deng, Xin Li, Yezhen Wang, Zhe Li, Hao Luo, Shuyan Li, Ziwei Wang, Weijian Deng, Xiu Li

机构 * Tsinghua University(清华大学) Nanjing University of Science and Technology(南京理工大学) Xi’an Jiaotong University(西安交通大学) Xidian University(西安电子科技大学) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学)

专题命中 规划决策 :agent(abstract);agentic(abstract)

AI总结 EMERGE-Policy是一种图结构智能体框架,通过多角色子智能体协作划分功能子任务,无需额外微调即可在公开基准和真实机器人实验中实现出色性能,扩展了机器人策略的应用范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22878 2026-09-01 cs.AI cs.CL cs.IR cs.LG 版本更新 67%

SciAtlas: A Computable Atlas of Science for Knowledge-Grounded AI Research

SciAtlas:面向自动化科学研究的大规模知识图谱

Shuofei Qiao, Yunxiang Wei, Busheng Zhang, Mengru Wang, Jiazheng Fan, Huadong Jian, Bin Wu, Shumin Deng, Yida Xue, Zifan Cheng, Xiang Chen, Dan Zhang, Junfeng Fang, Ningyu Zhang, Keyan Ding, Qiang Zhang, Jeff Z. Pan, Emine Yilmaz, Huajun Chen

机构 * Zhejiang University(浙江大学) University College London(伦敦大学学院)

专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 为应对学术信息爆炸和跨学科整合困难,提出包含4300万论文、1.57亿实体和30亿三元组的多学科知识图谱SciAtlas,并开发神经符号检索算法,实现从语义匹配到确定性关联发现的转变,降低推理成本。

Comments Ongoing Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30224 2026-09-01 cs.CL cs.AI 新提交 62%

The Differential Reasoning Router: Operationalizing Cost-Aware LLM Annotation in E-commerce

差异推理路由:在电商中实现成本感知的大语言模型标注

Cheng Lyu, Jingyue Zhang, Vinny DeGenova, Mengwei Li, Yuanli Pei

机构 * Wayfair

专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 该研究针对电商LLM标注冷启动问题,提出DRR框架,通过联合优化模型选择与人工升级实现自适应路由,在保持准确率的同时节约60%以上推理令牌成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22479 2026-09-01 cs.CL cs.LG 版本更新 62%

GTA-RAG: Graph-Trajectory-Augmented Reinforcement Learning for Multi-Turn Retrieval-Augmented Reasoning

GTA-RAG:用于多轮检索增强推理的图轨迹增强强化学习

Jun Chen, Yongchao Liu, Pengyu Qiu, Jiajun Zheng, Juelu Zhang, Yujie Zeng, Qin Zhang, Ziyue Qiao, Xiao Luo

机构 * Shenzhen University(深圳大学) Great Bay University(大湾区大学) Ant Group(蚂蚁集团)

专题命中 规划决策 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 GTA-RAG是一种图轨迹增强强化学习框架,通过轨迹级监督优化检索策略,在多跳和简单问答基准上,相比RL-based RAG基线提升了性能与证据链覆盖率。

Comments 12 pages, 5 figures. Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25875 2026-09-01 cs.LG cs.AI 版本更新 62%

A2TTA: Anchored-and-Agile Test-Time Adaptation for Evolving Traffic Sensor Networks

A2TTA:用于不断发展的交通传感器网络的锚定与敏捷测试时自适应

Du Yin, Xiachong Lin, Yue Tan, Jinliang Deng, Estrid He, Hao Xue, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学) Beihang University(北京航空航天大学) RMIT University(皇家墨尔本理工大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对交通传感器网络动态变化致传统预测模型性能下降问题,提出A2TTA框架,将拓扑诱导误差转化为输出校准问题,区分时间自适应,联合应对拓扑演变和多尺度时间偏移,实验证明该框架能有效提升预测性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06387 2026-09-01 cs.LG cs.AI 版本更新 62%

Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level

非对称在线策略蒸馏:在令牌层面弥合利用与模仿

Nan Jia, Haojin Yang, Xing Ma, Jiesong Lian, Shuailiang Zhang, Weipeng Zhang, Ke Zeng, Xunliang Cai, Zequn Sun

机构 * Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Meituan(美团)

专题命中 规划决策 :tool-use(abstract);分类 cs.AI、cs.LG

AI总结 本文提出非对称在线策略蒸馏,通过局部散度最小化改进传统策略蒸馏,提升数学推理任务表现,实现更稳定的策略熵和持续工具使用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07699 2026-09-01 cs.CL cs.AI 版本更新 62%

DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity in the Retail Domain

DRIP-R:零售领域决策与推理在现实政策模糊性下的基准测试

Hsuvas Borkakoty, Sebastian Pohl, Cheng Wang, Bei Chen, Yufang Hou

机构 * Interdisciplinary Transformation University Austria(跨学科转型大学奥地利) Amazon Berlin(亚马逊柏林)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 DRIP-R基准测试通过现实零售政策模糊性构建无唯一正确解决方案的场景,评估LLM在模糊政策下的决策与推理能力,揭示其固有的系统性挑战。

Comments Accepted to EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03677 2026-09-01 cs.CL cs.AI 版本更新 62%

MIND: Unified Inquiry and Diagnosis RL with Criteria Grounded Clinical Supports for Psychiatric Consultation

MIND: 一种基于临床标准的统一探究与诊断强化学习框架用于精神病咨询

Guoyi Li, Shihao Xu, Jiatong Ma, Zhongjiang Yao, Yunyun Han, Jianhua Chen, Yafeng Deng

机构 * EverMind AI Inc.(EverMind AI公司) EverMind AI Inc., Tianqiao and Chrissy Chen Institute(EverMind AI公司、田桥与克里斯西·陈研究所) Shanghai Mental Health Center, Shanghai Jiao Tong University School of Medicine(上海精神卫生中心、上海交通大学医学院)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 MIND通过基于临床标准的推理框架提升精神病咨询的诊断准确性和互动质量。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01419 2026-09-01 cs.LG cs.AI 版本更新 62%

Semi-supervised CAPP Transformer Learning via Pseudo-labeling

半监督CAPP变换器学习 via 假设标签

Dennis Gross, Helge Spieker, Arnaud Gotlieb, Emmanuel Stathatos, Panorios Benardos, George-Christopher Vosniakos

机构 * Simula Research Laboratory(Simula研究实验室) National Technical University of Athens(希腊国家技术大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种半监督学习方法,通过假设标签改进基于变换器的CAPP模型,提升数据稀缺环境下的制造过程规划准确性。

Comments 4th European Symposium on Artificial Intelligence in Manufacturing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03400 2026-09-01 cs.LG cs.AI 版本更新 62%

Better World Models Can Lead to Better Post-Training Performance

更好的世界模型可以导致更好的训练后性能

Prakhar Gupta, Henry Conklin, Sarah-Jane Leslie, Andrew Lee

机构 * University of Michigan(密歇根大学) Princeton University(普林斯顿大学) Harvard University(哈佛大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过比较不同世界建模策略,发现显式建模能提升Transformer的状态表示质量,从而增强强化学习后训练的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04363 2026-09-01 cs.LG cs.CL 版本更新 62%

Amortizing intractable inference in large language models

摊销大型语言模型中难以处理的推理

Edward J. Hu, Moksh Jain, Eric Elmoznino, Younesse Kaddar, Guillaume Lajoie, Yoshua Bengio, Esmeralda S. Whitammer

专题命中 规划决策 :tool use(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对大型语言模型的难以处理后验分布采样问题,提出用生成流网络(GFlowNets)的摊销贝叶斯推理方法微调LLM,可替代最大似然训练,还能高效适配需多步推理和工具使用的任务。

Comments ICLR 2024; 23 pages; code: https://github.com/GFNOrg/gfn-lm-tuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29465 2026-09-01 stat.ML cs.LG stat.ME 新提交 57%

Deciding When to Decide: Testing Operational Suboptimality Under Distributional Shift

决策时机的确定:分布偏移下的操作次优性检验

Minxing Zheng, Holly Wiberg, Shixiang Zhu

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 针对分布偏移下决策是否需重新优化的问题,提出以决策为中心的框架\texttt{RADAR},可区分有害与无害偏移,在多任务中表现优于决策无关替代方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31167 2026-09-01 cs.RO cs.AI 新提交 57%

SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies

SUN:用于语言接地控制学习到真实策略的持久程序

Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao, Yuxin Jiang, Chenfanfu Jiang, Yingnian Wu, Demetri Terzopoulos, Ran Gong

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) Amazon(亚马逊公司) Robotics and AI Institute(机器人与人工智能研究院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出语义统一(SUN)程序及系统Kuafu,由大型视觉语言系统自动合成,在9项任务中实现82.03%宏观成功率,优于相关基准,可将控制摊销为鲁棒策略,实现符号规划与数据驱动执行的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31119 2026-09-01 cs.CL 新提交 57%

PaperGym: Rubric-Centered Evolution for Research-Plan Generation

PaperGym:以评分标准为中心的研究计划生成演化框架

Yuhan Wang, Zhengxi Lu, Yuchen Yan, Kaitao Song, Wenqi Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Apple(苹果公司)

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 本文提出PaperGym框架,将论文转化为研究计划生成的训练环境,采用评分标准分阶段训练Qwen3系列模型,显著提升了研究规划能力,在多项基准上优于现有方法。

Comments 34 pages, 6 figures, 6 tables. Code: https://github.com/ZJU-REAL/PaperGym. Project page: https://zju-real.github.io/PaperGym. Dataset: https://huggingface.co/datasets/CabbageWyh/PaperGym-Data. Model: https://huggingface.co/CabbageWyh/PaperGym-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31075 2026-09-01 cs.AI 新提交 57%

Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence

超越人类监督扩展大型推理模型:通往超级智能的路径

Zhiqin Yang, Jingwen Fu, Yuhan Liu, Hengyu Liu, Yonggang Zhang, Kainan Cao, Zizhuo Zhang, Chenxin Li, Ruibin Yuan, Jiahao Pan, Jiankai Sun, Zhenyuan Zhang, Yibo Li, Yunlong Lin, Jing Xiong, Sida Lin, Bo Han, Wei Xue, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhongguancun Academy(中关村学院) Xi’an Jiaotong University(西安交通大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Hong Kong Baptist University(香港浸会大学) Hunyuan Tencent(腾讯混元) National University of Singapore(新加坡国立大学) Xiamen University(厦门大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 本文研究人类监督逐步退出时大型推理模型(LRMs)的扩展路径,提出五级阶梯框架,分析自主化带来的风险,围绕策略能力等开展评估,为开发通往超级智能的自我维持学习系统提供结构化方案。

Comments 72pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30955 2026-09-01 cs.AI 新提交 57%

Learning Action Models with Conditional and Quantified Effects via Uncertainty-Guided Exploration

通过不确定性引导的探索学习具有条件和量化效果的动作模型

Jeffrey Jewett, William Solow, Sandhya Saisubramanian

机构 * Oregon State University(俄勒冈州立大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 研究针对现有动作模型学习方法难以处理条件与量化效果的问题,提出OHCAM方法,通过不确定性引导探索学习动作模型,在基准领域与机器人任务中验证其样本效率与现实适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30406 2026-09-01 cs.LG 新提交 57%

Locally-Guided Actor-Critic: Training a Goal-conditioned Actor with a Subgoal-aware Critic

局部引导的演员-评论家:利用感知子目标的评论家训练目标条件演员

Olivier Serris, Stéphane Doncieux, Olivier Sigaud

机构 * ISIR Sorbonne Université(索邦大学) CNRS(法国国家科学研究中心)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 针对目标条件强化学习长 horizon 稀疏奖励的问题,该文提出 LG-AC 方法,以子目标条件值函数总和实现密集事后重标记,在目标链任务中性能优于 RIS、RS 等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30307 2026-09-01 cs.CV cs.AI 新提交 57%

ScenePilot: Grow-and-Repair Policy for Text-Driven 3D Indoor Scene Generation

ScenePilot:面向文本驱动的3D室内场景生成的生长-修复策略

Jiawei Zhang, Hongsong Wang, Pan Zhou

机构 * Southeast University(东南大学) Singapore Management University(新加坡管理大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 ScenePilot是一种检索增强的生长-修复框架,通过HRAP模块检索布局先验、RMR模块进行轻量修复,实现了高效的文本驱动3D室内场景生成,提升了物理合理性等性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29998 2026-09-01 cs.LG 新提交 57%

The Intervention Gap in Latent World Models

潜在世界模型中的干预差距

Donna Vakalis

机构 * Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) University of Montreal(蒙特利尔大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 该研究发现潜在世界模型存在干预差距,即模型开环转移与环境干预对任务变量的影响存在偏差,需以捕获优先的方式在模型原生接口直接审计干预保真度。

Comments 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29888 2026-09-01 cs.LG 新提交 57%

Sensitivity-Constrained Neural Operators for Data-Efficient Forward and Inverse Modeling of Partial Differential Equation Systems

用于偏微分方程系统数据高效正演与反演建模的灵敏度约束神经算子

Abdolmehdi Behroozi, Chaopeng Shen, Daniel Kifer, Kathryn Lawson

机构 * Penn State University(宾夕法尼亚州立大学) School of Electrical Engineering and Computer Science, Penn State University(宾夕法尼亚州立大学电气工程与计算机科学学院)

专题命中 规划决策 :workflow(abstract);分类 cs.LG

AI总结 本文提出灵敏度约束神经算子(SC-NO),通过采样灵敏度监督改进神经PDE代理,在正演预测、反演重建等任务中提升精度与效率,实现了更优的精度-成本权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29841 2026-09-01 cs.CL cs.PL 新提交 57%

SkillForge: Compositional Skill Synthesis with Verification-in-the-Loop for Generating Formally Verified Dafny Programs

SkillForge:结合验证循环的组合技能合成方法,用于生成形式化验证的 Dafny 程序

Yanming Liu, Xinyue Peng, Jiannan Cao, Xinyi Wang, Jinbo Su

机构 * Zhejiang University(浙江大学) Southeast University(东南大学) MIT(麻省理工学院) Weixin AI Lab(微信AI实验室) Renmin University(中国人民大学)

专题命中 规划决策 :agentic(abstract);分类 cs.CL

AI总结 SKILLFORGE 是将形式化代码合成分解为原子技能库并结合验证循环协调的框架,在自然语言转 Dafny 程序任务上性能优于现有方法。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏