arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11076 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11076 篇

2603.16822 2026-03-18 cs.AI 70%

Surg$Σ$: A Spectrum of Large-Scale Multimodal Data and Foundation Models for Surgical Intelligence

Surg$Σ$: 一种大规模多模态数据和基础模型的光谱,用于外科智能

Zhitao Zeng, Mengya Xu, Jian Jiang, Pengfei Guo, Yunqiu Xu, Zhu Zhuo, Chang Han Low, Yufan He, Dong Yang, Chenxi Lin, Yiming Gu, Jiaxin Guo, Yutong Ban, Daguang Xu, Qi Dou, Yueming Jin

机构 * NUS(新加坡国立大学) CUHK(香港中文大学) SJTU(上海交通大学) NVIDIA(英伟达)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出Surg$Σ$,通过大规模多模态数据和基础模型提升外科智能,解决现有框架任务特定、泛化能力差的问题,展示统一语义设计和结构化推理标注的改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21790 2026-03-18 econ.EM cs.AI 70%

Can large language models assist choice modelling? Insights into prompting strategies and current models capabilities

大语言模型能否协助选择建模?关于提示策略和当前模型能力的洞察

Georges Sfeir, Gabriel Nova, Stephane Hess, Sander van Cranenburgh

机构 * Choice Modelling Centre & Institute for Transport Studies, University of Leeds(选择建模中心及交通研究学院,利兹大学) CityAI Lab, Transport and Logistics group, Engineering Systems and Services Department, TU Delft(CityAI实验室,运输与物流组,工程系统与服务部门,代尔夫特理工大学)

专题命中 规划推理 :reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 本文研究大语言模型在离散选择建模中的潜力,通过实验框架评估七种领先模型在不同提示策略和信息可用性下的表现,揭示其在模型规范和估计中的能力与限制。

Comments 35 pages, 8 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05344 2026-03-16 cs.AI 70%

Building Effective AI Coding Agents for the Terminal: Scaffolding, Harness, Context Engineering, and Lessons Learned

构建高效的AI编码代理:支架、驾驭、上下文工程及经验教训

Nghi D. Q. Bui

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出OPENDEV,一种基于命令行的开源编码代理,通过安全控制、高效上下文管理及自适应压缩技术,实现终端优先的自主软件工程支持。

Comments Work in progress, new versions will be updated continuously

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11392 2026-03-13 cs.NI cs.AI 70%

Agentic AI for Embodied-enhanced Beam Prediction in Low-Altitude Economy Networks

面向低空经济网络的具身增强型波束预测的代理AI

Min Hao, Zhizhuo Li, Zirui Zhang, Maoqiang Wu, Han Zhang, Rong Yu

机构 * School of Electronic Science and Engineering, South China Normal University(南方科技大学电子科学与工程学院) School of Intelligent Engineering, Shaoguan university(韶关大学智能工程学院) School of Automation, Guangdong University of Technology(广东工业大学自动化学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出了一种基于多代理协作推理的混合波束预测模型,通过整合时序建模、视觉编码和多模态融合,提升低空经济网络中UAV通信的波束预测精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09151 2026-03-13 cs.AI 70%

Deep Tabular Research via Continual Experience-Driven Execution

通过持续经验驱动执行进行深度表格研究

Junnan Dong, Chuang Zhou, Zheng Yuan, Yifei Yu, Qiufeng Wang, Yinghui Li, Siyu An, Di Yin, Xing Sun, Feiyue Huang

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出深度表格研究(DTR)框架,通过闭环决策过程解决复杂表格分析问题,利用分层元图和期望感知策略实现持续优化,验证了战略规划与低层执行分离的重要性。

Comments 23 pages, 6 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20299 2026-03-13 cs.RO cs.AI cs.CV 70%

KnowVal: A Knowledge-Augmented and Value-Guided Autonomous Driving System

KnowVal: 一种知识增强且价值引导的自动驾驶系统

Zhongyu Xia, Wenhao Chen, Yongtao Wang, Ming-Hsuan Yang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王学苑计算机技术研究所) University of California, Merced(加州大学默塞德分校)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 KnowVal通过整合开放世界感知与知识检索,构建驾驶知识图谱并训练价值模型,实现价值对齐的自动驾驶系统,提升了规划性能并降低了碰撞率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12667 2026-03-11 cs.AI 70%

Empowering All-in-Loop Health Management of Spacecraft Power System in the Mega-Constellation Era via Human-AI Collaboration

通过人机协作赋能航天器电力系统在 mega-星座时代中的全闭环健康管理

Yi Di, Zhibin Zhao, Fujin Wang, Xue Liu, Jiafeng Tang, Jiaxin Ren, Zhi Zhai, Xuefeng Chen

专题命中 规划推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于人机协作的航天器电力系统全闭环健康管理框架,通过开源工具和数据集实现了高效的健康管理与故障诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07416 2026-03-10 cs.LG 70%

DualSpec: Accelerating Deep Research Agents via Dual-Process Action Speculation

DualSpec: 通过双过程动作推测加速深度研究代理

Shuzhang Zhong, Baotong Lu, Qi Chen, Chuanjie Liu, Fan Yang, Meng Li

机构 * pku(北京大学) msr(微软研究院)

专题命中 规划推理 :reasoning(abstract);verifier(abstract);分类 cs.LG

AI总结 DualSpec通过双过程动作推测机制,在保持准确性的同时显著提升深度研究代理的端到端速度

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07024 2026-03-10 cs.AI 70%

Enhancing Web Agents with a Hierarchical Memory Tree

通过分层记忆树增强网络代理

Yunteng Tan, Zhi Gao, Xinxiao Wu

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出分层记忆树HMT,通过结构化框架分离逻辑规划与操作执行,提升网络代理在跨网站和跨领域任务中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22571 2026-03-06 cs.AI 70%

PerfGuard: A Performance-Aware Agent for Visual Content Generation

PerfGuard: 一种面向视觉内容生成的性能感知代理

Zhipeng Chen, Zhongrui Zhang, Chao Zhang, Yifan Xu, Lan Yang, Jun Liu, Ke Li, Yi-Zhe Song

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications, China(北京邮电大学人工智能学院) Beijing Digital Native Digital City Research Center, China(北京数字原生数字城市研究中心) School of Computer Science and Engineering, Beihang University, China(北航计算机科学与工程学院) SketchX, CVSSP, University of Surrey, United Kingdom(SketchX、CVSSP、英国萨里大学) Chenxi Shuzhi (Beijing) Technology Co., Ltd, China(北京晨曦智数科技有限公司)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 PerfGuard通过性能感知机制提升视觉内容生成任务中工具选择的准确性与执行可靠性。

Comments This paper has been accepted by ICLR 2026. The original paper link is: https://openreview.net/pdf?id=tdN42GTv4S The code repository link is: https://github.com/FelixChan9527/PerfGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26905 2026-03-05 cs.AI 70%

Cognition Envelopes for Bounded Decision Making in Autonomous UAS Operations

认知边界用于自主无人机操作中的有限决策

Pedro Antonio Alarcon Granadeno, Arturo Miguel Bernal Russell, Sofia Nelson, Demetrius Hernandez, Maureen Petterson, Michael Murphy, Walter J. Scheirer, Jane Cleland-Huang

机构 * University of Notre Dame(诺特大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出认知边界概念,用于约束自主无人机在搜索救援任务中的决策,结合概率推理和资源分析,以减少 AI 生成决策中的错误。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02688 2026-03-04 cs.AI cs.RO 70%

Retrieval-Augmented Robots via Retrieve-Reason-Act

通过检索-推理-行动实现增强型机器人

Izat Temiraliev, Diji Yang, Yi Zhang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出检索增强型机器人学(RAR)范式,通过检索-推理-行动循环,使机器人能从外部文档获取未见程序知识,提升复杂任务执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02623 2026-03-04 cs.RO cs.LG 70%

Uni-Skill: Building Self-Evolving Skill Repository for Generalizable Robotic Manipulation

Uni-Skill:构建通用机器人操作的自演化技能库

Senwei Xie, Yuntian Zhang, Ruiping Wang, Xilin Chen

机构 * Key Laboratory of AI Safety of CAS(中国科学院人工智能安全重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 Uni-Skill通过自演化技能库提升机器人操作的通用性与适应性,实现高效技能检索与少样本推理。

Comments Accepted to ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01548 2026-03-03 cs.AI cs.SE 70%

Graph-Based Self-Healing Tool Routing for Cost-Efficient LLM Agents

基于图的自愈工具路由用于成本高效的LLM代理

Neeraj Bholani

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 Self-Healing Router通过自愈路由机制在LLM代理中实现成本高效且容错的工具使用,减少LLM调用并消除沉默故障。

Comments Working paper. 27 references, 13 figures, 8 tables, pseudocode appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01050 2026-03-03 cs.CV cs.AI 70%

MM-DeepResearch: A Simple and Effective Multimodal Agentic Search Baseline

MM-DeepResearch: 一种简单而有效的多模态代理搜索基线

Huanjin Yao, Qixiang Yin, Min Yang, Ziwang Zhao, Yibo Wang, Haotian Luo, Jingyi Zhang, Jiaxing Huang

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 MM-DeepResearch通过Hyper-Search和DR-TTS方法,构建了多模态代理搜索基线,实现了高效多模态研究任务的处理。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23365 2026-03-03 cs.LG 70%

Emergence of Superposition: Unveiling the Training Dynamics of Chain of Continuous Thought

连续思维的涌现:揭示连续思维链的训练动态

Hanlin Zhu, Shibo Hao, Zhiting Hu, Jiantao Jiao, Stuart Russell, Yuandong Tian

机构 * UC Berkeley(加州大学伯克利分校) UCSD(加州大学圣地亚哥分校) Nvidia(英伟达) Meta AI

专题命中 规划推理 :reasoning(abstract);CoT(abstract);分类 cs.LG

AI总结 本文通过分析两层Transformer在有向图可达性问题上的训练动态,揭示了连续思维链中叠加机制如何在训练过程中通过自回归扩展思维和预测阶段自然产生。

Comments 32 pages, 9 figures, accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05233 2026-03-03 cs.AI 70%

Electric Vehicle User Charging Behavior Analysis Integrating Psychological and Environmental Factors: A Statistical-Driven LLM based Agent Approach

电动汽车用户充电行为分析:整合心理和环境因素:一种基于统计驱动的LLM代理方法

Chuanlin Zhang, Junkang Feng, Chenggang Cui, Pengfeng Lin, Hui Chen, Yan Xu, A. M. Y. M. Ghias, Qianguang Ma, Pei Zhang

机构 * School of Electrical Engineering, Shanghai Jiaotong University(上海交通大学电气工程学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) Psychological Consultation Center, East China University of Political Science and Law(中国政法大学政治学与法律系心理咨询中心) School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一种基于统计驱动LLM的代理方法,整合心理和环境因素分析电动汽车用户充电行为,揭示行为异质性及决策影响因素。

Comments Accepted for publication in CSEE Journal of Power and Energy Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00200 2026-03-03 cs.CR cs.AI 70%

LiaisonAgent: An Multi-Agent Framework for Autonomous Risk Investigation and Governance

LiaisonAgent: 一个用于自主风险调查与治理的多智能体框架

Chuanming Tang, Ling Qing, Shifeng Chen

机构 * Shenzhen Institute of Advanced Technology, CAS(深圳先进技术研究院, 中国科学院) Sangfor Technologies Inc.(Sangfor技术有限公司) College of Management Science(管理科学学院) Chengdu University of Technology(成都理工大学) Shenzhen University of Advanced Technology(深圳大学先进技术学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 LiaisonAgent通过多智能体系统实现自主风险调查与治理,结合QWQ-32B模型和混合规划架构,提升安全响应效率与准确性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06940 2026-03-02 cs.DB cs.AI 70%

VISTA: Knowledge-Driven Vessel Trajectory Imputation with Repair Provenance

VISTA: 基于知识的船舶轨迹补全与修复溯源

Hengyu Liu, Tianyi Li, Haoyu Wang, Kristian Torp, Tiancheng Zhang, Yushuai Li, Christian S. Jensen

机构 * Department of Computer Science, Aalborg University, Denmark(计算机科学系,奥胡斯大学,丹麦) School of Computer Science and Engineering, Northeastern University, Shenyang, China(计算机科学与工程学院,东北大学,沈阳,中国)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 VISTA通过基于知识的可解释方法实现船舶轨迹补全,生成修复溯源以提升下游决策的可信度和效率。

Comments 24 pages, 14 figures, 4 algorithms, 8 tables. Code available at https://github.com/hyLiu1994/VISTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16313 2026-02-19 cs.CL 70%

MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks

MemoryArena:评估多会话代理任务中的代理记忆

Zexue He, Yu Wang, Churan Zhi, Yuanzhe Hu, Tzu-Ping Chen, Lang Yin, Ze Chen, Tong Arthur Wu, Siru Ouyang, Zihan Wang, Jiaxin Pei, Julian McAuley, Yejin Choi, Alex Pentland

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学) University of Pittsburgh(匹兹堡大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 MemoryArena是一个用于评估多会话代理任务中代理记忆的统一评估环境,揭示了现有长上下文记忆基准在代理任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15870 2026-02-19 cs.CL 70%

VDLM: Variable Diffusion LMs via Robust Latent-to-Text Rendering

VDLM: 通过鲁棒的潜在到文本渲染实现变量扩散语言模型

Shuhui Qu

机构 * Stanford University(斯坦福大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 VDLM通过分离语义规划与文本渲染,利用嵌入空间后训练和鲁棒解码技术,在扩散语言模型中实现更高效的多步推理和长形式生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02649 2026-02-18 cs.AI 70%

From Prompts to Protection: Large Language Model-Enabled In-Context Learning for Smart Public Safety UAV

从提示到保护:基于大语言模型的上下文学习用于智能公共安全无人机

Yousef Emami, Hao Zhou, Miguel Gutierrez Gaitan, Kai Li, Luis Almeida, Zhu Han

机构 * Real-Time and Embedded Computing Systems Research Centre (CISTER)(实时嵌入式计算系统研究中心) Carnegie Mellon University(卡内基梅隆大学) Pontificia Universidad Católica de Chile(天主教大学) School of Computer Science, McGill University(麦吉尔大学计算机科学学院) Instituto de Telecomunicações, Faculdade de Engenharia, Universidade do Porto(电信研究所,工程学院,葡萄牙里斯本大学) University of Houston(休斯顿大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型的上下文学习提升公共安全无人机的自主决策能力,通过自然语言提示和示例指导实现路径规划和速度控制,减少数据丢失并缓解安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17900 2026-02-18 cs.CL 70%

MedPlan: A Two-Stage RAG-Based System for Personalized Medical Plan Generation

MedPlan: 一种基于RAG的双阶段系统,用于个性化医疗计划生成

Hsin-Ling Hsu, Cong-Tinh Dao, Luning Wang, Zitao Shuai, Thao Nguyen Minh Phan, Jun-En Ding, Chun-Chieh Liao, Pengfei Hu, Xiaoxue Han, Chih-Ho Hsu, Dongsheng Luo, Wen-Chih Peng, Feng Liu, Fang-Ming Hung, Chenwei Wu

机构 * National Chengchi University(国立政治大学) National Yang Ming Chiao Tung University(国立阳明交通大学) Can Tho University(庆坚大学) University of Michigan(密歇根大学) Stevens Institute of Technology(史泰文斯理工学院) Far Eastern Memorial Hospital(东方纪念医院) Florida International University(佛罗里达国际大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 MedPlan通过双阶段RAG框架,结合SOAP方法,提升个性化医疗计划生成的准确性和结构化质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14083 2026-02-17 cs.AI 70%

Plan-MCTS: Plan Exploration for Action Exploitation in Web Navigation

Plan-MCTS:网页导航中的计划探索用于动作利用

Weiming Zhang, Jihong Wang, Jiamu Zhou, Qingyao Li, Xinbei Ma, Congmin Zheng, Xingyu Lou, Weiwen Liu, Zhuosheng Zhang, Jun Wang, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) OPPO Research Institute(OPPO研究院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 Plan-MCTS通过将网页导航探索转移到语义计划空间,提升动作利用效率,实现更高效的导航任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13639 2026-02-17 cs.AI cs.MA 70%

Guided Collaboration in Heterogeneous LLM-Based Multi-Agent Systems via Entropy-Based Understanding Assessment and Experience Retrieval

通过基于熵的理解评估和经验检索实现异构大语言模型多智能体系统的引导协作

Linlin Wang, Tianqing Zhu, Laiqiao Qin, Longxiang Gao, Wanlei Zhou

机构 * Faculty of Data Science, City University of Macau(数据科学学院,澳门城市大学) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center, Qilu University of Technology (Shandong Academy of Sciences)(计算能力网络与信息安全重点实验室,教育部,山东计算机科学中心,齐鲁工业大学(山东科学院)) Shandong Provincial Key Laboratory of Computing Power Internet and Service Computing, Shandong Fundamental Research Center for Computer Science(山东省计算能力互联网与服务计算重点实验室,山东省计算机科学基础研究中心)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出基于熵的理解评估和经验检索的引导协作框架,通过自适应引导和RAG机制提升异构多智能体系统的协作效果和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13347 2026-02-17 cs.CV cs.AI cs.RO 70%

Visual Foresight for Robotic Stow: A Diffusion-Based World Model from Sparse Snapshots

机器人存取的视觉预见:一种基于稀疏快照的扩散世界模型

Lijun Zhang, Nikhil Chacko, Petter Nilsson, Ruinian Xu, Shantanu Thakar, Bai Lou, Harpreet Sawhney, Zhebin Zhang, Mudit Agrawal, Bhavana Chandrashekhar, Aaron Parness

机构 * Amazon, Seattle, US(亚马逊(美国西雅图))

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 FOREST通过基于稀疏快照的扩散模型,提升仓库存取操作的预测精度,为仓储规划提供有效预见信号。

Comments 20 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13227 2026-02-17 cs.NI cs.AI 70%

An Agentic AI Control Plane for 6G Network Slice Orchestration, Monitoring, and Trading

面向6G网络切片编排、监控与交易的代理式AI控制平面

Eranga Bandara, Ross Gore, Sachin Shetty, Ravi Mukkamala, Tharaka Hewa, Abdul Rahman, Xueping Liang, Safdar H. Bouk, Amin Hass, Peter Foytik, Ng Wee Keong, Kasun De Zoysa

机构 * Florida International University, USA(佛罗里达国际大学) Center for Wireless Communications, University of Oulu, Finland(无线通信中心,奥卢大学) Accenture Technology Labs, Arlington, VA, USA(埃森哲技术实验室) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出面向6G网络切片编排、监控与交易的代理式AI控制平面,通过市场感知编排和自然语言接口实现经济导向的智能控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01253 2026-02-12 cs.AI cs.SY eess.SY q-bio.NC 70%

Metareasoning in uncertain environments: a meta-BAMDP framework

在不确定环境中进行元推理:一个元Bayes-适应MDP框架

Prakhar Godara, Tilman Diego Alemán

机构 * Department of Psychology(心理学系) Institut für Geometrie und Praktische Mathematik(几何与应用数学研究所)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出元Bayes-适应MDP框架,用于处理未知奖励和转移分布环境中的元推理问题,并在伯努利老虎机任务中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08808 2026-02-10 cs.LG 70%

How2Everything: Mining the Web for How-To Procedures to Evaluate and Improve LLMs

How2Everything: 从网络挖掘如何操作指南以评估和改进大语言模型

Yapei Chang, Kyle Lo, Mohit Iyyer, Luca Soldaini

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Maryland(马里兰大学) University of Washington(华盛顿大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 How2Everything通过从网络挖掘操作指南,构建评估集并利用强化学习提升模型性能,实现大规模的能力评估与改进闭环。

Comments 53 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14893 2026-02-10 cs.CV cs.CL cs.RO 70%

Virtual Community: An Open World for Humans, Robots, and Society

虚拟社区:人类、机器人与社会的开放世界

Qinhong Zhou, Hongxin Zhang, Xiangye Lin, Zheyuan Zhang, Yutian Chen, Wenjun Liu, Zunzhe Zhang, Sunli Chen, Lixing Fang, Qiushi Lyu, Xinyu Sun, Jincheng Yang, Zeyuan Wang, Bao Chi Dang, Zhehuan Chen, Daksha Ladia, Quang Vinh Dang, Jiageng Liu, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Johns Hopkins University(约翰霍普金斯大学) CMU(卡内基梅隆大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 虚拟社区是一个开放世界平台,旨在研究人类与机器人共存的社会智能,通过多智能体模拟和大规模社区生成,提出两个新挑战以探索开放世界中的协作与规划能力。

Comments website https://virtual-community-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏