arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11076 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11076 篇

2512.04988 2026-07-02 cs.MA cs.AI 版本更新 70%

When AI Agents Compete for Jobs: Strategic Capabilities and Economic Dynamics of AI Labour Markets

当AI代理竞争工作岗位:AI劳动力市场的战略能力与经济动态

Christopher Chiu, Simpson Zhang, Mihaela van der Schaar

机构 * DAMTP, University of Cambridge(剑桥大学应用数学与理论物理系)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出AI-Work模拟平台,研究AI代理在劳动力市场中的竞争行为,发现元认知、竞争意识和长期战略规划能力使代理获得更高利润和市场份额。

Comments Accepted at ICML 2026, Code available at https://github.com/chy-chiu/ai-work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30658 2026-07-01 cs.CY cs.AI 新提交 70%

Agentic AI Enhances Physician Trust in Clinical Decision Making

智能体AI增强医生在临床决策中的信任

Zhiling Yan, Zhe Fang, David J King, Ann Pongsakul, Eashan Adhikarla, Hui Ren, Sunyang Fu, Quanzheng Li, Lifang He, Xiang Li, Hongfang Liu, Yonghui Wu, Lichao Sun

机构 * Department of Computer Science and Engineering, Lehigh University(里海大学计算机科学与工程系) Department of Epidemiology, Harvard T.H. Chan School of Public Health(哈佛大学陈曾熙公共卫生学院流行病学系) Department of Medicine, Division of Cardiology, University of Florida(佛罗里达大学医学院心脏病学系) McGovern Medical School, University of Texas Health Science Center at Houston(德克萨斯大学休斯顿健康科学中心麦戈文医学院) Department of Radiology, Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院放射学系) McWilliams School of Biomedical Informatics, University of Texas Health Science Center at Houston(德克萨斯大学休斯顿健康科学中心麦克威廉姆斯生物医学信息学院) Department of Health Outcomes & Biomedical Informatics, College of Medicine, University of Florida(佛罗里达大学医学院健康结果与生物医学信息学系)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究通过医生评估多模态临床病例,发现智能体AI相比非智能体基线显著提升医生的认知和行为信任,尤其在治疗规划任务中,但存在对错误输出的过度依赖。

Comments Accepted by AMIA 2026 Annual Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09038 2026-06-30 cs.AI 70%

SearchSkill: Teaching LLMs to Use Search Tools with Evolving Skill Banks

SearchSkill: 教授大语言模型使用搜索工具与演进技能库

Jinchao Hu, Meizhi Zhong, Kehai Chen, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区计算机科学与技术学院) TikTok Inc, Beijing(字节跳动北京公司)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 SearchSkill通过可重用的搜索技能显式规划查询,提升开放域问答中的检索效率和推理质量,改进了知识密集型问答基准的精确匹配表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01442 2026-06-29 cs.AI 版本更新 70%

Agentic Episodic Control

智能体情节控制

Xidong Yang, Wenhao Li, Junjie Sheng, Yun Hua, Haosheng Chen, Chuyun Shen, Xiangfeng Wang

机构 * East China Normal University(华东师范大学) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) Shanghai University of International Business and Economics(上海对外经贸大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出智能体情节控制(AEC),利用大语言模型增强情节强化学习,通过语义增强器和关键状态识别器提升数据效率和泛化能力,在BabyAI-Text环境中实现2-6倍数据效率提升。

Comments Accepted to Findings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26874 2026-06-26 cs.AI 新提交 70%

TAVR-VLM: Risk-Conditioned Causal Grounding for Hallucination-Resistant Report Generation

TAVR-VLM:面向抗幻觉报告生成的风险条件因果基础

Zhixiang Lu, Xiwei Liu, Sifan Song, Changkai Ji, Anh Nguyen, Jionglong Su, Imran Razzak, Jinfeng Wang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Shanghai Jiao Tong University(上海交通大学) University of Liverpool(利物浦大学) Kunming University of Science and Technology(昆明理工大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出TAVR-VLM框架,通过风险条件因果注意力(R-CGA)建立“风险→区域→词”的结构化基础路径,在TAVR规划中减少诊断幻觉,实现新最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26298 2026-06-26 cs.AI cs.CR 新提交 70%

Governing Actions, Not Agents: Institutional Attestation as a Governance Model for Autonomous AI Systems

治理行动,而非智能体:机构证明作为自主AI系统的治理模型

Jakob Salfeld-Nebgen

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 针对自主AI系统可能执行不可逆高风险行动的问题,提出一种基于机构证明的计算治理模型,将执行权限与规划推理分离,通过独立权威源证明前提条件,并采用防篡改日志记录决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24470 2026-06-24 cs.AI 新提交 70%

The Latent Bridge: A Continuous Slow-Fast Channel for Real-Time Game Agents

潜在桥:用于实时游戏智能体的连续慢-快通道

Bojie Li, Noah Shi

机构 * Pine AI University of Washington(华盛顿大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 针对实时游戏智能体,提出一种可学习的连续潜在桥(Latent Bridge),将慢速推理VLM的残差投影到快速反应VLM的输入嵌入空间,在7个Atari游戏和驾驶域中匹配或超越文本桥,且增益高度可预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23595 2026-06-23 cs.AI 新提交 70%

SPIRAL: Learning to Search and Aggregate

SPIRAL: 学习搜索与聚合

Jubayer Ibn Hamid, Ifdita Hasan Orney, Michael Y. Li, Omar Shaikh, Yoonho Lee, Dorsa Sadigh, Chelsea Finn, Noah Goodman

机构 * Stanford University(斯坦福大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出SPIRAL框架,通过强化学习联合训练语言模型在推理时使用顺序推理、并行采样和聚合三种原语,实现端到端优化,显著提升推理计算扩展效率。

Comments Ongoing Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22909 2026-06-23 cs.DB cs.AI cs.IR 新提交 70%

Graph-Enhanced Large Language Models for Spatial Search

用于空间搜索的图增强大型语言模型

Nicole R. Schneider, Kent O'Sullivan, Hanan Samet

机构 * University of Maryland(马里兰大学) University of Sydney(悉尼大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 针对大语言模型空间推理能力不足的问题,提出图增强方法,将空间数据以图形式存储并与检索增强生成结合,提升复杂空间问题回答能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21616 2026-06-23 cs.CL 新提交 70%

LLM and Human Modes of Representation

LLM与人类的表征模式

Shalom Lappin

机构 * Shalom Lappin

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 研究比较大型语言模型(LLM)与人类在语言知识和现实推理中的表征差异,发现LLM在语言任务上表现优异但处理方式不同,且在推理任务中学习与泛化效率低于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20761 2026-06-23 cs.SE cs.AI cs.ET cs.MA cs.SY eess.SY 新提交 70%

Integrating Large Language Model Agents with Digital Twins for Industrial Autonomous Systems

将大语言模型代理与数字孪生集成用于工业自主系统

Yuchen Xia

机构 * Institut für Automatisierungs- und Softwaresysteme (IAS) der Universität Stuttgart(自动化与软件系统研究所(IAS)的斯图加特大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出三层框架集成大语言模型、数字孪生与自动化系统,通过TPSR模型和四种LLM角色实现自适应任务规划与执行,提升工业自动化适应性。

Comments Doctoral Dissertation, University of Stuttgart. Doctoral Exam Video Recording: https://youtu.be/Mhd9LiV5TKE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20596 2026-06-23 cs.HC cs.AI cs.SE 新提交 70%

HAAS Studio: A Tool for Simulating, Benchmarking, and Governing Human-AI Work Allocation

HAAS Studio: 用于模拟、基准测试和管理人-AI工作分配的工具

Vicente Pelechano

机构 * Valencian Research Institute for Artificial Intelligence(巴伦西亚人工智能研究 institute)

专题命中 规划推理 :planning(abstract,abstract_cn);分类 cs.AI

AI总结 提出HAAS Studio,一个用于策略感知的自适应人-AI任务分配的模拟与决策支持工具,结合认知表示、协作光谱、多臂老虎机算法和基于契约的治理,支持多领域部署决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18325 2026-06-19 cs.CR cs.AI 新提交 70%

Agentra: A Supervisable Multi-Agent Framework for Enterprise Intrusion Response

Agentra: 一种可监督的多智能体企业入侵响应框架

Raj Patel, Shaswata Mitra, Michele Guida, Stefano Iannucci, Sudip Mittal, Shahram Rahimi

机构 * The University of Alabama, Alabama, USA(阿拉巴马大学) Roma Tre University, Rome, Italy(罗马三大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出可监督的多智能体入侵响应框架Agentra,通过角色划分、规划-验证循环、安全网关和风险评分机制,将警报转化为结构化响应计划,在120事件语料上F1从0.61提升至0.84,有害动作率降至0.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18363 2026-06-18 cs.RO cs.AI 新提交 70%

Guava: An Effective and Universal Harness for Embodied Manipulation

Guava: 一种有效且通用的具身操作工具框架

Haowen Liu, Xirui Li, Shaoxiong Yao, Peng Shi, Tianyi Zhou, Jia-Bin Huang, Furong Huang, Jiayuan Mao

机构 * University of Maryland College Park(马里兰大学帕克分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Waterloo(滑铁卢大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Pennsylvania(宾夕法尼亚大学) Amazon FAR(亚马逊 FAR)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出Guava框架,通过迭代感知-推理-行动循环、语义动作抽象和多模态观测三大关键设计,将具身操作能力蒸馏到4B开源模型中,在仿真和真实环境中性能媲美前沿专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21720 2026-06-18 cs.AI 版本更新 70%

PosterForest: Hierarchical Multi-Agent Collaboration for Scientific Poster Generation

PosterForest: 用于科学海报生成的分层多智能体协作

Jiho Choi, Seojeong Park, Seongjong Song, Hyunjung Shim

机构 * Graduate School of Artificial Intelligence, KAIST(韩国釜山国立大学人工智能研究生院) School of Integrated Technology, Yonsei University(延世大学整合技术学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出PosterForest,一种无需训练的科学海报生成框架,通过Poster Tree分层表示文档结构,并利用内容与布局智能体进行分层推理与递归优化,实现内容与布局的联合优化,提升语义连贯性、逻辑流畅性和视觉平衡。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17924 2026-06-17 cs.RO cs.AI 新提交 70%

PearlVLA: Progressive Embodied Action-Plan Refinement in Latent Space

PearlVLA:潜在空间中的渐进式具身动作计划精炼

Bochen Yang, Lianlei Shan

机构 * Imperial College London(帝国理工学院) Tsinghua University(清华大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出PearlVLA框架,通过在VLM潜在空间中进行迭代计划精炼,平衡动作生成效率与显式推理,在LIBERO基准上达到最先进性能。

Comments 21 pages, 2 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16576 2026-06-16 cs.CL 新提交 70%

Can LLM Agents Infer World Models? Evidence from Agentic Automata Learning

LLM智能体能否推断世界模型?来自智能体自动机学习的证据

Reef Menaged, Gili Lior, Shauli Ravfogel, Roee Aharoni, Gabriel Stanovsky

机构 * The Hebrew University of Jerusalem(海法大学) New York University(纽约大学) Google Research(谷歌研究)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 提出智能体自动机学习框架,通过成员查询和等价查询评估LLM智能体发现隐藏确定性有限自动机的能力,发现性能随DFA规模增加而急剧下降,推理模型优于非推理模型但仍存在规划、整合和假设构建缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15032 2026-06-16 cs.LG 新提交 70%

How Should World Models Be Evaluated for Embodied Decision-Making? A Decision-Making-Centric Position

世界模型应如何评估?一个以决策为中心的立场

Yang Yu, Shiyuan Zhang, Yifei Sheng, Haoxiang Ren, Haoxin Lin

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Cirquar Technologies

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 本文指出世界模型评估中声明与证据不匹配的问题,提出以决策为中心的评估框架,强调反事实推理、策略优化等能力,并定义L0-L7评估阶梯。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14790 2026-06-16 cs.PL cs.AI 新提交 70%

XFlow: An Executable Protocol Programming System for Reliable Multi-Agent Workflows

XFlow: 一个用于可靠多智能体工作流的可执行协议编程系统

Hanqi Li, Jing Peng, Zijian Wang, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(X-LANCE实验室,计算机科学学院,上海交通大学,上海,中国) Jiangsu Key Lab of Language Computing, Suzhou, China(江苏省语言计算重点实验室,苏州,中国) Suzhou Laboratory, Suzhou, China(苏州实验室,苏州,中国)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出XFlow可执行协议编程系统及其领域特定语言XPF,通过将工作流承诺从提示移至可检查、可执行的协议结构,并利用生命周期管理的符号中介智能体输出,提升多智能体工作流的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05963 2026-06-16 cs.LG 版本更新 70%

Next-Latent Prediction Transformers Learn Compact World Models

下一潜在预测变换器学习紧凑世界模型

Jayden Teoh, Manan Tomar, Kwangjun Ahn, Edward S. Hu, Tim Pearce, Pratyusha Sharma, Akshay Krishnamurthy, Riashat Islam, Alex Lamb, John Langford

机构 * Massachusetts Institute of Technology(麻省理工学院) Microsoft Research(微软研究院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 提出NextLat方法,通过潜在空间中的自监督预测训练变换器学习紧凑世界模型,提升泛化能力和推理效率。

Comments Microsoft Research Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21714 2026-06-16 cs.AI 版本更新 70%

E-mem: Multi-agent based Episodic Context Reconstruction for LLM Agent Memory

E-mem:基于多智能体的事件上下文重建用于LLM智能体记忆

Kaixiang Wang, Yidan Lin, Jiong Lou, Zhaojiacheng Zhou, Bunyod Suvonov, Jie Li

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 E-mem通过多智能体协同重建事件上下文,提升LLM在长时序任务中的推理能力,实现54%的F1分数,优于现有方法7.75%,并降低70%的token成本。

Comments This paper has been accepted by ICML 2026. If you find our project helpful, please consider giving it a star: https://github.com/dog-last/E-mem

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13643 2026-06-12 cs.CL 新提交 70%

Recursive Agent Harnesses

递归智能体框架

Elias Lumer, Sahil Sen, Kevin Paul, Vamse Kumar Subbiah

机构 * PricewaterhouseCoopers, U.S.(普华永道(美国))

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 提出递归智能体框架(RAH),通过代码优先的框架递归扩展模型递归,在长上下文推理中显著提升编码智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13211 2026-06-12 cs.AI 新提交 70%

Hallucination in Medical Imaging AI: A Cross-Modality Analytical Framework for Taxonomy, Detection, and Mitigation under Regulatory Constraints

医学影像AI中的幻觉:跨模态分析框架用于分类、检测与监管约束下的缓解

Omar Alshahrani, Muzammil Behzad

机构 * King Fahd University of Petroleum & Minerals, Saudi Arabia(沙特阿拉伯法赫德国王石油矿产大学) SDAIA-KFUPM Joint Research Center for Artificial Intelligence, Saudi Arabia(沙特阿拉伯SDAIA-KFUPM人工智能联合研究中心)

专题命中 规划推理 :chain-of-thought(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出跨模态分析框架,统一五种影像模态的幻觉分类、检测与缓解策略,发现通用基础模型在幻觉基准上优于医学专用模型,并映射到FDA全生命周期监管。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12783 2026-06-12 cs.AI 新提交 70%

A Tutorial on World Models and Physical AI

世界模型与物理AI教程

Il-Seok Oh

机构 * Department of Computer Science and Artificial Intelligence/CAIIT, Jeonju, Jeonbuk, South Korea(韩国全北全州计算机科学与人工智能系/CAIIT)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出统一框架,区分显式与隐式世界模型,并探讨其在机器人、自动驾驶等物理AI领域的应用,以及迈向通用人工智能的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11560 2026-06-11 cs.DB cs.AI 新提交 70%

LLMs+Graphs: Toward Graph-Native, Synergistic AI Systems

LLMs+Graphs:迈向图原生的协同人工智能系统

Arijit Khan, Longxu Sun, Xin Huang

机构 * Bowling Green State University(伯灵顿绿色州立大学) Hong Kong Baptist University(香港 Baptist大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文综述了大语言模型与图计算的三种协同方式,包括增强推理、知识图谱双向集成及图算法增强的AI代理,并探讨了图数据管理与图机器学习的新能力,旨在为构建下一代图原生AI系统提供统一视角。

Comments 10 pages, Accepted at PAKDD 2066 Tutorial

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07538 2026-06-09 cs.IR cs.AI 新提交 70%

Bidirectional Semantic Complementary Tool Retrieval for Remote Sensing Agents

面向遥感智能体的双向语义互补工具检索

Zeyuan Wang, Dongyang Hou, Cheng Yang, Xuezhi Cui, Linrui Xu, Bo Yu, Gaozhi Zhou, Ziyu Li, Liangtian Liu, Kai Ouyang, Wang Guo, Lili Zhu, Chao Tao

机构 * School of Geosciences and Info-Physics, Central South University(地质科学与信息物理学院,中南大学) School of Mechanical and Electrical Engineering, Central South University(机械与电子工程学院,中南大学) Hunan Key Laboratory of Land Resources Evaluation and Utilization, Hunan Provincial Institute of Land and Resources Planning(湖南省国土资源评价与利用重点实验室,湖南省国土资源规划院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 针对遥感智能体工具检索中查询与文档语义不对称问题,提出双向语义互补方法:通过规划增强查询机制补充功能语义,利用动态工具依赖图注入上下文语义,显著提升复杂遥感任务工具检索精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06399 2026-06-09 cs.CL 版本更新 70%

CollabSim: A CSCW-Grounded Methodology for Investigating Collaborative Competence of LLM Agents through Controlled Multi-Agent Experiments

CollabSim: 一种基于CSCW的方法,通过受控多智能体实验研究LLM智能体的协作能力

Jiaju Chen, Bo Sun, Yuxuan Lu, Yun Wang, Dakuo Wang, Bingsheng Yao

机构 * Northeastern University(东北大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 提出CollabSim框架,结合CSCW理论定义协作能力、控制交互条件并探测智能体内部状态,以系统分析LLM多智能体系统的协作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26179 2026-06-05 cond-mat.mtrl-sci cs.AI cs.CE 70%

AutoDFT: A Closed-Loop Multi-Agent Framework for Autonomous DFT Calculations

AutoDFT:用于自主DFT计算的闭环多智能体框架

Penghui Yang, Zhonghan Zhang, Yue Li, Xinrun Wang, Yanchen Deng, Yuhao Lu, Bijun Tang, Zheng Liu, Bo An

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Singapore Management University(新加坡管理大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出AutoDFT闭环多智能体框架,通过将LLM推理嵌入DFT计算全生命周期,实现从规划到执行的自主适应,在VASPBench基准上达到94.1%任务成功率,并可靠预测电子、磁性和能量性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21288 2026-06-05 cs.AI cs.CV 70%

Drive-KD: Multi-Teacher Distillation for VLMs in Autonomous Driving

Drive-KD:自动驾驶中用于视觉语言模型的多教师知识蒸馏

Weitong Lian, Zecong Tang, Haoran Li, Tianjian Gao, Yifei Wang, Zixu Wang, Lingyi Meng, Tengju Ru, Zhejun Cui, Yichen Zhu, Hangshuo Cao, Qi Kang, Tianxing Chen, Kaixuan Wang, Yu Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出Drive-KD框架,通过将自动驾驶分解为感知-推理-规划三元组,并利用知识蒸馏转移能力,构建了专用教师模型,并通过异构梯度投影缓解跨能力梯度冲突,验证了方法在不同模型家族和规模上的泛化能力,展示了蒸馏模型在自动驾驶任务中的优越性能。

Comments Preprint. 23 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05112 2026-06-04 cs.CL 70%

Evaluating Large Language Models in Dynamic Clinical Decision-Making with Standardized Patient Cases

评估大型语言模型在标准化病人案例中的动态临床决策能力

Cheng Liang, Pengcheng Qiu, Ya Zhang, Yanfeng Wang, Chaoyi Wu, Weidi Xie

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 规划推理 :planning(abstract);test-time compute(abstract);分类 cs.CL

AI总结 本文提出MedSP1000基准,通过标准化病人案例模拟动态临床交互,评估LLM在信息收集、治疗计划和长期管理中的表现,发现当前模型在过程级评估中远未达到临床安全标准。

详情

展开后加载摘要…

URL PDF HTML 收藏