arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11076 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11076 篇

2510.19268 2026-04-16 cs.RO cs.LG 70%

Hierarchical DLO Routing with Reinforcement Learning and In-Context Vision-language Models

基于强化学习和上下文视觉-语言模型的分层DLO路由

Mingen Li, Houjian Yu, Yixuan Huang, Youngjin Hong, Hantao Ye, Changhyun Choi

机构 * Department of Electrical and Computer Engineering, University of Minnesota(明尼苏达大学电气与计算机工程系) Princeton University(普林斯顿大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出了一种自主分层框架,利用视觉-语言模型进行上下文高层推理,结合强化学习训练的低层技能,解决长视距DLO路由任务,实现92%的成功率。

Comments 8 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13757 2026-04-16 cs.AI cs.HC 70%

Rethinking AI Hardware: A Three-Layer Cognitive Architecture for Autonomous Agents

重新思考人工智能硬件:一种三层认知架构用于自主代理

Li Chen

机构 * LI CHEN(李晨)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出Tri-Spirit架构,通过分解智能为规划、推理和执行三层,提升自主系统效率,实验显示任务延迟和能耗降低显著。

Comments A system architecture paper with simulation-based evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11540 2026-04-14 cs.AI 70%

A collaborative agent with two lightweight synergistic models for autonomous crystal materials research

一种用于自主晶体材料研究的双轻量协同模型协作代理

Tongyu Shi, Yutang Li, Zhanyuan Li, Qian Liu, Jie Zhou, Wenhe Xu, Yang Li, Dawei Dai, Rui He, Wenhua Zhou, Jiahong Wang, Xue-Feng Yu

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) Institute for Advanced Study, Chengdu University(成都大学高等研究院) Key Laboratory of Cyberspace Big Data Intelligent Security, Ministry of Education, Chongqing University of Posts and Telecommunications(重庆邮电大学教育部网络空间大数据智能安全重点实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出MatBrain,一种轻量级协作代理系统,通过双协同模型提升材料研究效率,显著优于大模型,减少硬件部署成本,并在催化剂设计中实现100倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11041 2026-04-14 cs.AI 70%

From Topology to Trajectory: LLM-Driven World Models For Supply Chain Resilience

从拓扑到轨迹:LLM驱动的世界模型用于供应链韧性

Jia Luo

机构 * Huazhong University and Science and Technology(华中科技大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出ReflectiChain框架,通过生成世界模型和回顾代理强化学习,提升供应链韧性,实验显示在极端场景下性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09596 2026-04-14 cs.AI cs.MA 70%

DERM-3R: A Resource-Efficient Multimodal Agents Framework for Dermatologic Diagnosis and Treatment in Real-World Clinical Settings

DERM-3R:一种资源高效的多模态代理框架,用于皮肤病诊断和治疗的现实世界临床应用

Ziwen Chen, Zhendong Wang, Chongjing Wang, Yurui Dong, Luozhijie Jin, Jihao Gu, Kui Chen, Jiaxi Yang, Bingjie Lu, Zhou Zhang, Jirui Dai, Changyong Luo, Xiameng Gai, Haibing Lan, Zhi Liu

机构 * School of Pharmacy, Nanjing University of Chinese Medicine(南京中医药大学药学院) Department of Dermatology, the Gulou Hospital of Traditional Chinese Medicine of Beijing(北京鼓楼中医医院皮肤科) Infectious disease department, Dongfang Hospital, Beijing University of Chinese Medicine(北京中医药大学东方医院感染科) College of Art and Science, university of Washington(华盛顿大学文理学院) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Fudan Unversity(复旦大学) Zhejiang Lab(之江实验室) University College London(伦敦大学学院) Department of Dermatology, Inner Mongolia Hospital of Traditional Chinese Medicine(内蒙古自治区中医医院皮肤科) International Campus of Zhejiang University(浙江大学国际校区)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出DERM-3R框架,通过三个协作代理解决皮肤病诊断中的细粒度病变识别、多视角病变表示和综合推理问题,展示了其在资源受限下的高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08719 2026-04-13 cs.CV cs.AI cs.RO 70%

LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving

LMGenDrive: 联合多模态理解与生成世界建模以实现端到端驾驶

Hao Shao, Letian Wang, Yang Zhou, Yuxuan Hu, Zhuofan Zong, Steven L. Waslander, Wei Zhan, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) University of Toronto(多伦多大学) UC Berkeley(加州大学伯克利分校)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出LMGenDrive框架,结合LLM多模态理解与生成世界模型,提升自动驾驶的闭环性能,通过视频预测和控制信号生成,增强时空场景建模和指令遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08033 2026-04-10 cs.AI cs.MA cs.NI 70%

IoT-Brain: Grounding LLMs for Semantic-Spatial Sensor Scheduling

IoT-Brain:为语义-空间传感器调度 grounding LLMs

Zhaomeng Zhou, Lan Zhang, Junyang Wang, Mu Yuan, Junda Lin, Jinke Song

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出IoT-Brain系统,通过引入空间轨迹图(STG)解决LLM在语义-空间传感器调度中的表示、推理和优化缺陷,提升任务成功率37.6%并显著降低资源消耗。

Comments To appear in ACM MobiCom 2026; 13 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08296 2026-04-10 cs.AI 70%

Towards a Science of Scaling Agent Systems

迈向代理系统的科学:扩展性研究

Yubin Kim, Ken Gu, Chanwoo Park, Chunjong Park, Samuel Schmidgall, A. Ali Heydari, Yao Yan, Zhihan Zhang, Yuchen Zhuang, Yun Liu, Mark Malhotra, Paul Pu Liang, Hae Won Park, Yuzhe Yang, Xuhai Xu, Yilun Du, Shwetak Patel, Tim Althoff, Daniel McDuff, Xin Liu

机构 * Google Research(谷歌研究院) Massachusetts Institute of Technology(麻省理工学院) Google DeepMind(谷歌DeepMind)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文通过260种配置评估六种代理基准,探讨代理系统在扩展维度上的性能变化规律,揭示协调、模型能力与任务结构之间的关系,发现协作成功取决于协调与任务结构的匹配程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05529 2026-04-09 cs.AI cs.RO 70%

Before We Trust Them: Decision-Making Failures in Navigation of Foundation Models

在我们信任之前:基础模型导航决策中的失败

Jua Han, Jaeyoon Seo, Jungbin Min, Sieun Choi, Huichan Seo, Jihie Kim, Jean Oh

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究发现基础模型在导航任务中存在显著决策失败,需更细致评估以理解其局限性。

Comments Corrected author order in metadata; manuscript changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16150 2026-04-09 cs.AI cs.HC cs.SY eess.SY 70%

A Comprehensive Survey of Agents for Computer Use: Foundations, Challenges, and Future Directions

用于计算机的代理全面综述:基础、挑战与未来方向

Pascal J. Sager, Benjamin Meyer, Peng Yan, Rebekka von Wartburg-Kottler, Layan Etaiwi, Aref Enayati, Gabriel Nobel, Ahmed Abdulkadir, Benjamin F. Grewe, Thilo Stadelmann

机构 * Zurich University of Applied Sciences(苏黎世应用科技大学) University of Zurich(苏黎世大学) ETH AI Center(苏黎世联邦理工学院人工智能中心) University of Fribourg(弗里堡大学) European Centre for Living Technology(欧洲生活技术中心)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文综述了用于计算机的代理(ACUs)的发展现状、趋势及研究空白,提出统一的分类体系,分析了六个主要研究缺口,并提出改进方向。

Journal ref Journal of Artificial Intelligence Research, vol. 85, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22653 2026-04-08 cs.AI 70%

URSA: The Universal Research and Scientific Agent

URSA:通用研究与科学代理

Michael Grosskopf, Nathan Debardeleben, Russell Bent, Rahul Somasundaram, Isaac Michaud, Arthur Lui, Alexius Wadell, Warren D. Graham, Golo A Wimmer, Sachin Shivakumar, Joan Vendrell Gallart, Harsha Nagarajan, Earl Lawrence

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 URSA通过模块化代理和工具加速科研任务,结合先进物理模拟代码,解决复杂科学问题,展现系统潜力。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03631 2026-04-07 cs.AI 70%

Single-agent vs. Multi-agents for Automated Video Analysis of On-Screen Collaborative Learning Behaviors

单 agent 与多 agent 在自动视频分析上的协作学习行为研究

Likai Peng, Shihui Feng

机构 * Faculty of Education, The University of Hong Kong(香港大学教育学院) Institute of Data Science, The University of Hong Kong(香港大学数据科学研究所)

专题命中 规划推理 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 本文比较了单 agent 和多 agent 框架在自动编码协作学习场景视频中的性能,提出两种多 agent 方法,分别在场景检测和动作检测任务中表现优异。

Comments 15 pages, 4 figures. To be published in the 27th International Conference on Artificial Intelligence in Education (AIED2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01202 2026-04-06 cs.AI 70%

Therefore I am. I Think

因此我存在。我认为

Esakkivel Esakkiraja, Sai Rajeswar, Denis Akhiyarov, Rajagopal Venkatesaramani

机构 * Mila, ServiceNow Research(米拉研究所,ServiceNow研究院) ServiceNow(ServiceNow公司)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文探讨了大语言推理模型在做决定时是先思考后决定还是先决定后思考的问题,通过证据表明早期编码的决策影响推理链,展示了一个简单线性探针能从预生成激活中高精度解码工具调用决策,甚至在生成首个推理标记前。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01594 2026-04-03 cs.AI 70%

Do Large Language Models Mentalize When They Teach?

大型语言模型在教学时是否具备心智化能力?

Sevan K. Harootonian, Mark K. Ho, Thomas L. Griffiths, Yael Niv, Ilia Sucholutsky

机构 * Princeton University(普林斯顿大学) New York University(纽约大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究通过控制任务探讨LLM教学决策机制,发现LLM在教学策略上与人类相似,但Bayes-Optimal模型最佳解释其选择,提示提示合规性不等于教学效果提升。

Comments 9 pages, 5 figures. Workshop paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01020 2026-04-02 cs.MA cs.AI 70%

OrgAgent: Organize Your Multi-Agent System like a Company

OrgAgent: 以公司式层级结构组织你的多智能体系统

Yiru Wang, Xinyue Shen, Yaohui Han, Michael Backes, Pin-Yu Chen, Tsung-Yi Ho

机构 * The Chinese University of Hong Kong(香港中文大学) IBM Research(IBM研究院) CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出OrgAgent框架,通过治理、执行、合规三层结构提升多智能体系统的推理性能,实验显示层级结构在任务稳定性、信息控制和验证方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00186 2026-04-02 eess.SY cs.AI cs.CY cs.SY econ.GN q-fin.EC stat.AP 70%

Agentic AI and Occupational Displacement: A Multi-Regional Task Exposure Analysis of Emerging Labor Market Disruption

代理AI与职业替代:新兴劳动力市场破坏的多地区任务暴露分析

Ravish Gupta, Saket Kumar

机构 * BigCommerce University at Buffalo, The State University of New York(纽约州立大学布法罗分校)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文扩展了Acemoglu-Restrepo的任务暴露框架,分析代理AI系统对劳动力市场的影响,提出Agentic Task Exposure(ATE)评分,揭示职业替代风险及新兴职业领域。

Comments 26 pages, 2 figures, 6 tables. Submitted to IMF-OECD-PIIE-World Bank Conference on Labor Markets and Structural Transformation 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02976 2026-04-02 cs.AI 70%

Teaching AI to Handle Exceptions: Supervised Fine-Tuning with Human-Aligned Judgment

教AI处理例外:基于人类对齐判断的监督微调

Matthew DosSantos DiSorbo, Harang Ju, Sinan Aral

机构 * Harvard Business School(哈佛商学院) Johns Hopkins University(约翰霍普金斯大学) MIT Sloan School of Management(麻省理工学院斯隆管理学院)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究探讨了如何通过监督微调使AI处理例外,发现使用人类解释的微调能显著提升模型决策能力,揭示了对齐人类判断需明确训练决策过程而非仅决策结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30022 2026-04-01 cs.RO cs.AI 70%

Hybrid Framework for Robotic Manipulation: Integrating Reinforcement Learning and Large Language Models

机器人操作的混合框架:整合强化学习与大语言模型

Md Saad, Sajjad Hussain, Mohd Suhaib

机构 * Jamia Millia Islamia(贾米亚米利亚伊斯兰大学) University of Brighton(布莱顿大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一种结合强化学习与大语言模型的混合框架,用于提升机器人操作任务。通过强化学习实现精确的低层控制,利用大语言模型进行高层任务规划和自然语言理解,有效连接低层执行与高层推理。实验显示任务完成时间减少33.5%,精度和适应性提升18.1%和36.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29755 2026-04-01 cs.AI 70%

CausalPulse: An Industrial-Grade Neurosymbolic Multi-Agent Copilot for Causal Diagnostics in Smart Manufacturing

CausalPulse:一种工业级神经符号多智能体协作者,用于智能制造中的因果诊断

Chathurangi Shyalika, Utkarshani Jaimini, Cory Henson, Amit Sheth

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 CausalPulse通过神经符号架构整合异常检测、因果发现和推理,实现智能制造中的因果诊断,展现高可靠性和可扩展性。

Comments 10 pages, 8 figures, 4 tables, Accepted at AAAI-MAKE 2026 (AAAI Spring Symposium on Machine Learning and Knowledge Engineering for Knowledge-Grounded Semantic Agents)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15109 2026-03-31 cs.SI cs.AI cs.CY cs.HC cs.MA 70%

An Agentic Operationalization of DISARM for FIMI Investigation on Social Media

针对FIMI调查的社会媒体的代理操作化DISARM

Kevin Tseng, Juan Carlos Toledano, Bart De Clerck, Yuliia Dukach, Phil Tinn

机构 * Center of Research Acquisition National Institute of Cyber Security Taipei City, Taiwan Department of Mathematics Royal Military Academy Brussels, Belgium Research Division OpenMinds Ltd. Kyiv, Ukraine Department of Sustainable Communication Technologies SINTEF Oslo, Norway (Corresponding Author)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一种基于代理的DISARM操作化框架,用于社会媒体上的FIMI调查。通过整合通用代理AI组件,实现对社交媒体数据中操纵性行为的识别和映射,提升分析效率和可解释性。

Comments This paper was originally presented at the International Conference on Military Communication and Information Systems (ICMCIS), organized by the Information Systems Technology (IST) Scientific and Technical Committee, IST-224-RSY---the ICMCIS, held in Bath, United Kingdom, 12-13 May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27410 2026-03-31 q-bio.NC cs.AI cs.CV 70%

Grounding Social Perception in Intuitive Physics

将社会感知 grounded 在直观物理学中

Lance Ying, Aydan Y. Huang, Aviv Netanyahu, Andrei Barbu, Boris Katz, Joshua B. Tenenbaum, Tianmin Shu

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学) Johns Hopkins University(约翰霍普金斯大学) Amazon(亚马逊)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出通过结合直观心理学与直观物理学的推理过程来解释社会感知,通过PHASE数据集和SIMPLE模型验证了物理基础的社会推理能力。

Comments 26 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26458 2026-03-30 cs.SE cs.AI 70%

Can AI Models Direct Each Other? Organizational Structure as a Probe into Training Limitations

AI模型能否相互指导?组织结构作为训练限制的探测器

Rui Liu

机构 * Independent Researcher(独立研究员)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文研究AI模型通过ManagerWorker双agent流水线相互指导的有效性,发现强管理者指导弱工作者与单体强模型性能相近,但弱管理者指导弱工作者效果更差,揭示了多agent指导的潜力与限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12104 2026-03-27 cs.CR cs.AI 70%

DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents

DRIFT: 基于注入隔离的动态规则防御以保障LLM代理安全

Hao Li, Xiaogeng Liu, Hung-Chun Chiu, Dianqi Li, Ning Zhang, Chaowei Xiao

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Johns Hopkins University(约翰霍普金斯大学) Independent Researcher(独立研究者)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 DRIFT通过动态安全策略和注入隔离技术,有效防御LLM代理中的提示注入攻击,验证了其在多个基准测试中的高安全性和高实用性。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01853 2026-03-26 cs.CL 70%

Let the Agent Search: Autonomous Exploration Beats Rigid Workflows in Temporal Question Answering

让代理搜索:在时间问题回答中自主探索胜过固定工作流

Xufei Lv, Jiahui Yang, Haoyuan Sun, Xialin Su, Zhiliang Tian, Yifu Gao, Linbo Qiao, Houde Liu

机构 * National University of Defense Technology(国防科技大学) Tsinghua University(清华大学)

专题命中 规划推理 :reasoning(abstract);self-correction(abstract);分类 cs.CL

AI总结 本文提出AT2QA代理,通过自主探索和动态自我纠正提升时间知识图谱问题回答性能,实验表明其在三个基准测试中超越现有最佳基线。

Comments Revised version with three added authors and additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23271 2026-03-25 cs.RO cs.AI 70%

A Multimodal Framework for Human-Multi-Agent Interaction

人-多智能体交互的多模态框架

Shaid Hasan, Breenice Lee, Sujan Sarker, Tariq Iqbal

机构 * University of Virginia(弗吉尼亚大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一个多模态框架,用于人与多智能体交互,通过集成多模态感知和大语言模型驱动的规划,实现自主认知代理的协调决策,解决现有系统在统一框架下整合多模态感知、具身表达和协同决策的难题。

Comments 4 pages, 3 figures. Accepted at ACM/IEEE HRI 2026 Workshop (MAgicS-HRI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21523 2026-03-24 cs.RO cs.AI 70%

SafePilot: A Framework for Assuring LLM-enabled Cyber-Physical Systems

SafePilot: 一种确保基于大语言模型的嵌入式物理系统框架

Weizhe Xu, Mengyu Liu, Fanxin Kong

机构 * University of Notre Dame(诺克斯维尔大学) Washington State University(华盛顿州立大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出SafePilot框架,通过层级神经符号方法确保基于大语言模型的嵌入式物理系统安全性,通过任务复杂度评估和分治策略,结合形式化验证提升任务规划可靠性。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15677 2026-03-24 cs.LG q-bio.QM 70%

CAMEL: An ECG Language Model for Forecasting Cardiac Events

CAMEL:一种用于预测心脏事件的ECG语言模型

Neelay Velingker, Alaia Solko-Breslin, Mayank Keoliya, Seewon Choi, Jiayi Xin, Anika Marathe, Alireza Oraii, Rajat Deo, Sameed Khatana, Rajeev Alur, Mayur Naik, Eric Wong

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 CAMEL是首个能处理长信号的ECG语言模型,通过专门的编码器实现ECG与文本的跨理解,展示了在六个任务和九个数据集上的强大零样本性能,包括新提出的ECGForecastBench基准测试。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20267 2026-03-24 cs.AI 70%

Domain-Specialized Tree of Thought through Plug-and-Play Predictors

通过即插即用预测器实现领域专用的树状思维

Xuanqi Gao, Haoyu Wang, Jun Sun, Shiqing Ma, Chao Shen

机构 * Xi'an Jiaotong University, China(西安交通大学) Singapore Management University, Singapore(新加坡管理学院) University of Massachusetts at Amherst, United States(马萨诸塞大学阿默斯特分校)

专题命中 规划推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出DST,一种轻量级监督启发式预测器,用于指导树状思维搜索过程,实现动态剪枝和适应性扩展,提升复杂推理的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19564 2026-03-23 cs.LG 70%

Wearable Foundation Models Should Go Beyond Static Encoders

可穿戴基础模型应超越静态编码器

Yu Yvonne Wu, Yuwei Zhang, Hyungjun Yoon, Ting Dang, Dimitris Spathis, Tong Xia, Qiang Yang, Jing Han, Dong Ma, Sung-Ju Lee, Cecilia Mascolo

机构 * Dartmouth College, USA(达特茅斯学院) University of Cambridge, UK(剑桥大学) The University of Melbourne, Australia(墨尔本大学) Google Research, UK(谷歌研究) Tsinghua University, China(清华大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出可穿戴基础模型需超越静态编码器,通过结构丰富数据、纵向感知多模态建模和代理推理系统实现连续性健康支持。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08794 2026-03-20 cs.AI 70%

LLM-Based World Models Can Make Decisions Solely, But Rigorous Evaluations are Needed

基于LLM的世界模型可以独立做出决策,但需要严谨的评估

Chang Yang, Xinrun Wang, Junzhe Jiang, Qinggang Zhang, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) Singapore Management University(新加坡国立大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文从决策视角出发,对基于LLM的世界模型进行综合评估,设计了政策验证、行动提案和政策规划三项任务,评估了GPT-4o和GPT-4o-mini在不同环境中的表现,发现LLM世界模型在长期决策任务中性能下降,且不同功能组合会引入额外的不稳定性。

Comments Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏