arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11076 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11076 篇

2605.06869 2026-05-14 cs.AI 70%

Agentick: A Unified Benchmark for General Sequential Decision-Making Agents

Agentick: 一个统一的连续决策制定代理基准测试

Roger Creus Castanyer, Pablo Samuel Castro, Glen Berseth

机构 * Mila Quebec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) Google DeepMind(谷歌DeepMind)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 Agentick是一个统一的连续决策制定代理基准测试,评估RL、LLM、VLM等代理在共同基础上的表现,揭示各方法的不足,为通用自主代理研究提供实验基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02600 2026-05-13 cs.RO cs.AI 70%

CoRAL: Contact-Rich Adaptive LLM-based Control for Robotic Manipulation

CoRAL:富含接触的自适应LLM基于控制用于机械臂操作

Berk Çiçek, Mert K. Er, Ozgur S. Oguz

机构 * LiRA Lab, Department of Computer Engineering Bilkent University(LiRA实验室,计算机工程系,比尔肯特大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 CoRAL通过解耦高层推理与低层控制,利用LLM设计成本函数,结合神经符号适应循环和记忆单元,实现接触密集任务的自适应控制,提升成功率50%以上。

Comments 22 pages, 9 figures, 3 tables. Accepted to Robotics: Science and Systems (RSS) 2026. Updated to camera-ready version with appendix and text/formatting revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09384 2026-05-12 cs.CV cs.AI q-bio.QM 70%

LiteMedCoT-VL: Parameter-Efficient Adaptation for Medical Visual Question Answering

LiteMedCoT-VL: 用于医疗视觉问答的参数高效适应

Runze Ma, Shunbo Jia, Haonan Lyu, Guo Liu, Caizhi Liao

机构 * School of Information Technology(信息科技学院) Monash University Malaysia(墨尔本大学马来西亚分校) Faculty of Innovation Engineering(创新工程学院) Macau University of Science and Technology(澳门科学技术大学) Department of Bioelectronics(生物电子系) Faculty of Biomedical Engineering(生物医学工程学院) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出LiteMedCoT-VL,通过LoRA微调将大模型的推理过程转移到小模型,实现医疗视觉问答的高效部署,实验显示2B模型在准确率上超越4B模型。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14125 2026-05-12 cs.CV cs.AI cs.RO 70%

HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System

HiVLA:一种以视觉为基础的分层具身操作系统

Tianshuo Yang, Guanyu Chen, Yutian Chen, Zhixuan Liang, Yitian Liu, Zanxin Chen, Chunpu Xu, Haotian Liang, Jiangmiao Pang, Yao Mu, Ping Luo

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 HiVLA提出一种分层框架,将高层语义规划与底层动作控制解耦,通过视觉 grounding 和 Diffusion Transformer 专家提升机器人操作能力,实验证明其在长时序技能组合和精细操作中表现优异。

Comments Project Page: https://tianshuoy.github.io/HiVLA-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14022 2026-05-12 cs.RO cs.AI 70%

Language Conditioned Multi-Finger Dexterous Manipulation Enabled by Physical Compliance and Switching of Controllers

通过物理合规性和控制器切换实现语言条件下的多指灵巧操作

Cheng Pan, Kai Junge, Benhui Dai, Qinghua Guan, Josie Hughes

机构 * Embodied AI(具身人工智能)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一种结合高层视觉语言动作模型与小型控制模型的切换控制器,通过事件驱动机制实现多指灵巧操作的鲁棒控制,验证了硬件级合规性在提升接触稳定性方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08774 2026-05-12 cs.RO cs.LG 70%

ProcVLM: Learning Procedure-Grounded Progress Rewards for Robotic Manipulation

ProcVLM:基于学习的程序导向进度奖励用于机器人操作

Youhe Feng, Hansen Shi, Haoyang Li, Xinlei Guo, Yang Wang, Chengyang Zhang, Jinkai Zhang, Xiaohan Zhang, Jie Tang, Jing Zhang

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Zhipu AI(智谱AI) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 ProcVLM通过程序结构和阶段内视觉变化学习密集的进度奖励,提升机器人操作的程序推理能力,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01532 2026-05-12 cs.AI 70%

PHMForge: Evaluating LLM Agents on Industrial Prognostics through MCP-Native, Algorithm-Grounded Tools

PHMForge:通过MCP原生、算法基础的工具评估LLM代理在工业预测维护中的表现

Tianjun Feng, Yunfeng Chen, Chun-Yi Tsai, Yihan Sun, Ayan Das, Kaoutar El Maghraoui, Shuxin Lin, Dhaval Patel

机构 * Columbia University(哥伦比亚大学) Georgia Institute of Technology(佐治亚理工学院) IBM, New York(IBM,纽约)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 PHMForge通过MCP原生工具评估LLM代理在工业预测维护中的可靠性,揭示了静态检索在预测计算中的局限性,展示了不同框架和模型的表现差异。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08019 2026-05-11 cs.AI q-bio.NC 70%

Reason to Play: Behavioral and Brain Alignment Between Frontier LRMs and Human Game Learners

玩乐的动机:前沿LRMs与人类游戏学习者的行为与大脑对齐

Botos Csaba, Sreejan Kumar, Austin Tudor David Andrews, Laurence Hunt, Chris Summerfield, Joshua B. Tenenbaum, Rui Ponte Costa, Marcelo G. Mattar, Momchil Tomov

机构 * University of Oxford(牛津大学) Columbia University(哥伦比亚大学) New York University(纽约大学) Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文研究了前沿LRMs在游戏学习中的行为与大脑活动对齐情况,发现其在游戏发现阶段更接近人类行为,并能更准确预测大脑活动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00568 2026-05-11 cs.CL 70%

ReSeek: A Self-Correcting Framework for Search Agents with Instructive Rewards

ReSeek:一种具有指导性奖励的自我纠正搜索代理框架

Shiyu Li, Yang Tang, Yifan Wang, Peiming Li, Xi Chen

机构 * Basic Algorithm Center, PCG, Tencent, Shenzhen, China(腾讯基本算法中心、PCG、腾讯,深圳,中国) Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生学院,清华大学,深圳,中国)

专题命中 规划推理 :reasoning(abstract);self-correction(abstract);分类 cs.CL

AI总结 本文提出ReSeek框架,通过引入自我纠正机制和密集指导性奖励函数,提升搜索代理在复杂任务中的表现和路径忠实度。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01299 2026-05-05 cs.LG 70%

GA-VisAgent: A Multi-Agent application for code generation and visualization in interactive learning

GA-VisAgent:一种用于交互式学习中代码生成和可视化的多智能体应用

Wang Jian, Zhou Jianbo, Xiong Yuhao, Liu Zhenxia, Luo Wen, Yuan LinWang, Yu ZhaoYuan

机构 * School of Geography, Nanjing Normal University, Nanjing 210023, Jiangsu, China(地理学院,南京师范大学) School of Environment, Nanjing Normal University, Nanjing 210023, Jiangsu, China(环境学院,南京师范大学) Key Laboratory of Virtual Geographic Environment, Ministry of Education, Nanjing Normal University, Nanjing 210023, Jiangsu, China(虚拟地理环境重点实验室,南京师范大学) Jiangsu Center for Collaborative Innovation in Geographical Information Resource Development(江苏省地理信息资源开发与应用协同创新中心)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 GA-VisAgent基于GAGPT提出多智能体应用,通过任务规划和ReAct策略生成代码并提供可视化,实验显示在40个典型Conformal GA任务中代码生成成功率达90%,比GPT-4o提升70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25602 2026-04-30 cs.AI 70%

OxyGent: Making Multi-Agent Systems Modular, Observable, and Evolvable via Oxy Abstraction

OxyGent:通过Oxy抽象使多智能体系统模块化、可观察和可进化

Junxing Hu, Tianlong Li, Lei Yu, Ai Han

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 OxyGent通过Oxy抽象和OxyBank引擎,实现多智能体系统的模块化、可观察性和可进化性,通过统一抽象和动态规划提升可扩展性和可观测性,实验证明其在复杂工业环境中的鲁棒性和可扩展性。

Comments 10 pages, 10 figures, ACL 2026 System Demonstration track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26630 2026-04-30 cs.CL 70%

SAGE: A Strategy-Aware Graph-Enhanced Generation Framework For Online Counseling

SAGE:一种面向在线咨询的策略感知图增强生成框架

Eliya Naomi Aharon, Meytal Grimland, Avi Segal, Loona Ben Dayan, Inbar Shenfeld, Yossi Levi Belz, Kobi Gal

机构 * Ben-Gurion University of the Negev(贝叶特·沙瓦大学) University of Haifa(海法大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 SAGE通过整合心理框架和实时压力信号,提升在线咨询的策略预测与响应质量,为高风险危机咨询提供决策支持工具。

Comments Full version of the work accepted as a short paper at the 34th ACM Conference on User Modeling, Adaptation and Personalization (UMAP '26). 9 pages, 4 figures, 5 tables

Journal ref Proceedings of the 34th ACM Conference on User Modeling, Adaptation and Personalization (UMAP '26), June 08--11, 2026, Gothenburg, Sweden

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23605 2026-04-28 cs.AI 70%

Thinking Like a Clinician: A Cognitive AI Agent for Clinical Diagnosis via Panoramic Profiling and Adversarial Debate

像医生一样思考:一种通过全景分析与对抗辩论的临床诊断认知AI代理

Zhiqi Lv, Duofan Tu, Jun Li, Mingyue Zhao, Heqin Zhu, Wenliang Li, Shaohua Kevin Zhou

机构 * School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学生物医学工程学院,生命科学与医学系) Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州市先进研究机构) Key Lab of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS(中国科学院智能信息处理重点实验室,计算技术研究所) Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology(江苏省多模态数字孪生技术省级重点实验室) State Key Laboratory of Precision and Intelligent Chemistry, USTC(国家精密与智能化学重点实验室,中国科学技术大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出DxChain框架,通过全景患者基线建立和对抗辩论解决证据冲突,提升临床诊断准确性和逻辑一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20324 2026-04-28 cs.CL 70%

Can Compact Language Models Search Like Agents? Distillation-Guided Policy Optimization for Preserving Agentic RAG Capabilities

紧凑语言模型能否像智能体一样搜索?基于知识增强的策略优化以保持智能体RAG能力

Rikuto Kotoge, Mai Nishimura, Jiaxin Ma

机构 * The University of Osaka(大阪大学) OMRON SINIC X Corporation(OMRON SINIC X公司)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 本文提出Distillation-Guided Policy Optimization方法,通过教师示范初始化和持续教师指导,使紧凑模型实现复杂的智能体搜索行为,甚至在某些情况下超越大模型。

Comments Accepted at ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22266 2026-04-27 cs.CL 70%

Large Language Models Decide Early and Explain Later

大语言模型早决策晚解释

Ayan Datta, Zhixue Zhao, Bhuvanesh Verma, Radhika Mamidi, Mounika Marreddy, Alexander Mehler

机构 * University of Sheffield, UK(谢菲尔德大学,英国) Goethe University, Frankfurt am Main, Germany(法兰克福歌德大学,德国)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 研究发现大语言模型在生成过程中,只有32%的查询在中间阶段改变最终答案,且稳定后生成额外760个推理token。通过早停策略可减少500个token使用,仅导致2%的准确率下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22256 2026-04-27 cs.SC cs.AI 70%

A Probabilistic Framework for Hierarchical Goal Recognition

基于概率的层次目标识别框架

Chenyuan Zhang, Katherine Ip, Hamid Rezatofighi, Buser Say, Mor Vered

机构 * Monash University(蒙纳士大学) The University of Melbourne(墨尔本大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出基于规划的概率框架,用于层次目标识别,结合层次任务网络结构与概率推理,提升目标识别性能。

Comments Accepted by KR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22199 2026-04-27 cs.RO cs.AI 70%

An LLM-Driven Closed-Loop Autonomous Learning Framework for Robots Facing Uncovered Tasks in Open Environments

基于大语言模型的闭环自主学习框架:面向机器人在开放环境中处理未覆盖任务

Hong Su

机构 * School of Computer Science, Chengdu University of Information Technology(成都信息学院计算机学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一种基于大语言模型的闭环自主学习框架,使机器人在开放环境中自主处理未覆盖任务,通过闭环学习减少对大语言模型的依赖,提升任务执行效率和本地知识库的利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06498 2026-04-24 cs.CL astro-ph.IM 70%

Spec-o3: A Tool-Augmented Vision-Language Agent for Rare Celestial Object Candidate Vetting via Automated Spectral Inspection

Spec-o3:一种工具增强的视觉-语言代理,用于通过自动化光谱检查验证稀有天体候选体

Minghui Jia, Qichao Zhang, Ali Luo, Linjing Li, Shuo Ye, Hailing Lu, Wen Hou, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, CAS(SKL-MAIS,自动化研究所,中国科学院) School of Advanced Interdisciplinary Sciences, UCAS(交叉科学学院,中国科学院大学) National Astronomical Observatories, CAS(国家天文台,中国科学院) School of Artificial Intelligence, UCAS(人工智能学院,中国科学院大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出Spec-o3,一种工具增强的视觉-语言代理,通过多模态链式推理实现天文学家对稀有天体候选体的自动化光谱检查,提升验证效率和准确性。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20146 2026-04-23 cs.IR cs.CL 70%

SAKE: Self-aware Knowledge Exploitation-Exploration for Grounded Multimodal Named Entity Recognition

SAKE: 为基于地面的多模态命名实体识别的自我意识知识利用-探索

Jielong Tang, Xujie Yuan, Jiayang Liu, Jianxing Yu, Xiao Dong, Lin Chen, Yunlai Teng, Shimin Di, Jian Yin

机构 * Sun Yat-sen University(中山大学) Shandong Normal University(山东师范大学) University of the Chinese Academy of Sciences(中国科学院大学) Southeast University(东南大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 针对开放世界社交媒体平台中长尾、快速演变和未见实体的挑战,SAKE提出一种端到端代理框架,通过自我意识推理和自适应搜索工具调用,结合内部知识利用和外部知识探索,提升多模态命名实体识别的精度与鲁棒性。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19839 2026-04-23 cs.CV cs.AI 70%

Environmental Understanding Vision-Language Model for Embodied Agent

面向具身智能体的环境理解视觉-语言模型

Jinsik Bang, Jaeyeon Bae, Donggyu Lee, Siyeol Jung, Taehwan Kim

机构 * UNIST(全南国立大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出EUEA框架,通过细调四项核心技能提升具身智能体的环境理解能力,结合恢复步骤和GRPO阶段提升任务执行效果,实验显示在ALFRED任务中性能显著优于行为克隆基线。

Comments CVPR Findings 2026, Project Page: https://eu-ea.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11037 2026-04-22 cs.AI 70%

BAPO: Boundary-Aware Policy Optimization for Reliable Agentic Search

BAPO:面向可靠代理搜索的边界感知策略优化

Shiyu Liu, Yongjing Yin, Jianhao Yan, Yunbo Tang, Qinggang Zhang, Bei Li, Xin Chen, Jingang Wang, Xunliang Cai, Jinsong Su

机构 * Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院) Meituan Inc.(美团公司) School of Informatics, Xiamen University(厦门大学信息学院) Westlake University(西湖大学) Jilin University(吉林大学) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism, China(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室(厦门大学),中华人民共和国文旅部,中国)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 BAPO通过引入边界感知奖励和自适应奖励调节器,提升代理搜索的可靠性,避免过度依赖IDK响应,实验表明其显著增强可靠性。

Comments ACL 2026 Conference. Code is available at https://github.com/Liushiyu-0709/BAPO-Reliable-Search

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17648 2026-04-21 cs.CL 70%

ThreadSumm: Summarization of Nested Discourse Threads Using Tree of Thoughts

ThreadSumm: 使用思维树进行嵌套讨论线的摘要

Olubusayo Olabisi, Ekata Mitra, Ameeta Agrawal

机构 * PortNLP Lab, Portland State University(波特兰州立大学PortNLP实验室) Department of Computer Science, Portland State University(波特兰州立大学计算机科学系)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 ThreadSumm通过多阶段LLM框架处理嵌套讨论线中的交错回复和引用,生成逻辑结构更清晰的摘要,同时提升观点覆盖和方面保留。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17405 2026-04-21 cs.AI 70%

STRIDE: Strategic Iterative Decision-Making for Retrieval-Augmented Multi-Hop Question Answering

STRIDE: 用于检索增强多跳问答的策略迭代决策

Wei Chen, Lili Zhao, Zhi Zheng, HuiJun Hou, Tong Xu

机构 * University of Science Technology of China \& State Key Laboratory of Cognitive Intelligence Hefei Anhui China Technology of China \& State Key Laboratory of Cognitive Intelligence

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 STRIDE通过分离战略规划、动态控制和 grounded 执行,解决多跳问答中实体早 Commit 和推理依赖缺失的问题,提升推理鲁棒性与准确性。

Comments Accepted by SIGIR 2026 Full Paper. The code repository is available at https://github.com/fanshu6hao/STRIDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16612 2026-04-21 cs.LG 70%

FedLLM: A Privacy-Preserving Federated Large Language Model for Explainable Traffic Flow Prediction

FedLLM: 一种用于可解释交通流预测的隐私保护联邦大语言模型

Seerat Kaur, Sukhjit Singh Sehra, Dariush Ebrahimi

机构 * Department of Physics & Computer Science, Wilfrid Laurier University, Waterloo, Canada(物理与计算机科学系,威尔弗里德·劳里尔大学,多伦多,加拿大)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 FedLLM提出一种隐私保护的联邦大语言模型框架,用于可解释的多时间尺度短时交通流预测,通过复合选择分数、领域适应的LLM微调、轻量级参数交换和结构化提示表示提升预测性能与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16338 2026-04-21 cs.AI cs.MA 70%

Governing the Agentic Enterprise: A Governance Maturity Model for Managing AI Agent Sprawl in Business Operations

治理代理企业:一种治理成熟度模型用于管理人工智能代理在业务运营中的扩张

Vivek Acharya

机构 * Independent Researcher(独立研究员)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出了一种针对人工智能代理扩张的治理成熟度模型,通过12个治理领域和五个级别框架,结合NIST AI RMF和ISO/IEC 42001标准,验证了治理能力与业务成果的关联性,并展示了不同成熟度层级下的显著差异。

Comments 11 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15456 2026-04-20 cs.AI 70%

DeepER-Med: Advancing Deep Evidence-Based Research in Medicine Through Agentic AI

DeepER-Med: 通过代理AI推进医学中的深度证据导向研究

Zhizheng Wang, Chih-Hsuan Wei, Joey Chan, Robert Leaman, Chi-Ping Day, Chuan Wu, Mark A Knepper, Antolin Serrano Farias, Jordina Rincon-Torroella, Hasan Slika, Betty Tyler, Ryan Huu-Tuan Nguyen, Asmita Indurkar, Mélanie Hébert, Shubo Tian, Lauren He, Noor Naffakh, Aseem Aseem, Nicholas Wan, Emily Y Chew, Tiarnan D L Keenan, Zhiyong Lu

机构 * Division of Intramural Research (DIR), National Library of Medicine (NLM), National Institutes of Health (NIH)(国家医学图书馆(NLM)内务研究部,国家卫生研究院(NIH)) Hunterian Neurosurgical Laboratory, Johns Hopkins School of Medicine(约翰霍普金斯医学院霍尔特神经外科实验室) Cancer Data Science Laboratory, Center for Cancer Research, National Cancer Institute (NCI), National Institutes of Health (NIH)(国家癌症研究所(NCI)癌症数据科学实验室,国家癌症研究中心,国家卫生研究院(NIH)) Experimental Immunology Branch, National Cancer Institute (NCI), National Institutes of Health (NIH)(国家癌症研究所(NCI)实验免疫学分支,国家卫生研究院(NIH)) Epithelial Systems Biology Laboratory, Systems Biology Center, National Heart, Lung, and Blood Institute (NHLBI), National Institutes of Health (NIH)(国家心肺血液研究所(NHLBI)上皮系统生物学实验室,系统生物学中心,国家卫生研究院(NIH)) Brain Tumor Genetics Lab, Department of Neurosurgery, Johns Hopkins Hospital(约翰霍普金斯医院神经外科部脑肿瘤遗传实验室) Division of Hematology/Oncology, University of Illinois Chicago(伊利诺伊大学芝加哥分校血液/肿瘤科部) University of Illinois Cancer Center, Chicago, IL 60612, USA(伊利诺伊大学癌症中心,芝加哥,IL 60612,美国) Division of Epidemiology and Clinical Applications, National Eye Institute (NEI), National Institutes of Health (NIH)(国家眼耳研究所(NEI)流行病学与临床应用部,国家卫生研究院(NIH)) University of Michigan Medical School, Ann Arbor, MI 48109, USA(密歇根大学医学学院,安阿伯,MI 48109,美国)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 DeepER-Med通过代理AI框架提升医学研究的证据生成流程,包含研究规划、协作和证据综合模块,并通过专家评估和真实临床案例验证其有效性。

Comments 37 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05722 2026-04-20 cs.LG physics.chem-ph 70%

Teaching Language Models Mechanistic Explainability Through MechSMILES

通过MechSMILES教会语言模型机制性可解释性

Théo A. Neukomm, Zlatko Jončev, Philippe Schwaller

机构 * Laboratory of Artificial Chemical Intelligence (LIAC), Institut des Sciences et Ingénierie Chimiques, Ecole Polytechnique Fédérale de Lausanne (EPFL), Lausanne 1015, Switzerland(人工化学智能实验室(LIAC)、化学与工程学院、瑞士联邦理工学院(EPFL)、拉沃斯纳1015号)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出MechSMILES框架,通过箭头推导法教会语言模型预测化学反应机制,实现了反应路径验证、原子映射和催化剂识别等能力,展示了在复杂机制预测任务中的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14178 2026-04-17 cs.AI q-bio.NC 70%

Simulating Human Cognition: Heartbeat-Driven Autonomous Thinking Activity Scheduling for LLM-based AI systems

模拟人类认知:基于心跳驱动的自主思考活动调度机制用于基于大语言模型的AI系统

Hong Su

机构 * School of Computer Science, Chengdu University of Information Technology(成都信息学院计算机科学学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出基于心跳驱动的自主思考活动调度机制,通过动态认知模块实现自适应和持续自我调节,提升LLM代理的适应性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03686 2026-04-17 cs.AI 70%

AI4S-SDS: A Neuro-Symbolic Solvent Design System via Sparse MCTS and Differentiable Physics Alignment

AI4S-SDS: 一种基于稀疏MCTS和可微物理对齐的神经符号溶剂设计系统

Jiangyu Chen

机构 * State Key Laboratory for Novel Software Technology at Nanjing University(南京大学新型软件技术国家重点实验室) School of Computer Science, Nanjing University(南京大学计算机科学学院) Suzhou Laboratory(苏州实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出AI4S-SDS系统,通过稀疏MCTS和可微物理对齐,解决化学配方设计中的高维组合空间问题,提升探索多样性并实现物理约束下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05486 2026-04-17 cs.CL 70%

Language Model as Planner and Formalizer under Constraints

语言模型作为规划器和形式化工具的约束下

Cassie Huang, Stuti Mohan, Ziyi Yang, Stefanie Tellex, Li Zhang

机构 * Drexel University(德雷塞尔大学) Brown University(布朗大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 研究通过引入细粒度自然语言约束,揭示语言模型在规划任务中的性能下降,指出其鲁棒性不足及未来研究方向。

Comments In ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏