arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11167 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11167 篇

2512.21456 2025-12-29 cs.LG 57%

Statistical vs. Deep Learning Models for Estimating Substance Overdose Excess Mortality in the US

统计学习与深度学习模型用于估计美国物质过量死亡率

Sukanya Krishna, Marie-Laure Charpignon, Maimuna Majumder

机构 * Harvard University(哈佛大学) Boston Children's Hospital(波士顿儿童医院) Broad Institute of MIT and Harvard(MIT和哈佛联合研究所) Massachusetts Institute of Technology(麻省理工学院) Harvard Medical School(哈佛医学院)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文比较了统计模型与深度学习模型在预测美国物质过量死亡率方面的性能,发现LSTM在预测结构变化时表现更优,而基于注意力的模型因过度拟合历史数据而表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21412 2025-12-29 cs.LG cs.SY eess.SY 57%

A Survey of Freshness-Aware Wireless Networking with Reinforcement Learning

面向新鲜度的无线网络调研:强化学习视角

Alimu Alibotaiken, Suyang Wang, Oluwaseun T. Ajayi, Yu Cheng

机构 * Department of Electrical and Computer Engineering, Illinois Institute of Technology(伊利诺伊理工学院电气与计算机工程系) School of Computer Science and Engineering, California State University(加州州立大学计算机科学与工程学院)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文通过强化学习视角调研了面向新鲜度的无线网络,系统梳理了AoI及其变体分类,并提出策略分类法,综合了RL驱动的新鲜度控制进展,突出了延迟决策、随机变化和跨层设计等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21120 2025-12-25 cs.CL cs.IR 57%

ClarifyMT-Bench: Benchmarking and Improving Multi-Turn Clarification for Conversational Large Language Models

ClarifyMT-Bench: 会话大语言模型多轮澄清的基准测试与改进

Sichun Luo, Yi Huang, Mukai Li, Shichang Meng, Fengyuan Liu, Zefa Hu, Junlan Feng, Qi Liu

机构 * The University of Hong Kong(香港大学) JIUTIAN Research, China Mobile(中移动巨泰研宄院) CityUHK(城市大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 ClarifyMT-Bench通过多轮对话基准测试和ClarifyAgent代理方法,解决LLM在多轮对话中澄清不足的问题,提升在模糊情境下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20789 2025-12-25 eess.SY cs.AI cs.SY 57%

X-GridAgent: An LLM-Powered Agentic AI System for Assisting Power Grid Analysis

X-GridAgent: 一种基于大语言模型的代理AI系统,用于协助电力 grid 分析

Yihan, Wen, Xin Chen

机构 * Department of Electrical and Computer Engineering, Texas A&M University(电气与计算机工程系,德克萨斯A&M大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 X-GridAgent是一种基于大语言模型的代理AI系统,通过自然语言查询实现电力系统分析的自动化,结合提示优化和混合检索增强生成算法,提升电网分析的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20778 2025-12-25 cs.MA cs.AI cs.RO 57%

Towards Optimal Performance and Action Consistency Guarantees in Dec-POMDPs with Inconsistent Beliefs and Limited Communication

在具有不一致信念和有限通信的Dec-POMDPs中实现最优性能和行动一致性保证

Moshe Rafaeli Shimron, Vadim Indelman

机构 * Technion - Israel Institute of Technology(技术学院-以色列理工学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种去中心化框架,用于在具有不一致信念和有限通信的Dec-POMDPs中实现最优联合行动选择,提供行动一致性和性能的概率保证,并在需要时触发通信。

Comments 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20482 2025-12-24 cs.SE cs.AI 57%

SweRank+: Multilingual, Multi-Turn Code Ranking for Software Issue Localization

SweRank+: 多语言、多轮次代码排名用于软件问题定位

Revanth Gangi Reddy, Ye Liu, Wenting Zhao, JaeHyeok Doo, Tarun Suresh, Daniel Lee, Caiming Xiong, Yingbo Zhou, Semih Yavuz, Shafiq Joty

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Salesforce AI Research(Salesforce AI研究院) KAIST AI(韩国科学技术院AI研究中心)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 SweRank+结合跨语言代码排名工具和代理搜索设置,实现多轮次的代码库推理,提升多语言软件问题定位的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08674 2025-12-24 cs.AI cs.MA 57%

Multi-Agent Intelligence for Multidisciplinary Decision-Making in Gastrointestinal Oncology

多智能体智能在胃肠肿瘤多学科决策中的应用

Rongzhao Zhang, Junqiao Wang, Shuyun Yang, Mouxiao Bian, Chihao Zhang, Dongyang Wang, Qiujuan Yan, Yun Zhong, Yuwei Bai, Guanxu Zhu, Kangkun Mao, Miao Wang, Chao Ding, Renjie Lu, Lei Wang, Lei Zheng, Tao Zheng, Xi Wang, Zhuo Fan, Bing Han, Meiling Liu, Luyi Jiang, Dongming Shan, Wenzhong Jin, Jiwei Yu, Zheng Wang, Jie Xu, Meng Luo

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Ninth People’s Hospital, Shanghai Jiao Tong University School of Medicine(上海第九人民医院,上海交通大学医学院) Renji Hospital, Shanghai Jiao Tong University School of Medicine(仁济医院,上海交通大学医学院) Shanghai Institute of Infectious Disease and Biosecurity, Fudan University(上海市传染病防治研究所暨生物安全研究所,复旦大学) Shanghai Health Development Research Center (Shanghai Medical Information Center)(上海市卫生健康发展研究中心(上海市医疗信息中心)) Shanghai Kupas Technology Co., Ltd.(上海库帕斯科技有限公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于多智能体的框架,用于提升胃肠肿瘤多学科决策的自动化支持,通过模拟多学科团队协作,提高推理逻辑和医疗准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19475 2025-12-23 cs.CL 57%

A Large-Language-Model Framework for Automated Humanitarian Situation Reporting

为自动化人道主义局势报告设计的大型语言模型框架

Ivan Decostanzi, Yelena Mejova, Kyriaki Kalimeri

机构 * ISI Foundation(ISI基金会) UNICEF(联合国儿童基金会)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种基于大型语言模型的自动化框架,用于生成结构化、可解释且可操作的人道主义局势报告,通过多级评估和透明引用链接提高了报告的准确性和实用性。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19234 2025-12-23 cs.AI 57%

DeliveryBench: Can Agents Earn Profit in Real World?

DeliveryBench: 代理在现实世界中能否获利?

Lingjun Mao, Jiawei Ren, Kun Zhou, Jixuan Chen, Ziqiao Ma, Lianhui Qin

机构 * University of California, San Diego(加州大学圣地亚哥分校) University of Michigan(密歇根大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 DeliveryBench通过模拟现实世界中的食品配送任务,评估基于VLM的具身代理在长期规划和约束管理方面的性能,发现其与人类存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18596 2025-12-23 cs.LG 57%

EIA-SEC: Improved Actor-Critic Framework for Multi-UAV Collaborative Control in Smart Agriculture

EIA-SEC:改进的Actor-Critic框架用于智能农业多无人机协同控制

Quanxi Zhou, Wencan Mao, Yilei Liang, Manabu Tsukada, Yunling Liu, Jon Crowcroft

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国家信息研究所) The University of Cambridge(剑桥大学) China Agricultural University(中国农业大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 EIA-SEC框架通过精英模仿和共享批评机制,提升多无人机在智能农业中的协同控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18425 2025-12-23 cs.LG 57%

MoE Pathfinder: Trajectory-driven Expert Pruning

MoE路径规划者:轨迹驱动的专家剪枝

Xican Yang, Yuanhe Tian, Yan Song

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 MoE路径规划者通过轨迹驱动的专家剪枝方法,提升MoE模型的计算效率和部署性能。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18202 2025-12-23 cs.AI 57%

Sophia: A Persistent Agent Framework of Artificial Life

Sophia:人工智能生命的一种持久代理框架

Mingyang Sun, Feng Hong, Weinan Zhang

机构 * Westlake University(西湖大学) Shanghai Innovation Institute(上海创新研究院) Project Cuddlepark Team(Project Cuddlepark团队) Shanghai Jiao Tong University(上海交通大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 Sophia通过引入系统3,实现持久代理框架,使AI代理具备自我改进、身份连续性和透明行为解释能力,推动人工生命的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17913 2025-12-23 cs.DC cs.AI 57%

Byzantine Fault-Tolerant Multi-Agent System for Healthcare: A Gossip Protocol Approach to Secure Medical Message Propagation

容错多智能体系统在医疗中的应用:基于 gossip 协议的安全医疗信息传播方法

Nihir Chadderwala

机构 * Nihir Chadderwala(独立研究者)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种基于 gossip 协议的拜占庭容错多智能体系统,用于医疗领域,通过加密验证和共识协议保障信息安全与系统容错性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12399 2025-12-23 cs.AI 57%

A Survey of Vibe Coding with Large Language Models

基于大语言模型的Vibe编码调研

Yuyao Ge, Lingrui Mei, Zenghao Duan, Tianhao Li, Yujia Zheng, Yiwei Wang, Lexin Wang, Jiayu Yao, Tianyu Liu, Yujun Cai, Baolong Bi, Fangda Guo, Jiafeng Guo, Shenghua Liu, Xueqi Cheng

机构 * Institute of Computing Technology Chinese Academy of Sciences(中国科学院计算技术研究所) Duke University(杜克大学) University of California Merced(加州大学默塞德分校) Peking University(北京大学) University of Queensland(昆士兰大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文调研了基于大语言模型的Vibe编码方法,系统分析了其理论基础和五个开发模型,揭示了上下文工程与协作模式对成功的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17488 2025-12-22 cs.CV cs.LG 57%

TwinSegNet: A Digital Twin-Enabled Federated Learning Framework for Brain Tumor Analysis

TwinSegNet: 一种基于数字孪生的联邦学习框架用于脑肿瘤分析

Almustapha A. Wakili, Adamu Hussaini, Abubakar A. Musa, Woosub Jung, Wei Yu

机构 * Department of Computer Science and Information Sciences, Towson University, USA(塔森大学计算机科学与信息科学系)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 TwinSegNet通过整合混合ViT-UNet模型与个性化数字孪生,实现了隐私保护的联邦学习框架,用于准确且实时的脑肿瘤分割。

Comments IEEE Virtual Conference on Communications. 4-6 November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17250 2025-12-22 cs.AI 57%

Accelerating Multi-modal LLM Gaming Performance via Input Prediction and Mishit Correction

通过输入预测和误位修正加速多模态大语言模型游戏性能

Ziyang Lin, Zixuan Sun, Sanhorn Chen, Xiaoyang Chen, Roy Zhao

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 通过输入预测和误位修正方法,显著降低多模态大语言模型游戏性能的推理延迟,提升整体控制效果。

Comments UIUC 25 Fall CS 498

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16532 2025-12-19 cs.AI cs.IR 57%

From Personalization to Prejudice: Bias and Discrimination in Memory-Enhanced AI Agents for Recruitment

从个性化到偏见:记忆增强型AI招聘代理中的偏见与歧视

Himanshu Gharat, Himanshi Agrawal, Gourab K. Patro

机构 * Phi Labs, Quantiphi Inc.(Phi实验室、Quantiphi公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究揭示了记忆增强型AI招聘代理中偏见的系统性引入与强化,强调了对LLM基础AI代理的额外防护措施的必要性。

Comments In Proceedings of the Nineteenth ACM International Conference on Web Search and Data Mining (WSDM '26)

Journal ref In Proceedings of the Nineteenth ACM International Conference on Web Search and Data Mining (WSDM '26), 2026, Boise, ID, USA. ACM, New York, NY, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08226 2025-12-19 cs.LG 57%

UAMDP: Uncertainty-Aware Markov Decision Process for Risk-Constrained Reinforcement Learning from Probabilistic Forecasts

UAMDP:面向风险约束强化学习的概率预测不确定性感知马尔可夫决策过程

Michal Koren, Or Peretz, Tai Dinh, Philip S. Yu

机构 * The Kyoto College of Graduate Studies for Informatics(京都大学研究生院信息学研究科) Department of Computer Science, University of Illinois at Chicago(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 UAMDP通过整合概率预测、后验不确定性探索和风险约束规划,提升高波动环境下序列决策的安全性和盈利能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13324 2025-12-19 cs.AI cs.MA 57%

Towards Pervasive Distributed Agentic Generative AI -- A State of The Art

迈向普及型分布式代理生成AI——综述

Gianni Molinari, Fabio Ciravegna

机构 * University of Turin(都灵大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文综述了智能代理和大语言模型在普及计算中的最新发展,探讨了代理部署策略、挑战及提出的‘代理作为工具’框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16149 2025-12-19 cs.AI 57%

ToolForge: A Data Synthesis Pipeline for Multi-Hop Search without Real-World APIs

ToolForge: 一种无需真实世界API的多跳搜索数据合成管道

Hao Chen, Zhexin Hu, Jiajun Chai, Haocheng Yang, Hang He, Xiaohan Wang, Wei Lin, Luhang Wang, Guojun Yin, Zhuofeng zhao

机构 * North China University of Technology(华北理工大学) Meituan(美团) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) National University of Singapore(新加坡国立大学) East China Normal University(华东师范大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 ToolForge通过构建虚拟工具生成多跳搜索数据,无需真实API调用,提升模型在多跳推理任务中的性能。

Comments 13 pages, 9 tables, 6 figures. Code available at https://github.com/Buycar-arb/ToolForge

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15834 2025-12-19 cs.PL cs.AI cs.DC cs.PF cs.SE 57%

Optimizing Agentic Language Model Inference via Speculative Tool Calls

通过推测性工具调用优化代理语言模型推理

Daniel Nichols, Prajwal Singhania, Charles Jekel, Abhinav Bhatele, Harshitha Menon

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过推测性工具调用优化代理语言模型推理,提升推理吞吐量并提供理论分析与工具缓存API。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19895 2025-12-18 cs.AI 57%

RPM-MCTS: Knowledge-Retrieval as Process Reward Model with Monte Carlo Tree Search for Code Generation

RPM-MCTS:基于蒙特卡洛树搜索的知识检索作为过程奖励模型用于代码生成

Yuanyuan Lin, Xiangyu Ouyang, Teng Zhang, Kaixin Sui

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 RPM-MCTS通过结合知识检索与蒙特卡洛树搜索,有效评估代码生成过程中的中间步骤,减少错误并提升效率

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15042 2025-12-18 cs.CL cs.IR 57%

DASH: Dialogue-Aware Similarity and Handshake Recognition for Topic Segmentation in Public-Channel Conversations

DASH:对话感知相似性与握手识别用于公共频道对话中的主题分割

Sijin Sun, Liangbin Zhao, Ming Deng, Xiuju Fu

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 DASH-DTS通过对话感知相似性与握手识别技术,提升公共频道对话中主题分割的准确性和鲁棒性,并发布首个海上VHF通信数据集推动相关研究。

Comments Accepted by AAAIW2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14910 2025-12-18 cs.AI cs.CY 57%

AgroAskAI: A Multi-Agentic AI Framework for Supporting Smallholder Farmers' Enquiries Globally

AgroAskAI: 一种支持全球小农户提问的多智能体AI框架

Nadine Angela Cantonjos, Arpita Biswas

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 AgroAskAI通过多智能体系统为小农户提供气候适应决策支持,支持多语言交互并整合实时数据,提升农业可持续性和决策透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06928 2025-12-18 cs.CY cs.AI 57%

Beyond Tools: Generative AI as Epistemic Infrastructure in Education

超越工具:生成式AI在教育中的认知基础设施

Bodong Chen

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出AI作为认知基础设施的框架,探讨其在教育中对认知能力的影响,指出AI系统可能替代而非维持人类认知实践。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12045 2025-12-17 cs.HC cs.AI 57%

AI as a Teaching Partner: Early Lessons from Classroom Codesign with Secondary Teachers

AI作为教学伙伴:与中学教师课堂共同设计的初步经验

Alex Liu, Lief Esbenshade, Shawon Sarkar, Zewei Tian, Min Sun, Zachary Zhang, Thomas Han, Yulia Lapicus, Kevin He

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本研究探讨了AI在中学课堂中的应用,通过教师与AI的共同设计,评估AI在教学中的作用及改进需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14138 2025-12-17 cs.HC cs.AI 57%

LAPPI: Interactive Optimization with LLM-Assisted Preference-Based Problem Instantiation

LAPPI:基于LLM的偏好驱动问题实例化交互优化

So Kuroki, Manami Nakagawa, Shigeo Yoshida, Yuki Koyama, Kozuno Tadashi

机构 * Sakana AI University of California, Davis(加州大学戴维斯分校) OMRON SINIC X Corporation(OMRON SINIC X公司) University of Tokyo(东京大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 LAPPI通过LLM辅助用户将模糊偏好转化为明确的优化问题,提升终端用户在旅行计划等任务中的问题实例化效率和解决方案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13860 2025-12-17 cs.SE cs.AI 57%

Verification-Guided Context Optimization for Tool Calling via Hierarchical LLMs-as-Editors

通过分层大语言模型作为编辑器进行工具调用的验证引导上下文优化

Henger Li, Shuangjie You, Flavio Di Palo, Yiyue Qian, Ayush Jain

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 通过分层LLM作为编辑器,验证引导上下文优化提升工具调用的准确性和泛化能力。

Comments Accepted by AAAI 2026 Workshop on Agentic AI Benchmarks and Applications for Enterprise Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13747 2025-12-17 cs.CV cs.AI 57%

Why Text Prevails: Vision May Undermine Multimodal Medical Decision Making

为何文本占上风:视觉可能损害多模态医疗决策制定

Siyuan Dai, Lunxiao Li, Kun Zhao, Eardi Lila, Paul K. Crane, Heng Huang, Dongkuan Xu, Haoteng Tang, Liang Zhan

机构 * University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷大学) University of Pittsburgh(匹兹堡大学) NC State University(北卡罗来纳州立大学) University of Washington(华盛顿大学) University of Maryland(马里兰大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究发现文本推理在医疗多模态决策中优于多模态输入,提出三种策略以提升多模态医疗决策能力。

Comments Accepted by ICDM 2025 the Workshop on Synergy of AI and Multimodal Biomedical Data Mining

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16097 2025-12-17 cs.AI 57%

Developing Large Language Models for Clinical Research Using One Million Clinical Trials

利用一百万项临床试验开发大型语言模型用于临床研究

Zifeng Wang, Jiacheng Lin, Qiao Jin, Junyi Gao, Jathurshan Pradeepkumar, Pengcheng Jiang, Zhiyong Lu, Jimeng Sun

机构 * Usher Institute, Edinburgh Medical School, University of Edinburgh(埃丁堡大学埃丁堡医学院usher研究所) Health Data Research UK(英国健康数据研究) School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算与数据科学学院) Division of Intramural Research, National Library of Medicine, National Institutes of Health(国家卫生研究院国家医学图书馆内部研究部) Keiji AI

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出TrialPanorama,通过整合一百万项临床试验数据,训练出在八个关键临床研究任务中表现优于通用大语言模型的8B LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏