arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5878 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5878 篇

2604.07304 2026-04-09 cs.SE cs.AI 57%

Chatbot-Based Assessment of Code Understanding in Automated Programming Assessment Systems

基于聊天机器人的代码理解评估在自动化编程评估系统中的应用

Eduard Frankford, Erik Cikalleshi, Ruth Breu

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了聊天机器人在自动化编程评估中的应用,提出混合苏格拉底框架以整合对话验证,解决代码理解评估中的挑战。

Comments 12 pages, accepted for publication at CSEDU 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07121 2026-04-09 cs.HC cs.AI 57%

Mixed-Initiative Context: Structuring and Managing Context for Human-AI Collaboration

混合发起式上下文:为人类-人工智能协作结构和管理上下文

Haichang Li, Qinshi Zhang, Piaohong Wang, Zhicong Lu

机构 * George Mason University(乔治梅森大学) University of California, San Diego(加利福尼亚大学圣迭戈分校) City University of Hong Kong(香港城市大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出混合发起式上下文,通过结构化和可操作的交互对象,动态组织协作流程中的上下文,提升人机协作效率与可控性。

Comments 19 pages, 3 figures, 1 table. Appendix on pages 13-19 (main text is self-contained)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07116 2026-04-09 cs.CL 57%

Yale-DM-Lab at ArchEHR-QA 2026: Deterministic Grounding and Multi-Pass Evidence Alignment for EHR Question Answering

耶鲁-DM实验室参加ArchEHR-QA 2026:用于电子病历问答的确定性接地和多轮证据对齐

Elyas Irankhah, Samah Fodeh

机构 * Yale University(耶鲁大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出确定性接地和多轮证据对齐方法,用于电子病历问答任务,通过模型多样性与投票策略提升性能,实验结果显示对齐准确率受限于推理能力。

Comments 9 pages, 2 figures. System description for ArchEHR-QA 2026 shared task

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09035 2026-04-09 cs.RO cs.AI cs.SY eess.SY 57%

ManeuverGPT Agentic Control for Safe Autonomous Stunt Maneuvers

ManeuverGPT 代理控制用于安全的自动驾驶特技动作

Shawn Azdam, Pranav Doma, Aliasghar Moj Arab

机构 * New York University(纽约大学) Tandon School of Engineering, New York University(纽约大学坦登工程学院) General Autonomy Inc.(通用自主公司) Azdam AI

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ManeuverGPT框架,利用大语言模型代理生成并执行高动态特技动作,通过迭代提示法优化车辆控制参数,实现安全的J-turn等特技动作执行。

Comments 6 Pages, Submitted to IROS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05887 2026-04-08 cs.AI 57%

HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference

HybridKV: 为高效多模态大语言模型推理设计的混合KV缓存压缩

Bowen Zeng, Feiyang Ren, Jun Zhang, Xiaoling Gu, Ke Chen, Lidan Shou, Huan Li

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新区(滨江)区块链与数据安全研究院) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出HybridKV框架,通过分层预算分配和不同压缩策略,有效减少KV缓存内存占用并提升解码速度,实验表明在11个多模态基准上内存减少达7.9倍,解码速度提升1.52倍,性能损失极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04403 2026-04-08 cs.AI 57%

MolDA: Molecular Understanding and Generation via Large Language Diffusion Model

MolDA:通过大规模语言扩散模型实现分子理解与生成

Seohyeon Shin, HanJun Choi, Jun-Hyung Park, Hong Kook Kim, Mansu Kim

机构 * Gwangju Institute of Science and Technology(光州科学技术院) Hankuk University of Foreign Studies(韩国外国语大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 MolDA通过大规模语言扩散模型替代传统自回归架构,解决分子生成中非局部约束和结构误差问题,实现分子生成、描述和性质预测的全局一致性与化学有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05757 2026-04-08 cs.CL 57%

Identifying Influential N-grams in Confidence Calibration via Regression Analysis

通过回归分析识别影响置信度校准的关键n-gram

Shintaro Ozaki, Wataru Hashimoto, Hidetaka Kamigaito, Katsuhiko Hayashi, Taro Watanabe

机构 * Nara Institute of Science and Technology (NAIST)(奈良先端科学技术大学院大学) The University of Tokyo(东京大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文通过回归分析识别与置信度相关的语言表达,发现LLM在推理时仍保持高置信度,并通过抑制这些表达可实现置信度校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05149 2026-04-08 cs.CL 57%

EvolveRouter: Co-Evolving Routing and Prompt for Multi-Agent Question Answering

EvolveRouter: 多智能体问答中的共进化路由与提示

Jiatan Huang, Zheyuan Zhang, Kaiwen Shi, Yanfang Ye, Chuxu Zhang

机构 * University of Connecticut(康涅狄格大学) University of Notre Dame(圣母大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 EvolveRouter通过闭环共进化提升智能体质量和协作结构,实现动态适应的高效多智能体推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04895 2026-04-07 cs.MA cs.AI 57%

Agentic Federated Learning: The Future of Distributed Training Orchestration

代理联邦学习:分布式训练编排的未来

Rafael O. Jarczewski, Gabriel U. Talasso, Leandro Villas, Allan M. de Souza

机构 * Institute of Computing, University of Campinas(坎皮纳斯州立大学计算研究所) Hub of Artificial Intelligence and Cognitive Architectures - H.IAAC(人工智能与认知架构中心 - H.IAAC)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出代理联邦学习框架,通过语言模型代理自主协调,缓解客户端异质性和系统动态波动,提升资源利用和公平性,推动联邦学习向去中心化生态系统演进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04562 2026-04-07 cs.DL cs.AI 57%

Paper Espresso: From Paper Overload to Research Insight

Paper Espresso:从论文过载到研究洞察

Mingzhe Du, Luu Anh Tuan, Dong Huang, See-kiong Ng

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 Paper Espresso通过大规模语言模型自动发现、总结和分析arXiv热点论文,揭示AI研究动态,包括强化学习的爆发、非饱和主题涌现及新颖性与社区参与度的正相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04157 2026-04-07 cs.AI 57%

Readable Minds: Emergent Theory-of-Mind-Like Behavior in LLM Poker Agents

可读心智:LLM扑克代理中涌现的理论心智行为

Hsieh-Ting Lin, Tsung-Yu Hou

机构 * Department of Oncology, Koo Foundation Sun Yat-Sen Cancer Center(辜公亮基金会和信治癌中心医院肿瘤科) Department of Digital Content and Technologies, National Chengchi University(国立政治大学数位内容与科技学系)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究LLM在动态互动中发展理论心智行为的能力,发现持久记忆是必要且充分条件,使代理达到高级对手建模水平,且领域知识增强应用效果。

Comments 7 pages (PNAS format), 4 figures, 2 tables, 49 references. Submitted to PNAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00495 2026-04-07 cs.AI 57%

AI Runtime Infrastructure

AI 运行时基础设施

Christopher Cruz

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AI运行时基础设施,通过在模型与应用之间引入执行层,主动监控和干预智能体行为,优化任务成功率、延迟、令牌效率、可靠性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18633 2026-04-07 cs.AI cs.ET 57%

An Onto-Relational-Sophic Framework for Governing Synthetic Minds

一个面向合成智能的本体-关系-Sophic框架

Huansheng Ning, Jianguo Ding

机构 * University of Science and Technology Beijing(北京科技大学) Blekinge Institute of Technology(布莱金厄理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ORS框架,通过本体论、数字人格谱系和Cybersophy三支柱,解决合成智能的治理问题,展示其在自主研究代理和医疗AI等场景中的适应性治理能力。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06597 2026-04-07 cs.LG stat.ML 57%

Understanding and inverse design of implicit bias in stochastic learning: a geometric perspective

隐式偏置的理解与逆向设计:从几何视角出发

Nicola Aladrah, Emanuele Ballarin, Matteo Biagetti, Alessio Ansuini, Alberto d'Onofrio, Fabio Anselmi

机构 * Department of Mathematics, Informatics and Geoscience, University of Trieste(的里雅斯特大学数学、信息学与地球科学系) Area Science Park(科学园区) McGovern Institute, MIT(麻省理工学院麦戈文研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文从几何视角探讨了随机学习中隐式偏置的形成机制,提出了一种理论框架,通过梯度噪声与损失连续对称性的相互作用解释隐式偏置,并展示了如何通过参数化设计实现逆向设计,验证了稀疏性和谱稀疏性等特性。

Comments v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02783 2026-04-06 cs.HC cs.AI 57%

Disrupting Cognitive Passivity: Rethinking AI-Assisted Data Literacy through Cognitive Alignment

打破认知惰性:通过认知对齐重新思考人工智能辅助的数据素养

Yongsu Ahn, Nam Wook Kim, Benjamin Bach

机构 * Boston College(波士顿学院) Inria(法国国家信息与自动化研究所) University of Edinburgh(爱丁堡大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过认知对齐框架,重新设计人工智能辅助的数据素养,以避免认知惰性,促进主动思考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02678 2026-04-06 stat.ME cs.AI stat.AP 57%

Eligibility-Aware Evidence Synthesis: An Agentic Framework for Clinical Trial Meta-Analysis

有资格意识的证据合成:一个用于临床试验元分析的代理框架

Yao Zhao, Zhiyue Zhang, Yanxun Xu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 EligMeta框架整合了自动化试验发现与有资格意识的元分析,通过自然语言查询生成可复现的试验选择,并基于资格对研究加权,以产生特定群体的汇总估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02674 2026-04-06 cs.MA cs.AI 57%

Do Agent Societies Develop Intellectual Elites? The Hidden Power Laws of Collective Cognition in LLM Multi-Agent Systems

智能体社会是否发展出知识分子?LLM多智能体系统中集体认知的隐藏幂律

Kavana Venkatesh, Jiaming Cui

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究LLM多智能体系统中协调动态,揭示协调遵循幂律级联、集中于知识分子精英及系统规模增长时极端事件频发的三大定律,提出整合瓶颈机制及Deficit-Triggered Integration方法提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02280 2026-04-03 cs.AI cs.CV 57%

Novel Memory Forgetting Techniques for Autonomous AI Agents: Balancing Relevance and Efficiency

新颖的记忆遗忘技术用于自主AI代理:在相关性和效率之间平衡

Payal Fofadiya, Sunil Tiwari

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种自适应预算遗忘框架,通过相关性引导评分和有界优化,提升长周期对话任务的F1分数和记忆一致性,减少虚假记忆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01599 2026-04-03 cs.AI 57%

ByteRover: Agent-Native Memory Through LLM-Curated Hierarchical Context

ByteRover:通过LLM-curated分层上下文实现代理原生内存

Andy Nguyen, Danh Doan, Hoang Pham, Bao Ha, Dat Pham, Linh Nguyen, Hieu Nguyen, Thien Nguyen, Cuong Do, Phat Nguyen, Toan Nguyen

机构 * ByteRover

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ByteRover,一种代理原生内存架构,通过LLM-curated分层上下文实现知识的结构化存储与检索,实验显示其在LoCoMo和LongMemEval上表现优异,无需外部基础设施。

Comments 19 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01461 2026-04-03 cs.AI 57%

Reducing Hallucinations in LLM-based Scientific Literature Analysis Using Peer Context Outlier Detection

通过同侪上下文异常检测减少基于LLM的科学文献分析中的幻觉

Daniel Xie, Maxwell J. Jacobson, Adil Wazeer, Haiyan Wang, Xinghang Zhang, Yexiang Xue

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出Peer Context Outlier Detection方法,通过文档间关系提升数据提取准确性,实验显示在6个科学领域达到98%的异常检测精度,减少幻觉并提高自动化系统可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00474 2026-04-03 cs.IT cs.LG eess.SP math.IT 57%

Wireless Power Control Based on Large Language Models

基于大语言模型的无线功率控制

Jiacheng Wang, Yucheng Sheng, Le Liang, Hao Ye, Shi Jin

机构 * School of Information Science and Engineering, Southeast University(东南大学信息科学与工程学院) Department of Electrical and Computer Engineering, University of California, Santa Cruz(加州大学圣克鲁兹分校电气与计算机工程系)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出PC-LLM框架,通过引入干扰感知注意力偏差,有效融合无线拓扑与预训练关系先验,实现高效无线网络功率控制,且在零样本环境下表现出色。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11558 2026-04-02 cs.RO cs.AI 57%

RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks

RoboClaw:一个用于可扩展长周期机器人任务的代理框架

Ruiying Li, Yunlang Zhou, YuYao Zhu, Kylin Chen, Jingyuan Wang, Sukai Wang, Kongtao Hu, Minhui Yu, Bowen Jiang, Zhan Su, Jiayao Ma, Xin He, Yongjian Shen, Yang Yang, Guanghui Ren, Maoqing Yao, Wenhao Wang, Yao Mu

机构 * AgiBot National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) MoE Key Lab of Artificial Intelligence, AI Institute, SJTU(上海交通大学人工智能研究院教育部人工智能重点实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 RoboClaw通过统一数据收集、策略学习和任务执行,提高长周期机器人任务的稳定性和可扩展性,减少人工干预,提升多策略鲁棒性。

Comments Code available at: https://github.com/RoboClaw-Robotics/RoboClaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27971 2026-04-01 cs.LG 57%

Principal Prototype Analysis on Manifold for Interpretable Reinforcement Learning

流形上的主原型分析用于可解释的强化学习

Bodla Krishna Vamshi, Haizhao Yang

机构 * University of Maryland College park(马里兰大学帕克分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出一种自动选择最优原型的方法,用于增强强化学习的可解释性,无需人工定义原型,实验显示其性能与现有方法相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14565 2026-04-01 cs.RO cs.AI 57%

Masked IRL: LLM-Guided Reward Disambiguation from Demonstrations and Language

掩码逆强化学习:从演示和语言引导的奖励消歧

Minyoung Hwang, Alexandra Forsey-Smerek, Nathaniel Dennler, Andreea Bobu

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出掩码逆强化学习框架,利用大语言模型结合演示和语言信息,提升机器人奖励学习的样本效率和泛化能力。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28361 2026-03-31 cs.AI cs.MA 57%

Deep Research of Deep Research: From Transformer to Agent, From AI to AI for Science

深度研究的深度研究:从Transformer到代理,从AI到AI为科学

Yipeng Yu

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨深度研究的定义与发展方向,整合行业深度研究与AI为科学的视角,提出生成式AI的双支柱,并讨论AI4S在各学科的进展及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03904 2026-03-31 cs.LG 57%

LLM as an Algorithmist: Enhancing Anomaly Detectors via Programmatic Synthesis

LLM作为算法家:通过程序合成增强异常检测器

Hangting Ye, Jinmeng Li, He Zhao, Mingchen Zhuge, Dandan Guo, Yi Chang, Hongyuan Zha

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) CUHK-Shenzhen(香港中文大学(深圳)) Department of DSAI, Monash University(莫纳什大学数据科学与人工智能系) KAUST(阿卜杜拉国王科技大学) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动人机智能工程研究中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出LLM-DAS框架,将LLM从数据处理者转变为算法家,通过程序合成生成对抗性异常,提升检测器鲁棒性。

Comments Accepted by the Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27536 2026-03-31 cs.AI 57%

Dual-Stage LLM Framework for Scenario-Centric Semantic Interpretation in Driving Assistance

双阶段LLM框架用于驾驶辅助中的场景中心语义解释

Jean Douglas Carvalho, Hugo Taciro Kenji, Ahmad Mohammad Saber, Glaucia Melo, Max Mauro Dias Santos, Deepa Kundur

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出双阶段LLM框架,用于评估城市驾驶场景中基于LLM的风险推理可复现性。通过多模态驾驶数据构建确定性场景窗口,并在固定提示约束和闭合数字风险方案下评估,揭示模型间在风险等级分配、高风险升级、证据使用和因果归因上的系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27116 2026-03-31 cs.AI cs.IR cs.NE 57%

The Price of Meaning: Why Every Semantic Memory System Forgets

意义的代价:为何每一个语义记忆系统都会遗忘

Sambartha Ray Barman, Andrey Starenky, Sofia Bodnar, Nikhil Narasimhan, Ashwin Gopinath

机构 * Sentra Massachusetts Institute of Technology(麻省理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了语义记忆系统中意义与遗忘的权衡,证明了语义连续核阈值记忆系统中干扰和遗忘不可避免,通过四个结果揭示了语义表示的有效秩、局部维度、记忆增长对保留的影响以及联想诱饵的虚假回忆无法消除。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08482 2026-03-31 cs.DB cs.AI 57%

CLEAR: A Knowledge-Centric Vessel Trajectory Analysis Platform

CLEAR:一种以知识为中心的船舶轨迹分析平台

Hengyu Liu, Tianyi Li, Haoyu Wang, Kristian Torp, Yushuai Li, Tiancheng Zhang, Torben Bach Pedersen, Christian S. Jensen

机构 * Aalborg University(奥尔堡大学) Northeastern University(东北大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 CLEAR平台利用大语言模型生成能力,将不完整复杂的AIS数据转化为完整可解释的船舶轨迹,通过结构化数据知识图谱提升非专业用户分析能力。

Comments 4 pages, 5 figures. Accepted at SIGMOD 2026 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26904 2026-03-31 quant-ph cs.AI 57%

Are LLMs Good For Quantum Software, Architecture, and System Design?

大语言模型在量子软件、架构和系统设计中是否有效?

Sourish Wawdhane, Poulami Das

机构 * UT Austin(德克萨斯大学奥斯汀分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨大语言模型在量子系统设计中的应用,评估了九种前沿模型与研究生在量子计算问题上的表现,提出未来研究方向。

Comments 2 pages

详情

展开后加载摘要…

URL PDF HTML 收藏