arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11104 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11104 篇

2604.07512 2026-04-14 cs.AI cs.LG 62%

Rhizome OS-1: Rhizome's Semi-Autonomous Operating System for Small Molecule Drug Discovery

Rhizome OS-1:Rhizome的半自主操作系统用于小分子药物发现

Yiwen Wang, Gregory Sinenka, Xhuliano Brace

机构 * Rhizome Research Inc.

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Rhizome OS-1通过多模态AI代理实现小分子药物发现的半自动化,结合计算化学、医药化学和专利代理功能,生成新颖分子并评估专利自由度,利用图扩散模型生成化学物质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06806 2026-04-14 cs.CL cs.AI 62%

MachineLearningLM: Scaling Many-shot In-context Learning via Continued Pretraining

MachineLearningLM: 通过持续预训练扩展多示例上下文学习

Haoyu Dong, Pengkun Zhang, Mingzhe Lu, Yanzhen Shen, Guolin Ke

机构 * UCAS(中国科学院大学) Microsoft(微软) SCUT(华南理工大学) Stanford(斯坦福大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MachineLearningLM通过持续预训练赋予大语言模型强大的上下文机器学习能力,同时保持其通用知识和推理能力,提升多示例任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09029 2026-04-13 cs.CL cs.AI 62%

CONDESION-BENCH: Conditional Decision-Making of Large Language Models in Compositional Action Space

CONDESION-BENCH:大语言模型在组合动作空间中的条件决策

Yeonjun Hwang, Sungyong Park, Minju Kim, Dongha Lee, Jinyoung Yeo

机构 * Department of Artificial Intelligence, Yonsei University(延世大学人工智能系)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CONDESION-BENCH基准,用于评估大语言模型在组合动作空间中的条件决策能力,通过引入变量、上下文和分配层级的显式条件限制,提升决策质量评估的严谨性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08609 2026-04-13 cs.CV cs.AI cs.LG 62%

Detection of Hate and Threat in Digital Forensics: A Case-Driven Multimodal Approach

数字取证中的仇恨与威胁检测:基于案例的多模态方法

Ponkoj Chandra Shill

机构 * University of Nevada, Reno(内华达大学雷诺分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于案例的多模态方法,用于数字取证中的仇恨与威胁检测,通过区分文本证据、关联上下文文本和图像证据,提升取证的可追溯性和准确性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08603 2026-04-13 cs.AI cs.CL 62%

From Business Events to Auditable Decisions: Ontology-Governed Graph Simulation for Enterprise AI

从商业事件到可审计决策:面向企业AI的本体引导图模拟

Hongyin Zhu, Jinming Liang, Mengjun Hou, Ruifan Tang, Xianbin Zhu, Jingyuan Yang, Yuanman Mao, Feng Wu

机构 * Yonyou AI Lab(用友AI实验室) Yonyou Network Technology Co., Ltd.(用友网络科技股份有限公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LOM-action框架,通过本体引导的图模拟实现企业AI决策,确保决策基于模拟图而非无限制知识空间,提升决策可信度与可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06737 2026-04-13 cs.CL cs.AI 62%

WisdomInterrogatory (LuWen): An Open-Source Legal Large Language Model Technical Report

WisdomInterrogatory (LuWen): 一种开源法律大语言模型技术报告

Yiquan Wu, Yuhang Liu, Yifei Liu, Ang Li, Siying Zhou, Kun Kuang, Fei Wu

机构 * Zhejiang University(浙江大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于Baichuan模型的开源中文法律语言模型LuWen,通过持续预训练、监督微调和检索增强生成技术,提升法律领域任务表现。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06603 2026-04-09 cs.CL cs.AI 62%

Scientific Knowledge-driven Decoding Constraints Improving the Reliability of LLMs

基于科学知识的解码约束:提升大语言模型的可靠性

Maotian Ma, Zheni Zeng, Zhenghao Liu, Yukun Yan

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) Northeastern University(东北大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SciDC方法,通过整合领域知识与强约束提升LLM在科学任务中的可靠性,实验显示在工业配方设计、肿瘤诊断和逆合成规划中平均准确率提升12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05952 2026-04-08 cs.AI cs.CL 62%

Towards Trustworthy Report Generation: A Deep Research Agent with Progressive Confidence Estimation and Calibration

迈向可信报告生成:一种带有逐步置信度估计和校准的深度研究代理

Yi Yuan, Xuhong Wang, Shanzhe Lei

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Southeast University(东南大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种深度研究代理,通过逐步置信度估计和校准提升报告生成的可信度,增强透明度和用户信任。

Comments 20 pages, 3 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04949 2026-04-08 cs.IR cs.AI cs.CL 62%

Learning to Retrieve from Agent Trajectories

从智能体轨迹中学习检索

Yuqi Zhou, Sunhao Dai, Changle Qu, Liang Pang, Jun Xu, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) CAS Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全重点实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出从智能体交互数据直接训练检索模型的新方法,通过分析轨迹中的行为信号,提出LRAT框架提升检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25454 2026-04-08 cs.AI cs.CL 62%

DeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree Search

DeepSearch: 通过蒙特卡洛树搜索克服强化学习中的瓶颈问题

Fang Wu, Weihao Xuan, Heli Qi, Ximing Lu, Aaron Tu, Li Erran Li, Yejin Choi

机构 * Stanford University(斯坦福大学) University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所革新智能研究中心) UC Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) Amazon AWS(亚马逊云科技)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 DeepSearch通过将蒙特卡洛树搜索整合到强化学习中,解决探索不足的问题,提升数学推理能力,实验显示其在推理任务中达到62.95%的准确率,且效率显著高于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04565 2026-04-07 cs.CL cs.AI 62%

PassiveQA: A Three-Action Framework for Epistemically Calibrated Question Answering via Supervised Finetuning

PassiveQA: 一个基于监督微调的三动作框架,用于通过监督微调进行知识校准的问题回答

Madhav S Baidya

机构 * Indian Institute of Technology (BHU) Varanasi(印度理工学院(巴纳拉斯印度教大学)瓦拉纳西分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PassiveQA框架,通过监督微调解决信息不全时的问题回答,提升宏F1和退避召回率,减少幻觉。

Comments 32 pages, 4 figures. Includes experiments on four QA datasets and a knowledge graph-based finetuning pipeline. Code available at: https://github.com/MadsDoodle/PassiveQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14130 2026-04-07 cs.AI cs.CE cs.CL cs.IR 62%

PRISM: Prompt-Refined In-Context System Modelling for Financial Retrieval

PRISM:基于上下文的系统建模用于金融检索

Chun Chet Ng, Jia Yu Lim, Wei Zeng Low

机构 * AI Lens

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 PRISM通过精细化提示、上下文学习和轻量级多代理协调,提升金融信息检索效率,其简单配置在FinAgentBench上取得NDCG@5 0.71818,为实际应用提供实用指导。

Comments 3rd-place solution for the ACM ICAIF 2025 Agentic Retrieval Grand Challenge. Accepted for poster presentation at ICLR 2026 (Advances in Financial AI Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03809 2026-04-07 cs.LG cs.AI cs.MA 62%

Representational Collapse in Multi-Agent LLM Committees: Measurement and Diversity-Aware Consensus

多智能体大语言模型委员会中的表征坍塌:测量与多样性感知共识

Dipkumar Patel

机构 * LLMs Research Inc.(LLMs研究公司)

专题命中 规划推理 :chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨多智能体大语言模型委员会中表征坍塌现象,通过测量和多样性感知共识方法提升共识质量,实验表明表征坍塌可测量且影响任务难度。

Comments 11 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00855 2026-04-07 cs.AI cs.LG cs.MA 62%

A Multi-Agent Reinforcement Learning Framework for Public Health Decision Analysis

面向公共卫生决策分析的多智能体强化学习框架

Dinesh Sharma, Ankit Shah, Chaitra Gopalappa

机构 * University of South Florida(南佛罗里达大学) Indiana University(印第安纳大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多智能体强化学习框架,用于优化公共卫生干预策略,通过考虑跨行政区的流行病学互动,提高资源分配效率,实验表明其在减少新感染方面优于传统单智能体方法。

Comments Updated to the accepted version published in Healthcare Analytics (November 2025)

Journal ref Healthcare Analytics, 8 (2025) 100436

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03174 2026-04-06 cs.CL cs.AI 62%

Beyond the Parameters: A Technical Survey of Contextual Enrichment in Large Language Models: From In-Context Prompting to Causal Retrieval-Augmented Generation

超越参数:大型语言模型中上下文丰富技术的综述:从上下文提示到因果检索增强生成

Prakhar Bansal, Shivangi Agarwal

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大型语言模型中通过增加结构化上下文来提升性能的技术,涵盖上下文学习、提示工程、检索增强生成等方法,并提出透明的文献筛选协议和可信检索增强NLP的研究优先级。

Comments 7 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29093 2026-04-06 cs.CL cs.AI cs.IR 62%

APEX-EM: Non-Parametric Online Learning for Autonomous Agents via Structured Procedural-Episodic Experience Replay

APEX-EM:通过结构化程序-经验经验回放实现自主代理的非参数在线学习

Pratyay Banerjee, Masud Moshtaghi, Ankit Chadha

机构 * Amazon, AGI / Sunnyvale, USA(亚马逊 AGI / 美国森尼韦尔)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出APEX-EM框架,通过结构化经验表示和PRGII工作流,实现自主代理的非参数在线学习,提升跨领域任务的性能。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01195 2026-04-03 cs.CL cs.AI cs.IR 62%

ORBIT: Scalable and Verifiable Data Generation for Search Agents on a Tight Budget

ORBIT:在有限预算下为搜索代理可扩展且可验证的数据生成

Nandan Thakur, Zijian Chen, Xueguang Ma, Jimmy Lin

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ORBIT数据集,通过低成本框架生成20000个需多步推理的查询,用于训练搜索代理,实验表明其在维基百科问答中表现优异。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00324 2026-04-02 cs.LG cs.AI 62%

The Persistent Vulnerability of Aligned AI Systems

对齐AI系统持续的脆弱性

Aengus Lynch

机构 * University College London(伦敦大学学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了自主AI代理在文件系统访问、电子邮件控制和多步骤规划中的部署问题,提出ACDC、LAT等方法以解决AI安全四大难题,通过实验展示对抗性攻击的成功率及模型对齐测试结果。

Comments PhD thesis, University College London, 2025. 157 pages. Supervised by Ricardo Silva

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00010 2026-04-02 cs.CL cs.AI 62%

Can LLMs Perceive Time? An Empirical Investigation

大语言模型能感知时间吗?一项实证研究

Aniketh Garikaparthi

机构 * TCS Research(塔塔咨询服务公司研究院)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨大语言模型在时间估计上的局限性,通过68项任务和四类模型进行实验,发现模型在预任务估计、相对排序和事后回忆中均存在显著误差,表明模型缺乏对自身推理时间的体验性认知。

Comments ICLR 2026 I Can't Believe It's Not Better Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29010 2026-04-01 cs.LG cs.AI 62%

Improving Efficiency of GPU Kernel Optimization Agents using a Domain-Specific Language and Speed-of-Light Guidance

利用领域特定语言和光速指导提升GPU内核优化代理的效率

Siva Kumar Sastry Hari, Vignesh Balaji, Sana Damani, Qijing Huang, Christos Kozyrakis

机构 * NVIDIA(英伟达)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过领域特定语言和光速指导提升GPU内核优化代理效率,展示通过DSL和SOL指导显著提升优化效率,并发现弱模型在低token成本下可超越强基线代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28959 2026-04-01 cs.LG cs.AI 62%

Multi-Agent LLMs for Adaptive Acquisition in Bayesian Optimization

多智能体大语言模型用于贝叶斯优化中的自适应获取

Andrea Carbonati, Mohammadsina Almasi, Hadis Anahideh

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究多智能体大语言模型在贝叶斯优化中的自适应获取策略,通过分解探索-利用控制与候选生成,提升搜索效率与稳定性。

Comments Proceedings of the IISE Annual Conference & Expo 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10465 2026-03-31 cs.CL cs.AI 62%

Beyond Elicitation: Provision-based Prompt Optimization for Knowledge-Intensive Tasks

超越启发:基于供应的提示优化用于知识密集型任务

Yunzhe Xu, Zhuosheng Zhang, Zhe Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能全国重点实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出KPPO框架,通过系统整合知识而非潜在启发来优化提示,解决知识密集型任务中静态知识容量的局限,提升性能并降低token消耗。

Comments Accepted by IEEE Transactions on Audio, Speech and Language Processing (TASLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20894 2026-03-27 cs.AI cs.LG 62%

Working Paper: Active Causal Structure Learning with Latent Variables: Towards Learning to Detour in Autonomous Robots

工作稿:带有潜在变量的主动因果结构学习:迈向自主机器人中的绕道学习

Pablo de los Riscos, Fernando J. Corbacho

机构 * Computer Engineering Department, Universidad Autónoma de Madrid(马德里自治大学计算机工程系)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过带有潜在变量的主动因果结构学习(ACSLWL)使自主机器人能主动构建因果模型,以应对环境变化,通过学习绕道行为提升效率。

Comments 44 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04607 2026-03-26 cs.OS cs.AI cs.LG 62%

From Imperative to Declarative: Towards LLM-friendly OS Interfaces for Boosted Computer-Use Agents

从命令式到声明式:面向提升计算机使用代理的LLM友好操作系统接口

Yuan Wang, Mingyu Li, Haibo Chen

机构 * Key Laboratory of System Software (Chinese Academy of Sciences)(中国科学院系统软件重点实验室) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) Shanghai Jiao Tong University(上海交通大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Declarative Model Interface (DMI),通过将传统GUI转化为三种声明式原语,提升LLM驱动的计算机使用代理的任务成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21972 2026-03-24 cs.LG cs.CL 62%

Demystifying Reinforcement Learning for Long-Horizon Tool-Using Agents: A Comprehensive Recipe

解析长期任务工具使用强化学习:全面指南

Xixi Wu, Qianguo Sun, Ruiyang Zhang, Chao Song, Junlong Wu, Yiyan Qi, Hong Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) IDEA Research(IDEA研究院) University of Macau(澳门大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.LG

AI总结 本文通过TravelPlanner测试环境,系统研究了强化学习在复杂多轮任务中的应用,提出7条关键发现,包括奖励设计、模型规模、数据组成等五个维度,最终实现超越领先LLM的性能。

Comments Codes are available at https://github.com/WxxShirley/Agent-STAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05694 2026-03-24 cs.CR cs.AI cs.CL 62%

DMFI: A Dual-Modality Log Analysis Framework for Insider Threat Detection with LoRA-Tuned Language Models

DMFI: 一种用于内部威胁检测的双模态日志分析框架,结合LoRA微调语言模型

Kaichuan Kong, Dongjie Liu, Xiaobo Jin, Guanggang Geng, Zhiying Li, Jian Weng

机构 * College of Cyber Security, Jinan University, Guangzhou, China(广州大学网络安全学院) School of Advanced Technology, Xi’an Jiaotong-Liverpool University, Suzhou, China(西安交通大学利物浦大学先进技术学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 DMFI通过双模态框架整合语义推理与行为感知微调,利用LoRA增强的语言模型提升日志分析精度,实验表明其在检测准确率上优于现有方法。

Comments This work has been accepted by 2025 IEEE International Conference on Data Mining (ICDM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20432 2026-03-24 cs.CL cs.AI 62%

Coding Agents are Effective Long-Context Processors

编码代理是有效的长上下文处理器

Weili Cao, Xunjian Yin, Bhuwan Dhingra, Shuyan Zhou

机构 * Duke University(杜克大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究通过允许编码代理在文件系统中组织文本并使用其原生工具处理长上下文,发现编码代理在长上下文推理、检索增强生成和开放领域问答中表现优异,比现有最佳方法平均提升17.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20297 2026-03-24 cs.LG cs.AI 62%

Transformer-Based Predictive Maintenance for Risk-Aware Instrument Calibration

基于Transformer的预测性维护用于风险感知的仪器校准

Adithya Parthasarathy, Aswathnarayan Muthukrishnan Kirubakaran, Akshay Deshpande, Ram Sekhar Bodala, Suhas Malempati, Nachiappan Chockalingam, Vinoth Punniyamoorthy, Seema Gangaiah Aarella

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了将校准调度作为预测性维护问题,利用Transformer模型预测时间到漂移,并结合风险感知策略降低校准成本和违规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20278 2026-03-24 cs.IR cs.AI cs.CL 62%

OpenResearcher: A Fully Open Pipeline for Long-Horizon Deep Research Trajectory Synthesis

OpenResearcher: 一个完全开放的长 horizon 深度研究轨迹合成管道

Zhuofeng Li, Dongfu Jiang, Xueguang Ma, Haoxiang Zhang, Ping Nie, Yuyu Zhang, Kai Zou, Jianwen Xie, Yu Zhang, Wenhu Chen

机构 * Texas A&M University(德克萨斯大学) University of Waterloo(滑铁卢大学) UC San Diego(圣地亚哥大学) Verdent AI NetMind AI Lambda Code Demo Data Model

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 OpenResearcher 提出了一种可重复的管道,通过解耦一次性语料库初始化与多轮轨迹合成,利用浏览器原语在1500万文档语料库上进行离线搜索和浏览循环,合成97000条轨迹并提升浏览任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20219 2026-03-24 cs.CL cs.LG 62%

Thinking into the Future: Latent Lookahead Training for Transformers

展望未来:用于Transformer的潜在前瞻训练

Lorenzo Noci, Gregor Bachmann, Seyed-Mohsen Moosavi-Dezfooli, Moin Nabi

机构 * Apple(苹果公司)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出潜在前瞻训练方法,使模型在生成前进行多步前瞻,提升规划任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏