arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18857 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18857 篇

2605.12370 2026-05-13 cs.CL cs.IR 86%

Context Convergence Improves Answering Inferential Questions

上下文收敛提升推断性问题的回答

Jamshid Mozafari, Bhawna Piryani, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨了上下文结构和质量对LLM处理推断性问题的影响,发现高收敛性句子构建的上下文能显著提升回答准确率,且按收敛性排序略有提升,表明LLM倾向于优先使用信息丰富的早期提示。

Comments Accepted at SIGIR 2026

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11706 2026-05-13 cs.LG 86%

GRAFT: Graph-Tokenized LLMs for Tool Planning

GRAFT:基于图-令牌的大型语言模型用于工具规划

Xinyi Gao, Xinyu Ren, Junliang Yu, Tong Chen, Quoc Viet Hung Nguyen, Hongzhi Yin

机构 * The University of Queensland(昆士兰大学) Griffith University(格里菲斯大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 GRAFT通过内部化工具图和在线策略工具上下文蒸馏,提升工具规划的依赖意识和准确性,实现更可靠的复杂工作流中的LLM工具规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10247 2026-05-12 cs.LG 86%

Teaching LLMs to See Graphs: Unifying Text and Structural Reasoning

教LLM看见图:统一文本与结构推理

Dario Vajda

机构 * Faculty of Computer and Information Science University of Ljubljana(计算机与信息科学系卢布尔雅纳大学)

专题命中 推理与问题求解 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出GTLM,一种能原生处理图拓扑的新型架构,通过注入图感知注意力偏置,有效消除语义瓶颈,提升图结构数据处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08136 2026-05-12 cs.CL 86%

EconWebArena: Benchmarking Autonomous Agents on Economic Tasks in Realistic Web Environments

EconWebArena:在现实网络环境中评估自主代理在经济任务上的基准测试

Zefang Liu, Yinzhu Quan

机构 * Capital One Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出EconWebArena基准,通过360个精心挑选的任务测试自主代理在经济任务中的能力,强调权威数据源和基于网络的经济推理,评估多种多模态LLM的表现,揭示性能差距和挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09675 2026-05-12 cs.AI cs.MA 86%

CodeClinic: Evaluating Automation of Coding Skills for Clinical Reasoning Agents

CodeClinic:评估临床推理代理的编码技能自动化

Timothy Ossowski, Xinchi Liu, Danyal Maqbool, Vaibhav Dhanuka, Sheng Zhang, Hoifung Poon, Majid Afshar, Tyler Bradshaw, Junjie Hu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CodeClinic通过MIMIC-IV构建基准,评估LLM代理是否能合成和组合可重用的临床技能,而非依赖固定工具库,包含纵向ICU监控和组合信息检索任务,提升多步推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09494 2026-05-12 cs.RO cs.AI 86%

LASSA Architecture-Based Autonomous Fault-Tolerant Control of Unmanned Underwater Vehicles

基于LASSA架构的无人水下车辆自主容错控制

Hong Chen, Zixiang Tang, Yuanbao Chen, Yu Liu

机构 * Wuhan Second Ship Design and Research Institute(武汉第二船舶设计研究所) School of Aeronautic Science and Engineering, Beihang University(北航航空科学与工程学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于LASSA架构的无人水下车辆自主容错控制方法,通过LLM识别未知故障并自主规划任务,结合智能代理感知与决策评估, solver验证物理约束,实现高动态决策与高频控制的双闭环协同控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16310 2026-05-12 cs.SE cs.AI 86%

An Insight into Security Code Review with LLMs: Capabilities, Obstacles, and Influential Factors

通过大语言模型进行安全代码审查的洞察:能力、障碍及影响因素

Jiaxin Yu, Peng Liang, Yujia Fu, Amjed Tahir, Mojtaba Shahin, Chong Wang, Yangxiao Cai

机构 * School of Computer Science, Wuhan University, China(武汉大学计算机科学学院) School of Mathematical and Computational Sciences, Massey University(梅西大学数学与计算科学学院) School of Computing Technologies, RMIT University, Australia(皇家墨尔本理工学院计算技术学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过实证研究探讨大语言模型在安全代码审查中的潜力,比较了七种LLM与静态分析工具的性能,发现LLM在检测安全缺陷方面表现优异,且特定提示策略对性能有显著影响。

Comments 30 pages, 13 images, 10 tables, Manuscript revision submitted to a journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08011 2026-05-11 cs.AI stat.CO 86%

Abductive Reasoning with Probabilistic Commonsense

基于概率常识的归纳推理

Joseph Cotnareanu, Chiara Roverato, Han Zhou, Didier Chetelat, Yingxue Zhang, Mark Coates

机构 * International Laboratory on Learning Systems(学习系统国际实验室) McGill University(麦吉尔大学) Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所) Huawei Noah's Ark Lab(华为诺亚实验室)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PACS算法,通过LLM和形式求解器结合,建模常识认知的个体差异,提升大语言模型的归纳推理能力。

Journal ref Proceedings of the International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07568 2026-05-11 cs.CV cs.CL 86%

Tracing the Arrow of Time: Diagnosing Temporal Information Flow in Video-LLMs

追踪时间之箭:诊断视频大语言模型中的时间信息流

Peitao Han, Fei Cheng, Lis K. Pereira, Qianying Liu, Shigeru Kitazawa

机构 * The University of Osaka(大阪大学) Center for Information and Neural Networks(信息与神经网络中心) National Institute of Information and Communications Technology(信息与通信技术国家研究所) Kyoto University(京都大学) NII LLMC(日本信息处理学会LLMC)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究视频大语言模型(Video-LLMs)中时间信息流的瓶颈问题,通过分析编码器、投影器和LLM的结构,发现视频中心编码器能有效编码时间信息,但投影器设计影响信息传递,改进后模型在时间推理任务中表现显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06269 2026-05-08 q-bio.QM cs.AI 86%

MAT-Cell: A Multi-Agent Tree-Structured Reasoning Framework for Batch-Level Single-Cell Annotation

MAT-Cell: 一种多智能体树状推理框架用于批量单细胞注释

Yehui Yang, Zelin Zang, Xienan Zheng, Yuzhe Jia, Changxi Chi, Jingbo Zhou, Chang Yu, Jinlin Wu, Fuji Yang, Jiebo Luo, Zhen Lei, Stan Z. Li

机构 * Westlake University(西湖大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Center for Artificial Intelligence and Robotics(人工智能与机器人中心) Hong Kong Institute of Science and Innovation(香港科学与创新研究院) Chinese Academy of Sciences(中国科学院) University Key Laboratory of Information and Communication Security Backup and Recovery(信息与通信安全备份与恢复大学重点实验室)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);prompting(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 MAT-Cell通过分离证据基础与标签决策,结合反向验证查询和多轮辩论,提升批量单细胞注释的准确性与可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00297 2026-05-04 cs.CR cs.LG 86%

Trident: Improving Malware Detection with LLMs and Behavioral Features

Trident:利用LLMs和行为特征提升恶意软件检测

Rebecca Saul, Jingzhi Jiang, Elliott Chia, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Trident系统,结合静态特征、行为规则和LLM分析,提升恶意软件检测性能,优于传统方法并具备更强的抗概念漂移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27616 2026-05-01 cs.CL cs.MA 86%

RoadMapper: A Multi-Agent System for Roadmap Generation of Solving Complex Research Problems

RoadMapper: 一个用于解决复杂研究问题的路线图生成的多智能体系统

Jiacheng Liu, Zichen Tang, Zhongjun Yang, Xinyi Hu, Xueyuan Lin, Linwei Jia, Ruofei Bai, Rongjin Li, Shiyao Peng, Haocheng Gao, Haihong E

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) IDEA Research(IDEA研究院) Hithink RoyalFlush Information Network Co., Ltd.(Hithink RoyalFlush信息网络有限公司)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出RoadMapper,一个基于LLM的多智能体系统,通过分解任务生成高质量路线图,提升LLM在复杂问题解决中的性能,效率提升84%。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27311 2026-05-01 cs.SE cs.AI 86%

Pragmos: A Process Agentic Modeling System

Pragmos:一个过程代理建模系统

Pedro-Aarón Hernández-Ávalos, Luciano García-Bañuelos

机构 * Tecnologico de Monterrey(墨西哥技术学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Pragmos系统,通过人机协作的交互流程,利用LLM与领域专家共同构建可解释的过程模型,解决复杂过程建模问题。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26615 2026-04-30 cs.SE cs.AI 86%

TDD Governance for Multi-Agent Code Generation via Prompt Engineering

通过提示工程实现多智能体代码生成的TDD治理

Tarlan Hasanli, Shahbaz Siddeeq, Bishwash Khanal, Pyry Kotilainen, Tommi Mikkonen, Pekka Abrahamsson

机构 * University of Jyväskylä(于韦斯屈莱大学) Tampere University(塔尔基尔大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种AI原生的TDD框架,通过结构化提示和工作流程治理机制将经典TDD原则形式化,提升LLM辅助开发的稳定性与可重复性。

Comments 5 pages. Submitted to the 1st International Workshop on Empirical Prompt Engineering for Software Engineering (PROMPT-SE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15262 2026-04-30 cs.AI 86%

Probe-then-Plan: Environment-Aware Planning for Industrial E-commerce Search

探测-然后规划:面向工业电商搜索的环境感知规划

Mengxiang Chen, Zhouwei Zhai, Jin Li

机构 * JD.com Beijing China(京东北京中国)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出环境感知搜索规划(EASP),通过探测-规划机制解决电商搜索中盲点与延迟的矛盾,通过离线数据合成、规划器训练和在线服务适应性路由提升搜索相关召回率和UCVR、GMV。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22910 2026-04-30 cs.CL 86%

Talent or Luck? Evaluating Attribution Bias in Large Language Models

天赋还是运气?评估大语言模型中的归因偏差

Chahat Raj, Mahika Banerjee, Jinhao Pan, Aylin Caliskan, Antonios Anastasopoulos, Ziwei Zhu

机构 * George Mason University(乔治·马歇尔大学) Thomas Jefferson High School For Science and Technology(托马斯·杰斐逊科学与技术高中) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract_cn);分类 cs.CL

AI总结 研究探讨大语言模型在事件归因中的偏差,提出基于认知的评估框架,识别模型推理差异如何放大群体偏见。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25684 2026-04-29 cs.AI 86%

Think Before You Act -- A Neurocognitive Governance Model for Autonomous AI Agents

在行动前思考--一种用于自主AI代理的神经认知治理模型

Eranga Bandara, Ross Gore, Asanga Gunaratna, Sachini Rajapakse, Isurunima Kularathna, Ravi Mukkamala, Sachin Shetty, Xueping Liang, Amin Hass, Tharaka Hewa, Abdul Rahman, Christopher K. Rhea, Anita H. Clayton, Preston Samuel, Atmaram Yarlagadda

机构 * Old Dominion University(老奥德纳大学) AI Motion Labs(AI运动实验室) Department of Psychiatry and Neurobehavioral Sciences(精神病学与神经行为科学系) University of Virginia School of Medicine(弗吉尼亚大学医学院) Florida International University(佛罗里达国际大学) Accenture Technology Labs(埃森哲技术实验室) Center for Wireless Communications(无线通信中心) University of Oulu(奥卢大学) Blanchfield Army Community Hospital(布莱恩菲尔德陆军社区医院) McDonald Army Health Center(麦克唐纳陆军健康中心)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种神经认知治理框架,通过将人类自我治理过程映射到LLM驱动的代理推理中,实现95%的合规准确率和零人工监督升级,展示嵌入治理的代理推理能产生更一致、可解释和可审计的合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05205 2026-04-29 cs.CL 86%

RELIC: Evaluating Complex Reasoning via the Recognition of Languages In-Context

RELIC:通过上下文语言识别评估复杂推理

Jackson Petty, Michael Y. Hu, Wentao Wang, Shauli Ravfogel, William Merrill, Tal Linzen

机构 * Department of Linguistics(语言学系) Center for Data Science(数据科学中心) New York University(纽约大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RELIC通过评估语言是否属于上下文无关文法生成的语言,衡量LLM的复杂推理能力,发现先进模型在任务复杂度增加时推理计算减少,策略转向猜测。

Comments Accepted to TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15993 2026-04-28 cs.CL 86%

Explaining Puzzle Solutions in Natural Language: An Exploratory Study on 6x6 Sudoku

解释自然语言中的谜题解决方案:对6x6数独的探索性研究

Anirudh Maiya, Razan Alghamdi, Maria Leonor Pacheco, Ashutosh Trivedi, Fabio Somenzi

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究评估了五种LLM在解决和解释6x6数独中的表现,发现尽管部分模型能解决谜题,但无法提供反映战略推理或直观问题解决的解释,凸显了LLM在人机协作决策中需解决的关键挑战。

Comments Accepted to Findings of ACL 2025

Journal ref Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22601 2026-04-27 cs.SE cs.AI 86%

From Natural Language to Verified Code: Toward AI Assisted Problem-to-Code Generation with Dafny-Based Formal Verification

从自然语言到验证代码:迈向借助Dafny基于形式验证的AI辅助问题到代码生成

Md Erfan, Md Kamal Hossain Chowdhury, Ahmed Ryan, Md Rayhanur Rahman

机构 * Department of Computer Science, The University of Alabama(阿拉巴马大学计算机科学系) The University of Alabama(阿拉巴马大学) Alabama Water Institute, The University of Alabama(阿拉巴马水研究院,阿拉巴马大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出NL2VC-60数据集,通过分层提示策略评估不同LLM在形式验证中的表现,发现结构化提示和迭代反馈能显著提升验证成功率,证明开放权重LLM可用于高可靠软件开发。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21187 2026-04-24 math.CO cs.AI 86%

Doubly Saturated Ramsey Graphs: A Case Study in Computer-Assisted Mathematical Discovery

双重饱和的Ramsey图:计算机辅助数学发现的一个案例研究

Benjamin Przybocki, John Mackey, Marijn J. H. Heule, Bernardo Subercaseaux

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过结合SAT求解与定制生成的代码,发现无限多的双重饱和Ramsey图,回答了Grinstead和Roberts在1982年的疑问,并利用LLM生成形式化证明,展示自动化推理、大语言模型和形式验证在数学发现中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03323 2026-04-23 cs.CL 86%

Enhancing Agentic Textual Graph Retrieval with Synthetic Stepwise Supervision

通过合成的分步监督增强代理文本图检索

Ge Chang, Jinbo Su, Jiacheng Liu, Pengfei Yang, Yuhao Shang, Huiwen Zheng, Hongli Ma, Yan Liang, Yuanchun Li, Yunxin Liu

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) Peking University(北京大学) School of Information, Renmin University of China(中国人民大学信息学院) Harbin Institute of Technology(哈尔滨工业大学) North China Electric Power University(华北电力大学) GDS Holdings Limited(GDS控股有限公司)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种基于LLM的文本图检索框架,通过合成分步监督优化检索过程,提升复杂图基问答任务的准确性和F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20564 2026-04-23 cs.CL 86%

Where Reasoning Breaks: Logic-Aware Path Selection by Controlling Logical Connectives in LLMs Reasoning Chains

推理中逻辑的断裂:通过控制LLM推理链中的逻辑连接词进行逻辑感知路径选择

Seunghyun Park, Yuanyuan Lei

机构 * University of Florida(佛罗里达大学)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);preference optimization(abstract);分类 cs.CL

AI总结 本文研究LLM在多步逻辑推导中的脆弱性,提出通过干预逻辑连接词选择来提升推理准确性,采用多层框架优化逻辑关键节点,实现准确率与效率的平衡。

Journal ref 2026 ACL Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15173 2026-04-22 cs.AI 86%

Mind the (DH) Gap! A Contrast in Risky Choices Between Reasoning and Conversational LLMs

注意(DH)差距!理性推理与对话LLM在风险选择中的对比

Luise Ge, Yongyan Zhang, Yevgeniy Vorobeychik

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 推理与问题求解 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过对比推理模型与对话模型在风险决策中的表现,发现前者更理性,后者更接近人类但受因素影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02304 2026-04-22 cs.CL 86%

When Does Verification Pay Off? A Closer Look at LLMs as Solution Verifiers

验证何时有效?对LLM作为解决方案验证器的深入探讨

Jack Lu, Ryan Teehan, Jinran Jin, Mengye Ren

机构 * Agentic Learning AI Lab, New York University(代理学习人工智能实验室,纽约大学)

专题命中 推理与问题求解 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究探讨了在何种条件下验证有效,通过分析37个模型在9个基准测试中的表现,发现跨模型家族验证效果优于自验证,且验证收益随模型相似性增加而降低。

Comments Accepted at ICLR 2026 AI with Recursive Self-Improvement workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10899 2026-04-22 cs.CL cs.LO cs.SE 86%

From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language Models

从证明到程序:刻画大语言模型中的工具诱导推理幻觉

Farima Fatahi Bayat, Pouya Pezeshkpour, Estevam Hruschka

机构 * Megagon Labs(Megagon实验室)

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 研究探讨了工具增强语言模型在使用外部工具时产生的推理幻觉问题,通过PYMATH基准测试发现,尽管工具使用提升了最终答案准确率,但推理过程却愈发不连贯,提出基于偏好优化的框架以改善工具使用下的推理深度。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05498 2026-04-22 cs.AI 86%

GRAIL:Learning to Interact with Large Knowledge Graphs for Retrieval Augmented Reasoning

GRAIL:学习与大规模知识图谱交互以实现检索增强推理

Ge Chang, Jinbo Su, Jiacheng Liu, Pengfei Yang, Yuhao Shang, Huiwen Zheng, Hongli Ma, Yan Liang, Yuanchun Li, Yunxin Liu

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GRAIL通过结合LLM引导的随机探索与路径过滤,建立数据合成管道,学习动态决策策略,提升知识图谱检索的精度与简洁性平衡,实验表明在三个知识图谱问答数据集上准确率和F1值分别提升21.01%和22.43%。

Comments This is a duplicate submission of the article "Enhancing Agentic Textual Graph Retrieval with Synthetic Stepwise Supervision" [arXiv:2510.03323]. The content is identical to the newer version. This entry is being withdrawn to avoid redundancy

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18305 2026-04-21 cs.LG 86%

CAARL: In-Context Learning for Interpretable Co-Evolving Time Series Forecasting

CAARL:基于上下文的学习用于可解释的共演时间序列预测

Etienne Tajeuna, Patrick Asante Owusu, Armelle Brun, Shengrui Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) Anonymous University(匿名大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出CAARL方法,通过分解时间序列为自回归段并构建时序依赖图,利用LLM处理生成可解释的预测路径,实验证明其在真实数据集上的有效性。

Comments Double-columned, 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21094 2026-04-17 cs.CL 86%

ReasonScaffold: A Scaffolded Reasoning-based Annotation Protocol for Human-AI Co-Annotation

ReasonScaffold: 一种基于推理的标注协议用于人机协同标注

Smitha Muthya Sudheendra, Jaideep Srivastava

机构 * University of Minnesota, Twin Cities(明尼苏达大学,双城分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ReasonScaffold协议,通过暴露LLM生成的推理过程来提升标注一致性,发现推理能增加标注者一致性和最小化修订,为人类与AI协同标注提供实用机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18436 2026-04-16 cs.OS cs.AI cs.FL cs.SE 86%

VeruSAGE: A Study of Agent-Based Verification for Rust Systems

VeruSAGE:Rust系统代理验证的研究

Chenyuan Yang, Natalie Neamtu, Chris Hawblitzel, Jacob R. Lorch, Shan Lu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学) Microsoft Research(微软研究院) University of Chicago(芝加哥大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究LLM在Rust系统验证中的能力,提出VeruSAGE-Bench基准测试集,并设计不同代理系统以匹配不同LLM的特性,结果显示最佳组合能完成超过80%的验证任务。

详情

展开后加载摘要…

URL PDF HTML 收藏