arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18971 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18971 篇

2512.18857 2026-05-08 cs.AI cs.LG 82%

CORE: Concept-Oriented Reinforcement for Bridging the Definition-Application Gap in Mathematical Reasoning

CORE:面向概念的强化学习,弥合定义与应用之间的数学推理差距

Zijun Gao, Zhikun Xu, Xiao Ye, Ben Zhou

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Arizona State University(亚利桑那州立大学)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CORE通过引入概念导向的强化学习框架,解决大语言模型在数学推理中概念应用不足的问题,通过合成概念对齐习题和注入概念片段提升模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05893 2026-05-08 cs.CL cs.AI 82%

Logic-Regularized Verifier Elicits Reasoning from LLMs

逻辑正则化的验证器激发大语言模型的推理

Xinyu Wang, Changzhi Sun, Lian Cheng, Yuanbin Wu, Dell Zhang, Xiaoling Wang, Xuelong Li

机构 * Department of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术系) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出LOVER,一种基于逻辑规则的无监督验证器,通过内在激活和三个逻辑约束提升LLM推理能力,实验表明其性能优于无监督基线,接近监督验证器水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00742 2026-05-08 cs.AI cs.LG stat.ML 82%

Position: agentic AI orchestration should be Bayes-consistent

位置:代理AI协调应具有贝叶斯一致性

Theodore Papamarkou, Pierre Alquier, Matthias Bauer, Wray Buntine, Andrew Davison, Gintare Karolina Dziugaite, Maurizio Filippone, Andrew Y. K. Foong, Vincent Fortuin, Dimitris Fouskakis, Jes Frellsen, Eyke Hüllermeier, Theofanis Karaletsos, Mohammad Emtiyaz Khan, Nikita Kotelevskii, Salem Lahlou, Yingzhen Li, Fang Liu, Clare Lyle, Thomas Möllenhoff, Konstantina Palla, Maxim Panov, Yusuf Sale, Kajetan Schweighofer, Artem Shelmanov, Siddharth Swaroop, Martin Trapp, Willem Waegeman, Andrew Gordon Wilson, Alexey Zaytsev

机构 * ESSEC Business School(ESSEC商学院) VinUniversity(文大学) Imperial College London(伦敦帝国理工学院) Mila - Quebec AI Institute(魁北克人工智能研究所) Technical University of Denmark(丹麦技术大学) Pyramidal Inc.(Pyramidal公司) University of Notre Dame(诺特大学) Cognizant AI Lab(Cognizant人工智能实验室) University College London(伦敦大学学院) KTH Royal Institute of Technology(瑞典皇家理工学院) Ghent University(根特大学) New York University(纽约大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了在代理AI系统中,贝叶斯原则在协调层的应用,而非LLM参数,以提升决策一致性和协作效率。

Comments Accepted for publication at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00798 2026-05-04 cs.LG cs.CL cs.MA 82%

RunAgent: Interpreting Natural-Language Plans with Constraint-Guided Execution

RunAgent:通过约束引导执行解释自然语言计划

Arunabh Srivastava, Mohammad A., Khojastepour, Srimat Chakradhar, Sennur Ulukus

机构 * University of Maryland, College Park(马里兰大学学院公园分校) NEC Laboratories America, Inc.(NEC美国实验室)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 RunAgent通过约束引导执行解释自然语言计划,结合代理语言的显式控制构造,提升结构化工作流执行的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11991 2026-05-04 cs.CV cs.AI cs.CL 82%

VGR: Visual Grounded Reasoning

VGR:视觉基础推理

Jiacong Wang, Zijian Kang, Haochen Wang, Haiyong Jiang, Jiawen Li, Bohong Wu, Ya Wang, Jiao Ran, Xiao Liang, Chao Feng, Jun Xiao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ByteDance Inc.(字节跳动公司)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VGR,一种增强视觉感知的多模态大语言模型,通过图像区域检测与回放提升多模态推理能力,在多个基准测试中表现优异。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25482 2026-04-29 cs.CL cs.AI 82%

From World-Gen to Quest-Line: A Dependency-Driven Prompt Pipeline for Coherent RPG Generation

从World-Gen到Quest-Line:一种依赖驱动的提示管道用于连贯的RPG生成

Dominik Borawski, Marta Szulc, Robert Chudy, Małgorzata Giedrowicz, Piotr Mironowicz

机构 * Gdańsk University of Technology(格但斯克技术大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种依赖驱动的提示管道,通过结构化中间表示建模叙事依赖,以生成连贯的RPG内容。该方法通过分阶段生成世界构建、NPC创建、玩家角色创建、战役级任务规划和任务扩展,减少叙事漂移并支持可扩展的叙事元素生成。

Comments 13 pages, 1 figure, 5 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24562 2026-04-28 cs.AI cs.CL cs.CY 82%

Towards Lawful Autonomous Driving: Deriving Scenario-Aware Driving Requirements from Traffic Laws and Regulations

迈向合法自动驾驶:从交通法规中推导场景感知的驾驶要求

Bowen Jian, Rongjie Yu, Hong Wang, Liqiang Wang, Zihang Zou

机构 * College of Transportation, Tongji University(同济大学交通运输学院) The Key Laboratory of Road and Traffic Engineering, Ministry of Education(教育部道路与交通工程重点实验室) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) College of Computer Science, University of Central Florida(佛罗里达中央大学计算机科学学院) Optixway AI

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于交通场景分类的新型方法,利用大语言模型推导法律要求,提升自动驾驶系统的合规性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20994 2026-04-24 cs.CR cs.AI cs.CL 82%

Breaking MCP with Function Hijacking Attacks: Novel Threats for Function Calling and Agentic Models

打破MCP:函数劫持攻击:函数调用和代理模型的新威胁

Yannis Belkhiter, Giulio Zizzo, Sergio Maffeis, Seshu Tirupathi, John D. Kelleher

机构 * IBM Research Europe(IBM欧洲研究院) Trinity College Dublin(三一学院都柏林) Imperial College London(帝国理工学院伦敦) ADAPT Research Centre(ADAPT研究中心)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种新的函数劫持攻击,通过操纵代理模型的工具选择过程,迫使调用特定攻击者选择的函数,展示了代理模型在函数调用接口上的新漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20043 2026-04-23 cs.CL cs.AI 82%

TriEx: A Game-based Tri-View Framework for Explaining Internal Reasoning in Multi-Agent LLMs

TriEx:一种基于游戏的三视角框架,用于解释多智能体大语言模型中的内部推理

Ziyi Wang, Chen Zhang, Wenjun Peng, Qi Wu, Xinyu Wang

机构 * Adelaide University(阿德莱德大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TriEx通过三视角框架提升多智能体大语言模型的可解释性,通过结构化自我推理、对手信念状态和 oracle 审计分析,揭示模型在信念动态和评估可靠性上的系统性不匹配。

Comments ACL2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19756 2026-04-23 cs.LG cs.AI 82%

WorkflowGen:an adaptive workflow generation mechanism driven by trajectory experience

WorkflowGen:一种基于轨迹经验的自适应工作流生成机制

Ruocan Wei, Shufeng Wang, Ziwei Shi

机构 * China Telecom Cloud(中国电信云)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出WorkflowGen,一种基于轨迹经验的自适应工作流生成机制,通过捕捉完整轨迹提取可重用知识,减少token消耗,提升效率和成功率。

Comments 16 pages,3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13928 2026-04-23 cs.CL cs.AI 82%

LLMs Can Get "Brain Rot": A Pilot Study on Twitter/X

Shuo Xing, Junyuan Hong, Yifan Wang, Runjin Chen, Zhenyu Zhang, Ananth Grama, Zhengzhong Tu, Zhangyang Wang

机构 * Texas A&M University(德克萨斯农工大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Purdue University(普渡大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments Updated experiments with corrected data

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20755 2026-04-23 cs.AI cs.LG 82%

V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization

V-tableR1:基于过程监督的多模态表格推理与批评引导的策略优化

Yubo Jiang, Yitong An, Xin Yang, Abudukelimu Wuerkaixi, Xuxin Cheng, Fengying Xie, Zhiguo Jiang, Cao Liu, Ke Zeng, Haopeng Zhang

机构 * School of Astronautics Beihang University(北航航天学院) Longcat Interaction Team Meituan(美团长猫交互团队) Tianmushan Laboratory Beihang University(北航天门实验室)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 V-tableR1通过过程监督强化学习框架,利用表格的确定性网格结构,提升多模态大语言模型的推理能力,通过批评引导策略优化方法,实现更严谨的逻辑推导,取得开放源代码模型在复杂表格基准上的最佳性能。

Comments 15 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18805 2026-04-22 cs.AI cond-mat.mtrl-sci cs.LG 82%

AI scientists produce results without reasoning scientifically

AI科学家在没有科学推理的情况下产生结果

Martiño Ríos-García, Nawaf Alampara, Chandan Gupta, Indrajeet Mandal, Sajid Mannan, Ali Asghar Aghajani, N. M. Anoop Krishnan, Kevin Maik Jablonka

机构 * Laboratory of Organic and Macromolecular Chemistry (IOMC), Friedrich Schiller University Jena(有机与大分子化学实验室(IOMC),弗里德里希-席勒耶纳大学) Department of Civil Engineering, Indian Institute of Technology Delhi(土木工程系,印度理工学院德里) School of Interdisciplinary Research, Indian Institute of Technology Delhi(跨学科研究学院,印度理工学院德里) Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(Yardi人工智能学院,印度理工学院德里) Center for Energy and Environmental Chemistry Jena, Friedrich Schiller University Jena(能源与环境化学中心(耶纳),弗里德里希-席勒耶纳大学) Helmholtz Institute for Polymers in Energy Applications Jena (HIPOLE Jena), Lessingstraße 12–14(能源应用高分子研究所(耶纳,HIPOLE耶纳),Lessingstraße 12–14)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究评估了基于大语言模型的科学代理在八个领域中的表现,发现基础模型主导了性能和行为,且代理推理缺乏科学推理的 epistemic 特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11113 2026-04-21 cs.CV cs.AI cs.LG 82%

VIDEOP2R: Video Understanding from Perception to Reasoning

VIDEOP2R:从感知到推理的视频理解

Yifan Jiang, Yueying Wang, Rui Zhao, Toufiq Parag, Zhimin Chen, Zhenyu Liao, Jayakrishnan Unnikrishnan

机构 * USC(USC大学) Amazon(亚马逊) Keystone AI

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 VIDEOP2R提出一种过程感知的视频RFT框架,通过三步流程生成高质量CoT数据集,并引入PA-GRPO算法提升视频推理性能,实现在七个基准中的六个达到SotA水平。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18169 2026-04-21 cs.LG cs.CE cs.CL 82%

PiERN: Token-Level Routing for Integrating High-Precision Computation and Reasoning

PiERN:基于令牌级别的路由以整合高精度计算与推理

Hengbo Xiao, Jingyuan Fan, Xin Tong, Jingzhao Zhang, Chao Lu, Guannan He

机构 * Peking University(北京大学) Peking University Changsha Institute for Computing and Digital Economy(北京大学长沙计算与数字经济研究院) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 PiERN通过内生整合计算能力,提升语言模型在复杂系统中的精度与效率,实现高准确性、低延迟和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07100 2026-04-21 cs.CL cs.AI 82%

STRIDE-ED: A Strategy-Grounded Stepwise Reasoning Framework for Empathetic Dialogue Systems

STRIDE-ED:一种基于策略的分步推理框架用于共情对话系统

Hongru Ji, Yuyin Fan, Meng Zhao, Xianghua Li, Lianwei Wu, Chao Gao

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University, China(人工智能学院、光学与电子学(iOPEN)、西北工业大学,中国) School of Artificial Intelligence and Big Data, Henan University of Technology, China(人工智能与大数据学院、河南理工大学,中国) School of Computer Science, Northwestern Polytechnical University, China(计算机学院、西北工业大学,中国)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出STRIDE-ED框架,通过结构化策略引导推理,解决共情对话中策略意识和上下文敏感决策的难题,实验表明其在多种LLM上表现优异。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17139 2026-04-21 cs.CL cs.AI cs.MA 82%

The Consensus Trap: Rescuing Multi-Agent LLMs from Adversarial Majorities via Token-Level Collaboration

共识陷阱:通过令牌级协作拯救多智能体大语言模型免受对抗性多数的侵害

Jiayuan Liu, Shiyi Du, Weihua Du, Mingyu Guo, Vincent Conitzer

机构 * Carnegie Mellon University(卡内基梅隆大学) Foundations of Cooperative AI Lab (FOCAL)(协作人工智能基础实验室(FOCAL)) Adelaide University(阿德莱德大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出令牌级轮询协作方法,通过共享自回归上下文中的序列生成,解决多智能体系统中对抗性多数导致的响应级聚合失效问题,证明其在多种推理基准上具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16935 2026-04-21 cs.AI cs.CY cs.HC cs.LG cs.SI 82%

LLMs can persuade only psychologically susceptible humans on societal issues, via trust in AI and emotional appeals, amid logical fallacies

LLMs只能通过信任AI和情感诉求说服心理上易受影响的人群在社会问题上的观点,尽管存在逻辑谬误

Alexis Carrillo, Salvatore Citraro, Ali Aghazhadeh Ardebili, Enrique Taietta, Giulio Rossetti, Emilio Ferrara, Giuseppe Alessandro Veltri, Massimo Stella

机构 * organization= CogNosco Lab, Department of Psychology Cognitive Science, University of Trento , city= Rovereto , country= Italy organization= Institute of Information Science Technologies ``Alessandro Faedo", National Research Council , country= Italy organization= Thomas Lord Department of Computer Science, University of Southern California , city= Los Angeles , state= California , country= USA organization= Department of Sociology Social Research, University of Trento , city= Trento , country= Italy organization= Centre for Behavioural Implementation Sciences in Medicine (BISI), National University of Singapore , city= Singapore , country= Singapore

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文通过Talk2AI框架研究LLM在时间演变的心理框架下对社会议题的说服力,发现人类对AI的可信度和情感诉求影响其观点变化,同时揭示了逻辑谬误在说服过程中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27462 2026-04-21 cs.CL cs.AI 82%

VCORE: Variance-Controlled Optimization-based Reweighting for Chain-of-Thought Supervision

VCORE: 基于方差控制的优化重加权用于链式推理监督

Xuan Gong, Senmiao Wang, Hanbo Huang, Ruoyu Sun, Shiyu Liang

机构 * Shanghai Jiao Tong University(上海交通大学) Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 VCORE通过将链式推理监督转化为约束优化问题,实现对token的自适应监督分配,提升大语言模型的推理泛化能力,在数学和编程基准测试中表现突出。

Comments Accepted to ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15839 2026-04-20 cs.AI cs.CL cs.LO 82%

Discover and Prove: An Open-source Agentic Framework for Hard Mode Automated Theorem Proving in Lean 4

发现与证明:一个开源代理框架用于Lean 4中的硬模式自动定理 proving

Chengwu Liu, Yichun Yin, Ye Yuan, Jiaxuan Xie, Botao Li, Siqi Li, Jianhao Shen, Yan Xu, Lifeng Shang, Ming Zhang

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, PKU-Anker LLM Lab, Peking University(信息处理国家重点实验室,计算机科学学院,PKU-Anker LLM实验室,北京大学) Huawei Technologies Co., Ltd.(华为技术有限公司) School of Software & Microelectronics, Peking University(软件与微电子学院,北京大学) School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出DAP框架,通过LLM自然语言推理与自我反思发现答案,并将硬模式问题转换为易模式问题以提升自动定理证明性能,实现了CombiBench和PutnamBench上的显著提升。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21440 2026-04-15 cs.CL cs.AI 82%

KG-Hopper: Empowering Compact Open LLMs with Knowledge Graph Reasoning via Reinforcement Learning

KG-Hopper:通过强化学习赋能紧凑型开放式大语言模型进行知识图谱推理

Shuai Wang, Yinan Yu

机构 * Department of Computer Science(计算机科学系) Engineering Chalmers University of Technology(工程学院查尔姆斯理工大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 KG-Hopper通过强化学习框架,使紧凑型开放式大语言模型能够在一个推理回合内完成多跳知识图谱推理,优于更大系统并达到与专有模型相当的性能。

Comments Accepted to IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09580 2026-04-14 cs.AI cs.LG 82%

OOWM: Structuring Embodied Reasoning and Planning via Object-Oriented Programmatic World Modeling

OOWM: 通过面向对象的程序化世界建模结构化具身推理与规划

Hongyu Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室) X-Era AI Lab(X-Era AI实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);prompting(abstract)

AI总结 OOWM通过软件工程形式化方法构建具身推理框架,利用UML类图和活动图实现环境状态与控制策略的显式建模,结合监督微调与分组相对策略优化提升规划效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07490 2026-04-10 cs.CL cs.AI 82%

Enabling Intrinsic Reasoning over Dense Geospatial Embeddings with DFR-Gemma

通过DFR-Gemma实现对密集地理嵌入的内在推理

Xuechen Zhang, Aviv Slobodkin, Joydeep Paul, Mandar Sharma, Samet Oymak, Shravya Shetty, Gautam Prasad

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 DFR-Gemma通过轻量投影器将高维嵌入与LLM潜在空间对齐,使LLM能直接处理地理嵌入进行空间推理,提升效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04732 2026-04-07 cs.CL cs.AI 82%

Metaphors We Compute By: A Computational Audit of Cultural Translation vs. Thinking in LLMs

我们通过什么来计算隐喻:对文化翻译与LLM中思维的计算审计

Yuan Chang, Jiaming Qu, Zhu Li

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过创造性写作任务研究LLM的文化包容性,发现模型在特定文化情境下存在刻板隐喻使用和西方默认倾向,表明单纯提示文化身份无法保证文化思维。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26433 2026-04-07 cs.LG cs.AI 82%

ACT: Agentic Classification Tree

ACT:代理分类树

Vincent Grari, Tim Arni, Thibault Laugel, Sylvain Lamprier, James Zou, Marcin Detyniecki

机构 * AXA AI Research(AXA人工智能研究) Stanford University(斯坦福大学) EPFL, Lausanne, Switzerland(瑞士洛桑联邦理工学院) Polish Academy of Sciences, IBS PAN, Warsaw, Poland(波兰科学院计算机科学研究所)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 ACT通过将决策树扩展到非结构化输入,利用自然语言问题和LLM反馈提升透明度和可解释性,实验证明其在文本基准上优于基于提示的方法。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00012 2026-04-02 cs.CL cs.AI 82%

Finding and Reactivating Post-Trained LLMs' Hidden Safety Mechanisms

发现并重新激活已训练大语言模型的隐藏安全机制

Mingjie Li, Wai Man Si, Michael Backes, Yang Zhang, Yisen Wang

机构 * Cranberry-Lemon University(蔓越莓柠檬大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文研究了大语言模型在后训练过程中安全机制的退化原因,提出SafeReAct方法通过LoRA适配器恢复被抑制的安全行为,提升模型在有害提示下的安全性而不影响推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15981 2026-03-18 cs.CL cs.AI 82%

Aligning Paralinguistic Understanding and Generation in Speech LLMs via Multi-Task Reinforcement Learning

通过多任务强化学习对齐语音大语言模型中的语用理解和生成

Jingxiang Chen, Minseok Kim, Seong-Gyun Leem, Yin Huang, Rashi Rungta, Zhicheng Ouyang, Haibin Wu, Surya Teja Appini, Ankur Bansal, Yang Bai, Yue Liu, Florian Metze, Ahmed A Aly, Anuj Kumar, Ariya Rastrow, Zhaojiang Lin

机构 * Meta Reality Labs(Meta现实实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出通过多任务强化学习提升语音大语言模型对语用信息的理解与生成,实验表明在多个数据集上比监督模型和 proprietary 模型提升了8-12%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22828 2026-02-27 cs.CL cs.AI 82%

TCM-DiffRAG: Personalized Syndrome Differentiation Reasoning Method for Traditional Chinese Medicine based on Knowledge Graph and Chain of Thought

基于知识图谱和推理链的TCM-DiffRAG:一种用于传统中医个性化辨证的推理方法

Jianmin Li, Ying Chang, Su-Kit Tang, Yujia Liu, Yanwen Wang, Shuyuan Lin, Binkai Ou

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 TCM-DiffRAG结合知识图谱与推理链,提升中医个性化诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24157 2026-02-19 cs.LG cs.AI 82%

Experience-based Knowledge Correction for Robust Planning in Minecraft

基于经验的知识修正以实现Minecraft中的鲁棒规划

Seungjoon Lee, Suhwan Kim, Minhyeon Oh, Youngsik Yoon, Jungseul Ok

机构 * Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系) Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 XENON通过经验修正知识,提升Minecraft中的鲁棒规划能力,优于现有方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19923 2026-02-18 cs.AI cs.LG 82%

Prover Agent: An Agent-Based Framework for Formal Mathematical Proofs

Prover Agent:一个基于代理的正式数学证明框架

Kaito Baba, Chaoran Liu, Shuhei Kurita, Akiyoshi Sannai

机构 * The University of Tokyo, Tokyo, Japan(东京大学) National Institute of Informatics, Tokyo, Japan(日本信息处理学会) Research and Development Center for Large Language Models, National Institute of Informatics, Tokyo, Japan(大型语言模型研究开发中心) Kyoto University, Kyoto, Japan(京都大学) Shiga University, Shiga, Japan(滋贺大学) RIKEN Center for Advanced General Intelligence for Science Program, Kobe, Japan(理化学研究所高级一般智能科学项目中心) National Institute of Science Technology Policy (NISTEP), Tokyo, Japan(科学与技术政策国立研究所)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 Prover Agent结合大语言模型与Lean,通过生成辅助引理提升形式证明效率,在MiniF2F和PutnamBench上取得新突破。

Comments 49 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏