arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 19037 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 19037 篇

2412.12152 2026-07-09 cs.LG cs.AI 79%

GraphTool-Instruction: Revolutionizing Graph Reasoning in LLMs through Decomposed Subtask Instruction

GraphTool-Instruction: 通过分解子任务指令革新大语言模型中的图推理

Rongzheng Wang, Shuang Liang, Qizhi Chen, Jiasheng Zhang, Ke Qin

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 GraphTool-Instruction通过分解图推理任务为三个子任务,提升LLMs在图推理中的性能,实现SOTA效果。

Comments 22 pages, have been accepted by KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05001 2026-07-08 cs.CR cs.AI cs.LG cs.MA 新提交 79%

TACTIC-KG: Toward Small Agent Teams for Cyber Threat Intelligence Knowledge Graph Construction

TACTIC-KG:面向网络威胁情报知识图谱构建的小型智能体团队

Mouhamed Amine Bouchiha, Gregory Blanc

机构 * SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris(SAMOVAR, Telecom SudParis, Institute of Paris Polytechnic)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对网络威胁情报报告构建知识图谱的问题,提出TACTIC-KG框架,将任务分解给模块化专业语言模型智能体,用轻量级模型提升性能并降低成本,实验表明优于整体式模型。

Comments 20 pages, 2 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03065 2026-07-07 cs.LG cs.AI 新提交 79%

Spectral Rewiring for Exploration, Purification, and Model Merging

用于探索、提纯和模型合并的频谱重布线

Zhilong Zhang, Hongli Yu, Huan-ang Gao, Hanlin Wu, Yuxuan Song, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou

机构 * SIA-Lab of Tsinghua AIR(清华-字节跳动联合研究中心SIA实验室) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究强化学习中参数更新瓶颈,提出子空间对齐重布线方法,保留频谱核心去除正交分量,可提纯训练更新、实现模型合并,提升推理和跨域性能,是无训练机制提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02345 2026-07-03 cs.SE cs.AI cs.CL 新提交 79%

SkillFuzz: Fuzzing Skill Composition for Implicit Intents Discovery in Open Skill Marketplaces

SkillFuzz: 面向开放技能市场中隐式意图发现的技能组合模糊测试

Jinwei Hu, Yi Dong, Youcheng Sun, Xiaowei Huang

机构 * School of Computer Science and Informatics, University of Liverpool(利物浦大学计算机科学与信息学学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SkillFuzz,首个无需执行的模糊测试方法,通过提取结构化技能契约并利用契约引导的蒙特卡洛树搜索,在开放技能市场中高效发现因技能组合导致的隐式意图,验证了80%以上高风险组合。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00593 2026-07-03 cs.CL cs.AI 版本更新 79%

SPADER: Step-wise Peer Advantage with Diversity-Aware Exploration Rewards for Multi-Answer Question Answering

SPADER: 面向多答案问答的逐步同伴优势与多样性感知探索奖励

Qiming Shi, Zhaolu Kang, Yunfan Zhou, Di Weng, Yingcai Wu

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Software Technology, Zhejiang University(浙江大学软件技术学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出SPADER强化学习框架,通过逐步同伴优势(SPA)机制和多样性感知探索奖励,解决多答案问答中长程工具使用的细粒度信用分配与持续探索问题,实验表明在多个数据集上提升了召回率和F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30989 2026-07-01 cs.CL cs.AI 新提交 79%

Wait, am I Being Fair? Characterizing Deductive Stereotyping and Mitigating It with Fair-GCG

等等,我公平吗?刻画演绎刻板印象并用 Fair-GCG 缓解它

Naihao Deng, Yilun Zhu, Joan Nwatu, Clayton Scott, Rada Mihalcea

机构 * University of Michigan(密歇根大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文识别出大语言模型中的演绎刻板印象失败模式,提供统计解释,并提出推理时注入框架 Fair-GCG 以发现有效短语,提升多个公平性基准的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12277 2026-06-30 cs.CL cs.AI cs.CR 79%

Prompt Injection as Role Confusion

提示注入作为角色混淆

Charles Ye, Jasmine Cui, Dylan Hadfield-Menell

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文通过角色探测和CoT伪造攻击,揭示提示注入源于LLM对文本来源的角色感知混淆,并提出角色混淆程度可预测攻击成功率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26986 2026-06-26 cs.CL cs.AI 新提交 79%

ReaORE: Reasoning-Guided Progressive Open Relation Extraction Empowered by Large Reasoning Models

ReaORE: 基于大推理模型的推理引导渐进式开放关系抽取

Xin Lin, Liang Zhang, Guoqi Ma, Hongyao Tu, Jinsong Su

机构 * National Institute for Data Science in Health and Medicine, Xiamen University(厦门大学健康医疗大数据国家研究院) School of Informatics, Xiamen University(厦门大学信息学院)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出ReaORE框架,通过粗到细的关系推理(关系过滤与关系预测)解决开放关系抽取中关系标签生成和易混淆关系区分难题,在数据集上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25832 2026-06-26 cs.LG cs.AI 新提交 79%

MiniOpt: Reasoning to Model and Solve General Optimization Problems with Limited Resources

MiniOpt: 在有限资源下推理建模与求解通用优化问题

Ke Zhao, Zixiang Di, Hong Qian, Xiang Shu, Yaolin Wen, Qitao Shi, Bingdong Li, Xingyu Lu, Xiangfeng Wang, Jun Zhou, Ke Tang, Yang Yu

机构 * East China Normal University(华东师范大学) AntGroup(蚂蚁集团) Southern University of Science and Technology(南方科技大学) Nanjing University(南京大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MiniOpt强化学习框架,通过“推理-建模-求解”范式,结合层次化奖励函数OptReward和优化导向策略优化,使3B参数模型在多种优化问题上达到强泛化,且训练资源需求低。

Comments 20 pages, 9 figures, 11 tables, project: https://github.com/Hsiang-1/MiniOpt

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23196 2026-06-23 cs.CL cs.AI 新提交 79%

When Does Intrinsic Self-Correction Help? A Task-Sensitive Analysis

内在自我纠正何时有效?一项任务敏感分析

Elroy Stav, Dvir Berlowitz, Maayan Orner, Sarit Kraus

机构 * Bar-Ilan University(巴伊兰大学) Independent Researcher(独立研究员)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究采用任务敏感视角分析内在自我纠正(SC),发现当任务结构支持验证约束、重新审视推理或提供第二意见时,SC能带来一致性能提升,表明其有效性取决于任务类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00658 2026-06-23 cs.CL cs.AI 版本更新 79%

Sarc7: Evaluating Sarcasm Detection and Generation with Seven Types and Emotion-Informed Techniques

Sarc7: 基于七种类型和情感感知技术评估讽刺检测与生成

Raina Gao, Alyssa Jeong, Lang Xiong, Yicheng Fu, Sean O'Brien, Vasu Sharma, Kevin Zhu

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出Sarc7基准,将MUStARD数据集标注为七种讽刺类型,并通过零样本、少样本、思维链及新型情感提示技术进行分类评估,同时开发基于情感的生成方法,实验表明情感提示技术优于其他设置。

Comments Accepted to EMNLP WiNLP and COLM Melt, Solar, PragLM, and Origen

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17478 2026-06-17 cs.CL cs.AI 新提交 79%

Decoding Hidden Deception in Reasoning LLMs: Activation Explainers for Deception Auditing

解码推理型LLM中的隐藏欺骗:用于欺骗审计的激活解释器

Kexin Chen, Yi Liu, Haonan Zhang, Yanhui Li, Xinyu Deng, Dongxia Wang

机构 * Zhejiang University(浙江大学) Griffith University(格里菲斯大学)

专题命中 推理与问题求解 :LLM(title_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出STATEWITNESS,一种通过解码目标模型隐藏状态来生成自然语言查询答案和结构化报告的激活解释器,在欺骗检测中平均AUROC达0.916,优于现有方法。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16934 2026-06-16 cs.CL cs.LG 新提交 79%

Exploring Extrinsic and Intrinsic Properties for Effective Reasoning with Code Interpreter

探索代码解释器有效推理的外在属性与内在属性

Patomporn Payoungkhamdee, Napat Laosaengpha, Jenta Wonglertsakul, Pittawat Taveekitworachai, Pume Tuchinda, Panjapong Poobanchuen, Ekapol Chuangsuwanich, Can Udomcharoenchaikit, Samuel Cahyawijaya, Peerat Limkonchotiwat, Sarana Nutanong

机构 * Vidyasirimedhi Institute of Science and Technology(维达亚希米科技学院) Kasetsart University(科琼大学) SCB 10X King Mongkut’s University of Technology Thonburi(朱拉隆功技术大学泰竹分校) Department of Computer Engineering Chulalongkorn Univesity(朱拉隆功大学计算机工程系) Cohere AI Singapore(AI新加坡)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文从外在属性(关键token)和内在属性(代码特定认知行为)两个角度研究代码解释器推理,发现强模型更频繁出现关键token和验证、回溯等行为,并利用这些属性在推理和训练中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15866 2026-06-16 cs.AI cs.LG 新提交 79%

STRIDE: Strategic Trajectory Reasoning via Discriminative Estimation for Verifiable Reinforcement Learning

STRIDE: 通过判别估计进行策略轨迹推理以实现可验证强化学习

Qinjian Zhao, Zhihao Dou, Dinggen Zhang, Xiangyu Li, Chaoda Song, Zhongwei Wan, Xinpeng Li, Yanyan Zhang, Kaijie Chen, Qingtao Pan, Chengcheng Feng, Zhiqiang Gao, Xiaoyu Xia

机构 * Kean University(基恩大学) Case Western Reserve University(凯斯西储大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) The Ohio State University(俄亥俄州立大学) Tongji University(同济大学) Duke Kunshan University(昆山杜克大学) Royal Melbourne Institute of Technology(皇家墨尔本理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出STRIDE框架,通过对比成功与失败轨迹估计n-gram策略模式的判别偏好,结合推理显著性熵识别关键策略模式,实现细粒度信用分配,提升可验证强化学习的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10967 2026-06-16 cs.LG cs.AI 版本更新 79%

Retro-Expert: Collaborative Reasoning for Interpretable Retrosynthesis

Retro-Expert: 面向可解释逆合成的协同推理

Xinyi Li, Sai Wang, Yutian Lin, Yu Wu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Retro-Expert框架,通过强化学习结合大语言模型与专用模型,实现可解释的逆合成预测,并生成基于化学逻辑的自然语言解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08239 2026-06-09 cs.AI cs.CL cs.CV 新提交 79%

When No Answer Is Correct: Diagnosing Absent Answer Detection for MLLMs in Video Understanding

当没有正确答案时:诊断视频理解中多模态大语言模型的缺失答案检测

Yiheng Wang, Yueqian Lin, Lichen Zhu, Yudong Liu, Hai "Helen" Li, Yiran Chen

机构 * Duke University(杜克大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究多模态大语言模型在视频理解中检测缺失答案的能力,发现模型倾向于选择干扰项而非识别无正确答案,时间推理任务中问题更严重,链式思维提示虽提升检测率但仍不理想。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06260 2026-06-05 cs.IR cs.AI cs.CL 79%

OneReason Technical Report

OneReason 技术报告

OneRec Team, Biao Yang, Boyang Ding, Chenglong Chu, Dunju Zang, Fei Pan, Han Li, Hao Jiang, Honghui Bao, Huanjie Wang, Jian Liang, Jiangxia Cao, Jiao Ou, Jiaxin Deng, Jinghao Zhang, Kun Gai, Lu Ren, Peiru Du, Pengfei Zheng, Rongzhou Zhang, Ruiming Tang, Shiyao Wang, Siyang Mao, Siyuan Lou, Teng Shi, Wei Yuan, Wenlong Xu, Xingchen Liu, Xingmei Wang, Xinqi Jin, Yan Sun, Yan Wang, Yifei Hu, Yingzhi He, Yufei Ye, Yuhao Wang, Yunhao Zhou, Yuqin Dai, Zhao Liu, Zhipeng Wei, Zhixin Ling, Ziming Li, Zixing Zhang, Ziyuan Liu, An Zhang, Changxin Lao, Chaoyi Ma, Chengru Song, Defu Lian, Fan Yang, Guowang Zhang, Hao Peng, Jiayao Shen, Jie Chen, Jun Xu, Junmin Chen, Kun Zhang, Kuo Cai, Mingxing Wen, Minmao Wang, Minxuan Lv, Qi Zhang, Qiang Luo, Sheng Yu, Shijie Li, Shijie Yi, Shuang Yang, Shugui Liu, Shuni Chen, Tinghai Zhang, Tingting Gao, Xiang Wang, Xiangyu Wu, Xiangyu Zhao, Xiao Lv, Xiaoyou Zhou, Xuming Wang, Yong Du, Zejian Zhang, Zhaojie Liu, Zhiyang Zhang, Zhuang Zhuang, Ziqi Wang, Ziyi Zhao

机构 * OneRec Team(OneRec团队)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 针对生成式推荐模型中推理能力难以激活的问题,提出 OneReason 方法,通过增强感知和认知能力实现有效推理。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05315 2026-06-05 cs.CL cs.AI 79%

LoRi: Low-Rank Distillation for Implicit Reasoning

LoRi: 用于隐式推理的低秩蒸馏

Ryan Solgi, Jiayi Tian, Zheng Zhang

机构 * University of California-Santa Barbara(加州大学圣巴巴拉分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出低秩蒸馏框架,通过对齐师生模型在共享低秩张量子空间中的隐状态推理轨迹,提升大型语言模型的隐式思维链推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04632 2026-06-04 cs.LG cs.CL 79%

VentAgent: When LLMs Learn to Breathe -- Multi-Objective Arbitration for ARDS Ventilation

VentAgent:当大语言模型学会呼吸——ARDS通气的多目标仲裁

Teqi Hao, Yuxuan Fu, Xiaoyu Tan, Shaojie Shi, Bohao Lv, Yinghui Xu, Xihe Qiu

机构 * School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(上海工程技术大学电子与电气工程学院) Tencent Youtu Lab(腾讯优图实验室) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出VentAgent分层框架,利用大语言模型作为透明仲裁者,通过感知-规划-编排三阶段将机械通气控制转化为动态多目标仲裁过程,在生理模拟器上优于强化学习和经典控制基线,并提供可解释的推理链。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28829 2026-06-04 cs.CL cs.AI cs.CY 79%

Aryabhata 2: Scaling Reinforcement Learning for Advanced STEM Reasoning

Aryabhata 2:扩展强化学习以提升高级STEM推理能力

Ritvik Rastogi, Vishal Singh, Tejas Chaudhari, Sandeep Varma

机构 * PhysicsWallah

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Aryabhata 2,一个通过强化学习后训练在竞争性STEM考试中提升推理能力的语言模型,在JEE、NEET等基准上超越基础模型且输出token减少高达64%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04944 2026-06-04 cs.CL cs.AI 79%

Inclusion-of-Thoughts: Mitigating Preference Instability via Purifying the Decision Space

包含思维:通过净化决策空间缓解偏好不稳定性

Mohammad Reza Ghasemi Madani, Soyeon Caren Han, Shuo Yang, Jey Han Lau

机构 * School of Computing and Information Systems, The University of Melbourne(计算与信息系统学院,墨尔本大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出包含思维(IoT)策略,通过逐步自过滤干扰选项来重构多选题,从而稳定模型偏好并提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03811 2026-06-03 cs.CR cs.AI cs.LG 79%

AI Agents Enable Adaptive Computer Worms

AI代理实现自适应计算机蠕虫

Jonas Guan, Tom Blanchard, Hanna Foerster, Hengrui Jia, Gabriel Huang, Nicolas Papernot

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) University of Cambridge(剑桥大学) ServiceNow

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究展示了AI代理能够生成针对每个目标的定制攻击策略,利用被感染机器上的大语言模型自我维持并传播,形成自持的AI驱动网络威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24005 2026-06-02 cs.AI cs.CL 79%

LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition

LC-ERD:通过一致性调节奖励分解挖掘潜在逻辑以实现自我进化推理

Yanyu Chen, Jiyue Jiang, Dianzhi Yu, Zheng Wu, Jiahong Liu, Jiaming Han, Xiao Guo, Jinhu Qi, Yu Li, Yifei Zhang, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiaotong University(上海交通大学) Fudan University(复旦大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型推理中高质量过程数据稀缺的问题,提出LC-ERD框架,通过潜在逻辑挖掘和一致性调节的奖励分解,实现自我对齐与推理进化。

Comments Accepted in SIGKDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14405 2026-06-02 cs.LG cs.AI 79%

ES-Merging: Biological MLLM Merging via Embedding Space Signals

ES-Merging: 通过嵌入空间信号进行生物多模态大模型合并

Wonbin Lee, Dongki Kim, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) DeepAuto.ai

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出ES-Merging框架,利用嵌入空间信号估计合并系数,实现生物多模态大模型的高效合并,提升跨模态推理和单模态知识保留能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25842 2026-06-01 cs.AI cs.CL 79%

MuCRASP: Multimodal Chain-of-thought Reasoning aware Structured Pruning

MuCRASP: 多模态思维链推理感知的结构化剪枝

Aritra Dutta, Somak Aditya

机构 * Indian Institute of Technology, Kharagpur(印度理工学院,哈里科普尔)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对视觉语言模型在结构化剪枝后思维链推理准确性下降的问题,提出MuCRASP框架,通过识别推理关键令牌并保持跨模态对齐,在压缩下维持推理质量。

Comments Preprint ver. 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21762 2026-06-01 cs.CL cs.AI 79%

Reasoning-Intensive Regression

推理密集型回归

Diane Tchuindjo, Omar Khattab

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 针对推理密集型回归任务,提出MENTAT方法,结合批量反思提示优化与神经集成学习,在基准测试中相比基线提升高达65%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27824 2026-05-28 cs.AI cs.CL 79%

Revealing Algorithmic Deductive Circuits for Logical Reasoning

揭示逻辑推理的算法演绎电路

Phuong Minh Nguyen, Tien Huu Dang, Naoya Inoue

机构 * Japan Advanced Institute of Science and Technology(日本科学技术先进研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过因果中介分析定位大语言模型中负责逻辑推理步骤的注意力头,发现少量专用头处理事实和规则信息,而高层头促进信息整合和全局推理策略的出现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16312 2026-05-28 cs.CL cs.AI 79%

Teaching and Evaluating LLMs to Reason About Polymer Design Related Tasks

教授和评估LLMs推理聚合物设计相关任务

Dikshya Mohanty, Mohammad Saqib Hasan, Syed Mostofa Monsur, Size Zheng, Benjamin Hsiao, Niranjan Balasubramanian

机构 * Stony Brook University(石溪大学)

专题命中 推理与问题求解 :LLM(summary_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PolyBench基准数据集和知识增强推理蒸馏方法,使中小型语言模型在聚合物设计任务上性能接近前沿闭源LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25864 2026-05-26 cs.LG cs.CL 79%

When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards

当自我信念误导:面向可验证奖励的强化学习的主动标签获取

Li Wang, Xiaodong Lu, Xiaohan Wang, Yikun Ban, Jiajun Chai, Wei Lin, Tianhao Peng, Guojun Yin

机构 * Meituan(美团) Beihang University(北京航空航天大学) Nanyang Technological University(新加坡国立大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出RLAVR框架,通过主动获取少量真实标签并与伪标签结合,利用CAG指标和CARE策略稳定训练并提升有限标注预算下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02837 2026-05-26 cs.AI cs.CL 79%

Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents

超越最终答案:评估工具增强型智能体的推理轨迹

Wonjoong Kim, Sangwu Park, Yeonjun In, Sein Kim, Dongha Lee, Chanyoung Park

机构 * Graduate School of Data Science, KAIST, Daejeon, South Korea(数据科学研究生院,韩国科学技术院,大田,韩国) Department of Industrial and Systems Engineering, KAIST, Daejeon, South Korea(工业与系统工程系,韩国科学技术院,大田,韩国) Department of Artificial Intelligence, Yonsei University, Seoul, South Korea(人工智能系,延世大学,首尔,韩国)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对工具增强型LLM,提出无参考框架TRACE,通过证据库多维度评估推理轨迹的效率、幻觉和适应性,并用元评估数据集验证其有效性。

Comments International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏