RL for Reasoning by Adaptively Revealing Rationales
通过自适应揭示理由进行强化学习
专题命中 推理与问题求解 :SFT(abstract);分类 cs.AI、cs.LG
AI总结 AdaBack通过自适应揭示部分推理步骤,有效解决长序列依赖任务,超越传统SFT和RL的局限。
Comments 22 pages, 11 figures
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
通过自适应揭示理由进行强化学习
专题命中 推理与问题求解 :SFT(abstract);分类 cs.AI、cs.LG
AI总结 AdaBack通过自适应揭示部分推理步骤,有效解决长序列依赖任务,超越传统SFT和RL的局限。
Comments 22 pages, 11 figures
NFT:在数学推理中连接监督学习与强化学习
机构 * Tsinghua(清华大学) ; NVIDIA ; UIUC(伊利诺伊大学香槟分校) ; Stanford(斯坦福大学)
专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.LG
AI总结 NFT通过监督学习方法实现LLM自主改进,无需外部教师,在数学推理任务中超越传统RL算法。
神经符号技能发现用于条件多级规划
机构 * Department of Computer Science and Technology The University of Cambridge(计算机科学与技术系 剑桥大学) ; Department of Computer Engineering Bogazici University(计算机工程系 boazici大学) ; SISREC Osaka University(Osaka大学SISREC)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种神经符号学习架构,通过少量演示获取可推广的高级符号技能,并在多级规划中实现复杂任务的执行。
Comments 18 pages, 4 figures
草稿式推理:在长链式推理LLM中学习高效推理
机构 * Zhejiang University(浙江大学) ; Tencent(腾讯)
专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL、cs.AI
AI总结 Draft-Thinking通过草稿式推理结构和渐进式课程学习,在长链式推理LLM中实现高效推理,显著降低推理预算并保持性能
通过参数空间噪声学习探索:深入研究可验证奖励的强化学习
机构 * Shanghai Innovation Institute, Shanghai, China(上海创新研究院) ; College of Future Information Technology, Fudan University, Shanghai, China(未来信息科技学院,复旦大学) ; Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室) ; The Chinese University of Hong Kong, Hong Kong, China(香港中文大学)
专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG
AI总结 通过参数空间噪声提升探索能力,PSN-GRPO在多个基准中提升推理能力并超越传统探索方法。
Comments 17 pages, 10 Figures
LaSER: 将显式推理内化到潜在空间以实现密集检索
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高陵人工智能学院) ; Tongyi Lab, Alibaba Group(阿里集团通义实验室)
专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL
AI总结 LaSER通过将显式推理内化到潜在空间,提升密集检索性能,结合推理深度与推理效率。
Comments Under Review
推理还是合理化?在事实验证中的掩码扩散模型中合理化的作用
机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校)
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL
AI总结 研究发现,掩码扩散模型在事实验证中,早期结论易受合理化过程影响,导致准确性下降。
ATLAS:基于人工智能的威胁到断言学习用于片上系统安全验证
机构 * Department of Electrical and Computer Engineering, University of Central Florida(电子与计算机工程系,中央佛罗里达大学) ; Intel Corporation(英特尔公司)
专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI
AI总结 ATLAS通过结合人工智能和形式验证技术,实现了基于漏洞知识的自动化SoC安全验证,提高了安全设计的可靠性。
Comments Accepted at the 63rd Design Automation Conference (DAC 2026), Long Beach, CA, USA (July, 2026)
代理的原子性:揭示、利用和缓解浏览器使用代理中的TOCTOU漏洞
机构 * The Ohio State University(俄亥俄州立大学)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 本文研究了浏览器使用代理中的TOCTOU漏洞,通过实证研究揭示其普遍存在性,并提出基于预执行验证的轻量级缓解方法。
当链式思维帮助何时:马尔可夫视角
机构 * New York University(纽约大学)
专题命中 推理与问题求解 :prompting(abstract);分类 cs.LG
AI总结 本文从马尔可夫视角分析了链式思维在不同任务中的有效性,揭示了转移对齐性是决定CoT效果的关键因素,并通过合成基准验证了理论预测。
方向性推理轨迹变化(DRTC):在推理模型中识别关键轨迹段
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 推理与问题求解 :language model(abstract);分类 cs.LG
AI总结 DRTC通过过程因果方法识别推理模型中的关键轨迹段,揭示特定上下文元素如何引导推理轨迹。
Echo:通过音频交错推理实现高级音频理解
机构 * IIE, Chinese Academy of Sciences(中国科学院信息工程研究所) ; Zhejiang University(浙江大学) ; ByteDance China(字节跳动中国) ; VCIP & TMCC & DISSec, College of Computer Science, Nankai University(VCIP与TMCC与DISSec,南开大学计算机学院) ; School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) ; Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 推理与问题求解 :language model(abstract);分类 cs.LG
AI总结 Echo通过音频交错推理方法,提升音频理解能力,在基准测试中表现出色。
Comments Accepted by ICLR 2026
ChainMPQ: 交错文本图像推理链用于缓解关系幻觉
机构 * University of Queensland(昆士兰大学) ; University of California, Merced(加州大学梅尔德分校) ; Ant Group(蚂蚁集团)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 ChainMPQ通过交错文本和图像推理链,利用积累的记忆减少大型视觉语言模型的关系幻觉,提升关系推理能力。
Comments Accepted by ICLR2026
SpinBench:通过视角与旋转透视视角在视觉语言模型中的空间推理
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 SpinBench通过视角与旋转视角评估视觉语言模型的空间推理能力,揭示其在视角转换任务中的系统性弱点及改进潜力。
Comments ICLR 2026
ACPBench Hard: 关于行动、变化和规划的无约束推理
机构 * IBM Research San Jose(IBM桑 Jose 研究所) ; IBM Thomas J. Watson Research Center(IBM 托马斯·J·沃森研究中心)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 ACPBench Hard通过开放性问题测试模型在行动、变化和规划上的推理能力,发现现有模型在复杂任务上表现有限。
Comments Accepted at Proceedings of the Fourteenth International Conference on Learning Representations (ICLR 2026), see https://openreview.net/forum?id=WIXohR7mEo
SToLa:具有触觉常识推理的自适应触觉-语言框架在开放性场景中
专题命中 推理与问题求解 :language model(abstract)
AI总结 SToLa通过专家混合架构实现触觉与语言模态的自适应统一,解决开放性场景中触觉常识推理的挑战,提升多模态推理性能。
Comments Accepted by AAAI 2026
多模态强化学习中的token感知聚焦
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; The Chinese University of Hong Kong(香港中文大学) ; Nanjing University(南京大学) ; Wuhan University(武汉大学)
专题命中 推理与问题求解 :language model(abstract)
AI总结 本文提出VPPO算法,通过token感知优化提升多模态强化学习的视觉推理能力。
Comments Accepted by ICLR 2026, project page: https://github.com/huaixuheqing/VPPO-RL
DAM-VLA:一种基于动态动作模型的视觉-语言-动作框架,用于机器人操作
机构 * Advanced Research Lab, Samsung R&D Institute China-Beijing (SRCB)(三星研发中心中国北京先进研究实验室) ; Samsung AI Center, DS Division(三星人工智能中心,DS部门) ; Hanyang University ERICA(翰洋大学ERICA)
专题命中 推理与问题求解 :language model(abstract)
AI总结 DAM-VLA提出了一种基于动态动作模型的视觉-语言-动作框架,通过整合视觉语言模型与扩散动作模型,提升机器人在复杂任务中的操作精度和适应性。
Comments Accepted to ICRA2026
极简合规控制
专题命中 推理与问题求解 :language model(abstract)
AI总结 极简合规控制通过仅使用电机电流或电压信号实现无需力传感器的合规控制,适用于多种机器人和规划方法。
Comments Project website: https://minimalist-compliance-control.github.io/
基于图的SDN配置代码合成
专题命中 推理与问题求解 :prompting(abstract)
AI总结 GraphCue通过拓扑感知检索和约束条件生成,实现了SDN配置代码合成的高通过率和高效验证。
Comments 2 pages, 2 figures
Journal ref IEEE Consumer Communications & Networking Conference 2026
PanCanBench: 用于评估大型语言模型在胰腺肿瘤学中的综合基准
机构 * Department of Biostatistics, University of Washington(华盛顿大学生物统计学系) ; Clinical Research Division, Fred Hutch Cancer Center(Fred Hutch癌症中心临床研究部) ; Division of Hematology and Oncology, Department of Medicine, University of Washington(华盛顿大学医学系血液学与肿瘤学分会) ; Allen Institute for AI(Allen人工智能研究所) ; Department of Computer Science and Engineering, University of Washington(华盛顿大学计算机科学与工程系) ; Public Health Sciences, Biostatistics, Fred Hutchinson Cancer Center(Fred Hutchinson癌症中心公共卫生科学与生物统计学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 PanCanBench通过评估22种LLM在胰腺肿瘤学问题上的表现,揭示了模型在事实准确性、临床完整性和网络搜索整合方面的差异。
LiveCultureBench: 一种多智能体、多文化的大型语言模型动态社会模拟基准
机构 * Department of Data Science & AI, Monash University(数据科学与人工智能系,墨尔本大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 LiveCultureBench通过模拟动态社会环境,评估大型语言模型在文化规范遵守与任务完成之间的平衡,研究其跨文化鲁棒性和评估可靠性。
利用时间数据库对大语言模型中的事实时间敏感问答进行系统评估
机构 * KAIST(韩国科学技术院) ; William & Mary(威廉与玛丽学院) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
AI总结 TDBench通过时间数据库技术系统构建TSQA对,引入时间准确性指标,实现大语言模型时间敏感问答的可扩展和全面评估。
Comments Published in Proceedings of the 14th International Conference on Learning Representations (ICLR), 2026. Code and data are publicly available at: https://github.com/ssoy0701/tdbench.git
SymGPT:通过结合符号执行与大语言模型审计智能合约
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; University of Connecticut(康涅狄格大学) ; University of California San Diego(加州大学圣地亚哥分校) ; University of Oxford(牛津大学) ; SKLP, Institute of Computing Technology, Chinese Academy of Sciences(SKLP,计算技术研究所,中国科学院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 SymGPT结合符号执行与大语言模型,自动检测智能合约的ERC规则违规,识别出大量潜在安全漏洞。
Comments 34 pages. arXiv admin note: text overlap with arXiv:2404.04306
金融交易中的大语言模型代理:综述
机构 * Columbia University(哥伦比亚大学) ; New York University(纽约大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
AI总结 本文综述了利用大语言模型作为代理进行金融交易的研究,探讨了代理架构、数据输入、回测表现及面临的挑战,并展望了未来研究方向。
Journal ref International Conference on Computers in Management and Business 2026
基于大语言模型的全文语音识别纠错链
机构 * Tencent Ethereal Audio Lab, Tencent, China Center for Speech ; Language Technologies, BNRist, Tsinghua University, China
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
AI总结 本文提出纠错链(CoC)方法,利用大语言模型逐段纠正全文语音识别错误,通过多轮对话和上下文引导提升纠错效果,实验表明其在纠错性能上优于现有系统。
Comments ICASSP 2026
EPPCMinerBen:一种用于通过患者门户评估大语言模型在电子患者-提供者沟通中的新基准
机构 * Department of Emergency Medicine, Yale School of Medicine(耶鲁医学院急诊医学部) ; Cleveland Clinic Lerner College of Medicine of Case Western Reserve University, Cleveland Clinic(克利夫兰医学中心Lerner学院(凯斯西储大学)) ; Medical Oncology, Yale School of Medicine(耶鲁医学院肿瘤学部)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL
AI总结 EPPCMinerBen是一个用于评估大语言模型在电子患者-提供者沟通中表现的新基准,通过患者门户数据验证了大型模型在证据提取和分类任务中的优势。
大语言模型中的结构幻觉:基于网络的对知识组织与引用完整性的评估
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 本文提出基于网络的结构幻觉压力测试,评估大语言模型在知识组织与引用完整性方面的表现,发现其在不同领域存在显著的结构偏差。
视觉-深度研究基准:重新思考多模态大语言模型的视觉和文本搜索
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Vision-DeepResearch基准,通过精心设计的问题评估多模态大语言模型的视觉与文本搜索能力,并引入多轮裁剪搜索流程提升实际检索性能。
LitBench: 一种面向文献任务的图中心大型语言模型基准评估工具
机构 * Yale University(耶鲁大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG
AI总结 LitBench是一种用于评估领域特定文献任务的大型语言模型基准工具,通过生成领域特定的文献子图和任务集,提升模型在文献相关任务中的表现。