Creative Quality Alignment: Expert Tacit Knowledge Transfer via Chain-of-Thought Fine-Tuning
创意质量对齐:通过思维链微调实现专家隐性知识迁移
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过低数据成本和小基模型的严格工程条件,实证验证了校准惊喜中的创意质量度量,并发现数据偏差,提出创意质量对齐方法及理论解释。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
创意质量对齐:通过思维链微调实现专家隐性知识迁移
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过低数据成本和小基模型的严格工程条件,实证验证了校准惊喜中的创意质量度量,并发现数据偏差,提出创意质量对齐方法及理论解释。
通过反事实推理路径减少信用分配方差
机构 * Alibaba Group(阿里巴巴集团) ; Tsinghua University(清华大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出反事实比较框架,通过采样多条推理轨迹并利用差异隐式估计过程级优势,将稀疏终端奖励转化为步骤敏感信号,从而改进大语言模型多步推理的信用分配,并引入隐式行为策略优化(IBPO)提升训练稳定性和性能上限。
因果舌结:LLMs 能编码因果方向,但其是/否输出无法表达
机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究发现大语言模型在因果问题上存在内部编码与输出不匹配的现象,通过线性探针可从隐藏状态恢复证据支持的答案(准确率约0.97),但口头是/否回答却退化为常识答案(准确率约0.5),揭示了约+0.5的差距,称为“因果舌结”。
DVAO: 面向多奖励强化学习的动态方差自适应优势优化
机构 * Alibaba Cloud Computing(阿里巴巴云 computing)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 针对多奖励强化学习中奖励组合导致训练不稳定、优势组合依赖静态超参数的问题,提出动态方差自适应优势优化方法,通过基于经验奖励方差动态调整组合权重,实现稳定训练与多目标帕累托前沿优化。
特征相似性:迈向对Transformer中类比推理的理论理解
机构 * Department of Information Engineering, The Chinese University of Hong Kong, Hong Kong(香港中文大学信息工程系)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文通过最小化Transformer抽象模型,从理论上证明联合训练和特定课程顺序能使实体在表示空间中对齐,从而通过特征相似性实现属性转移,即类比推理。
上下文展开赌博机:面向可验证奖励的强化学习
机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) ; School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; Huawei(华为)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对RLVR中展开使用无差别、短视导致的问题,提出上下文赌博机框架,自适应选择高价值展开,提升训练效率与性能。
文本上的联邦:多智能体推理的洞察共享
机构 * University of Chicago(芝加哥大学) ; Google DeepMind(谷歌DeepMind)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 提出一种类似联邦学习的框架FoT,通过迭代聚合多个客户端的本地推理过程,构建跨任务元认知洞察库,无需共享问题实例或任务指令,显著提升推理效果和效率。
Comments 46 pages
分布式部分信息谜题:在认知不对称下检验共同基础的构建
机构 * Brandeis University(布兰迪斯大学) ; Colorado State University(科罗拉多州立大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出分布式部分信息谜题(DPIP)任务,收集多模态数据集,并评估大语言模型与动态认知逻辑方法在追踪信念状态和共同基础构建上的表现。
Comments 10 pages, 4 figures
Journal ref Proceedings of COLING-LREC 2026
SentGraph: 用于多跳检索增强问答的层次化句子图
机构 * University of Science and Technology of China(中国科学技术大学) ; Hefei University of Technology(合肥工业大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出SentGraph,一种句子级图RAG框架,通过构建层次化句子图并建模细粒度逻辑关系,解决多跳问答中证据链不完整的问题。
深度研究的交互式范式
机构 * Adobe Research(Adobe研究院) ; Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出SteER框架,通过可解释的中间过程控制、成本效益决策和实时用户模型,在深度研究中实现用户对齐,性能优于现有基线。
IVR-R1:通过强化学习中的迭代视觉基础推理优化轨迹
机构 * Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) ; School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; Kuaishou Technology(快手科技) ; Shenzhen Institute of Advanced Integration Technology, Shenzhen(深圳先进集成技术研究院)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出IVR-R1框架,利用奖励驱动的筛选机制和迭代再推理循环,在强化学习中动态校正多模态推理轨迹,以解决视觉幻觉和逻辑错误问题。
捕捉正确答案陷阱:分析学生推理时AI导师盲点的特征化
机构 * Department of Computer Science, University College London, UK(英国伦敦大学学院计算机科学系) ; Centre for Artificial Intelligence, University College London, UK(英国伦敦大学学院人工智能中心)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过分析Eedi数学平台的学生回答,发现智能辅导系统在评估学生推理时存在“正确答案陷阱”,即当学生通过错误推理得出正确答案时,系统难以检测其误解,并比较了微调T5与大型语言模型的检测性能。
Comments To be published at the International Conference on Artificial Intelligence in Education (AIED'26)
序列级奖励的组内学习设计条件:令牌梯度消除
机构 * Alibaba Group(阿里巴巴集团) ; Tsinghua University(清华大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对大语言模型多步推理中稀疏终端奖励导致的信用分配问题,提出反事实比较框架和隐式行为策略优化(IBPO),通过轨迹差异近似替代决策,将稀疏奖励转化为步骤敏感信号,提升训练稳定性和推理性能。
VeriTrace:深度研究智能体的心智模型演化
机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) ; TUM School of Management, Technical University of Munich(慕尼黑技术大学管理学院) ; The Alan Turing Institute(艾伦·图灵研究所)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 针对深度研究智能体面临的信息不确定性,提出VeriTrace认知图框架,通过显式反馈循环(解释更新、偏差反馈、模式修正)来演化心智模型,在DeepResearch Bench和DeepConsult上取得显著提升。
通过电路引导的内外不一致性检测不忠实的思维链
机构 * Jilin University(吉林大学) ; University of Central Florida(中央佛罗里达大学) ; Arizona State University(亚利桑那州立大学) ; University of Vienna(维也纳大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出CIE-Scorer框架,通过追踪句子级电路并利用Fused Gromov-Wasserstein距离度量内部与外部推理图的不一致性,实现实例级思维链不忠实检测,在FaithCoT-Bench上取得最优性能并降低电路构建成本。
StructBreak: 多模态大语言模型中结构性认知过载引发的安全故障
机构 * Key Laboratory of Trustworthy Distributed Computing and Service (MoE), Beijing University of Posts and Telecommunications(可信分布式计算与服务重点实验室(MoE),北京邮电大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出StructBreak框架,通过量化结构性认知过载(SCO)揭示一种高阶认知过载攻击范式,在六种主流MLLM上实现92%平均攻击成功率,并证明该攻击通过结构性通道绕过安全过滤器。
Comments 23 pages; accepted to Findings of ACL 2026. This paper contains examples of harmful content
CRPO:以角色为中心的群体相对策略优化用于角色扮演代理中的角色感知推理
机构 * Institute of Computing and Intelligence(计算与智能研究院) ; Harbin Institute of Technology(哈尔滨工业大学) ; Shenzhen Loop Area Institute (SLAI)(深圳Loop区研究院) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出CRPO框架,通过解耦任务逻辑与风格奖励、动态调整优化约束和利用通用响应作为负基线,解决强化学习在角色扮演中角色保真度下降和风格崩溃问题。
DUEL: 用于多模态推理的对抗性自我对弈
机构 * Meta AI
专题命中 推理与问题求解 :language model(abstract);post-training(abstract);分类 cs.CL
AI总结 提出DUEL框架,通过对抗性自我对弈从预训练VLM生成监督信号,结合长度归一化对数似然奖励,无需人工标注即可提升视觉推理与判别能力。
基于可学习文本反馈的强化学习:一种双层方法
机构 * University of Central Florida(佛罗里达中央大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.LG
AI总结 针对稀疏奖励导致样本效率低的问题,提出一种双层优化框架Bi-NAC,联合训练评论家生成可改善策略的文本反馈和演员利用该反馈,在MATH-500等任务上提升了样本和参数效率。
使用过程挖掘奖励推理的结构符合性
机构 * Dept. of Industrial Engineering(工业工程系) ; Pusan National University(釜山国立大学) ; Dept. of Data Science(数据科学系) ; Changwon National University(昌原国立大学)
专题命中 推理与问题求解 :language model(abstract);post-training(abstract);分类 cs.AI
AI总结 提出TACReward奖励模型,利用过程挖掘技术聚合推理步骤的结构偏差,以改进稀疏奖励策略梯度方法在数学推理任务中的性能。
LLMs 未显示出个体化元认知的迹象
机构 * Pareto AI
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 通过因素分析和校准方法,研究20个前沿大语言模型在六个基准上的置信度判断,发现模型间置信度差异主要由共享的难度因子和决策阈值决定,而非个体化元认知,数学推理中的表面例外实为混淆效应。
智能体技能形式化验证方法:面向可机械检查的能力包含证明的三层架构
机构 * Metere Consulting, LLC(梅特尔咨询公司)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出三层可组合方法(静态抽象解释、精炼类型系统、SMT有界模型检测),将智能体技能从声明或测试级别提升至形式化验证级别,实现机械可检查的能力包含证明。
VineLM: 基于Trie的细粒度控制用于智能体工作流
机构 * Columbia University(哥伦比亚大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出VineLM工作流管理器,通过Trie结构动态选择每个阶段调用的模型,在请求级目标下优化成本-延迟-准确率边界,稀疏分析减少离线分析成本98-99.8%。
扩展基于自然语言图结构的测试时计算用于自动定理证明
机构 * Boston University ; Provadis School of International Management \& Technology ; Duke University ; Algoverse AI Research
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出KG-prover框架,利用从权威数学文本挖掘的知识图谱增强通用大语言模型,通过扩展图结构的测试时计算显著提升自动定理证明性能。
Comments Accepted to ICML AI4Math Workshop 2025, NAACL SRW 2025
开放词汇时空语义表示的组合语义
机构 * Graduate School of Informatics, Nagoya University(名古屋大学信息学研究科) ; Ludolab ; TIER IV
专题命中 推理与问题求解 :LLM(abstract_cn);language model(abstract);分类 cs.LG
AI总结 提出潜在组合语义嵌入z*作为可查询时空语义记忆的知识表示,证明其存在性、最优性及可发现性,并引入充分相似性推理方法提升重叠语义推理性能。
Comments Preprint
PlanRAG-Audio:面向长音频理解的规划与检索增强生成
专题命中 推理与问题求解 :large language model(abstract);language model(abstract)
AI总结 提出PlanRAG-Audio框架,通过规划查询所需模态和时间跨度并仅检索相关信息,实现长音频的高效推理,提升准确率并稳定性能。
Comments Accepted to Findings of ACL 2026
FreeRet: 无需训练的多模态大语言模型检索器
机构 * Nanjing University(南京大学) ; Shanghai AI Lab(上海人工智能实验室) ; Shanghai Jiaotong University(上海交通大学) ; Institute of Science Tokyo(东京科学研究院) ; Zhejiang University(浙江大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract)
AI总结 提出FreeRet框架,将现成的多模态大语言模型转化为无需额外训练的两阶段检索器,通过语义嵌入和重排序提升检索性能。
Comments ICML 2026
人类无法检测AI生成的媒体,但社区可能可以——目前:Reddit上r/RealOrAI中的协作AI检测
专题命中 推理与问题求解 :LLM(abstract,abstract_cn)
AI总结 通过分析Reddit社区r/RealOrAI一年的活动,研究人类协作检测AI生成媒体的行为,发现社区检测准确率达72%但存在系统性假阳性偏差,且感知特征主导推理,而来源验证虽少但通过聚合被放大4.3倍。
隐藏以引导:通过语义掩码学习
机构 * MIT(麻省理工学院) ; NVIDIA(英伟达)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG
AI总结 提出语义掩码专家策略优化(SMEPO),通过掩码专家轨迹中与奖励相关的语义片段,将困难问题转化为填空过程,提升强化学习在推理密集型任务中的探索效率。
基于不确定性触发的特征路径探索的点击率预测选择性测试时计算扩展
机构 * Alibaba Group(阿里巴巴集团)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG
AI总结 针对点击率预测中训练数据稀疏导致的不确定性,提出无需训练、模型无关的UTTSI框架,通过双信号估计器区分认知不确定性和偶然模糊性,对不确定实例进行自适应特征过滤和随机特征路径探索,在保持最坏延迟不变的情况下实现平均约2.8倍基础模型开销,实验和在线A/B测试均取得显著提升。
Comments 12 pages, 4 Figures, 3 Tables