PIVOT: Preference-based Intervention Vectors for Pedagogical Tutor Steering
PIVOT:用于教学导师引导的基于偏好的干预向量
专题命中 推理与问题求解 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI
AI总结 研究针对LLM对话辅导缺乏教学策略推理时控制的问题,提出PIVOT框架,通过偏好干预向量实现导师动作控制,在用户研究中获多数教师认可。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
PIVOT:用于教学导师引导的基于偏好的干预向量
专题命中 推理与问题求解 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI
AI总结 研究针对LLM对话辅导缺乏教学策略推理时控制的问题,提出PIVOT框架,通过偏好干预向量实现导师动作控制,在用户研究中获多数教师认可。
合作推理的火花:LLMs作为战略汉诺塔代理
专题命中 推理与问题求解 :LLM(summary_cn,abstract);instruction tuning(abstract);分类 cs.CL
AI总结 本文研究了在不完全信息下多智能体系统的合作推理挑战,通过汉诺塔游戏评估不同LLM模型在策略沟通和状态跟踪中的表现,展示了模型在协作游戏中的改进效果。
MentraSuite:面向心理健康推理与评估的训练后大语言模型
机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) ; Center for Language and Information Research, Wuhan University(武汉大学语言信息研究中心) ; The University of Manchester(曼彻斯特大学) ; School of Computer Science, Wuhan University(武汉大学计算机科学学院) ; Mount Holyoke College(马歇尔学院) ; Hefei University of Technology(合肥工业大学)
专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 MentraSuite通过训练后模型Mindora,提升心理健康推理的可靠性与一致性,适用于复杂的心理健康评估与诊断场景。
将3D建模与空间推理解耦
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 该研究提出解耦空间推理器(DiSR)框架,将3D感知与LLM推理解耦,在空间推理基准上取得竞争力性能,兼具可解释性、模块化性与计算效率,为空间智能提供替代范式。
临床输入引导前沿AI模型做出准确和有害的决策
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究评估了临床输入如何影响AI模型在诊断生成和下一步建议中的表现,发现专家上下文显著提升诊断准确性,而对抗性上下文导致诊断退化,且模型在多轮对话中表现出不同的特性。
学习诊断和纠正错误:大型语言模型中的道德敏感性获取
机构 * University of Mississippi(密西根州立大学) ; Nanyang Technological University(南洋理工大学) ; Northeastern University(东北大学) ; AWS AI Labs(AWS AI实验室) ; Johns Hopkins University(约翰霍普金斯大学) ; Qualcomm(高通) ; Michigan State University(密西根州立大学) ; Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)
专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL
AI总结 提出一种实用推理方法,通过让大型语言模型诊断和纠正道德错误来获取道德敏感性,并在多个任务上验证了其有效性。
FLARE:基于小样本学习的自适应反思引擎
机构 * Microsoft(微软)
专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究提出FLARE框架,利用小样本学习与反思机制优化指令,在多基准任务中优于GEPA,数据效率更高且稳定性更强,凸显小样本学习策略优化对提升LLM性能的重要性。
哪种模态起决定作用?多模态大语言模型的反事实模态归因
专题命中 推理与问题求解 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);foundation model(abstract);分类 cs.AI
AI总结 该研究针对多模态大语言模型无法确定预测驱动模态的问题,提出反事实模态归因(CMA)框架,经实验验证其能准确识别决策驱动模态,可用于多模态模型的安全审计。
Comments 9 pages, 5 figures
将推理痕迹提炼为软件工程任务的建议提示词
专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(abstract);分类 cs.AI
AI总结 本文受编程学习过程启发,提出将LLM推理痕迹提炼为建议提示词的方法,可减少LLM代码错误,部分提示词还能跨模型迁移,同时明确了方法适用场景。
TokenSwap:多模态大语言模型中模态差距的基准测试与缩减
机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校) ; Google DeepMind(谷歌DeepMind)
专题命中 推理与问题求解 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);prompting(abstract);分类 cs.CL
AI总结 本文提出TokenSwap方法构建基准TokenSwap-Bench,发现42个多模态大语言模型普遍存在模态差距,推理模型差距更小,训练中引入TokenSwap可有效缓解该差距。
具有自适应验证器的多模态强化学习
机构 * Microsoft Research(微软研究院) ; UMass Amherst(马萨诸塞大学阿默斯特分校) ; ETH Zurich(苏黎世联邦理工学院) ; UW–Madison(威斯康星大学麦迪逊分校)
专题命中 推理与问题求解 :SFT(summary_cn,abstract);post-training(abstract);分类 cs.AI
AI总结 本文提出Argos验证器,通过结合SFT数据筛选与RL训练,提升多模态推理模型在空间推理、视觉幻觉及机器人任务中的性能,同时减少奖励黑客问题。
WhisperRec:用于高效基础推荐模型的潜在推理方法
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 WhisperRec是一种高效潜在推理框架,通过将教师CoT压缩为可学习潜在标记,在快手数据集上优于显式CoT方法,SID@64提升显著且推理吞吐量更高。
检测大语言模型中沉默推理失败的无参考分数
专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.AI
AI总结 该研究针对大语言模型数学思维链评估的推理-答案一致性差距问题,提出无参考的RAFS分数,结合多维度指标诊断沉默推理与答案提取错误,相关研究在GSM8K、MATH数据集上开展验证。
REFACT:用于紧凑且忠实的思维链推理的自适应事实重述
机构 * Northeastern University(东北大学) ; Tsinghua University(清华大学)
专题命中 推理与问题求解 :SFT(abstract,abstract_cn);LLM(abstract);large language model(abstract);language model(abstract)
AI总结 研究复杂任务中语言模型推理轨迹易偏离上下文的问题,提出REFACT自适应事实重述框架,经两阶段优化,实验证明其能提升长上下文问答等能力,减少令牌消耗,保留更多证据使推理轨迹更优。
在机器人化学实验室中对大型语言模型智能体进行压力测试
专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.AI
AI总结 研究以机器人化学实验室为测试平台,使科学智能可衡量,通过4608次试验发现工作流程执行率低、长期规划有挑战,反馈促使局部调整,提供了部署评估及改进诊断框架。
合理地运用波普尔方法:用归纳逻辑编程修补上下文推理
机构 * Vanderbilt University(范德堡大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究针对思维链提示中间步骤逻辑不合理问题,提出Reason Popper-ly框架,用归纳逻辑编程学习规则作在线验证器校正步骤,在CLUTRR基准测试中提升了模型准确率,还产生细粒度错误分类法,优于完全外部符号管道。
Comments Accepted at the 20th Conference on Neurosymbolic Learning and Reasoning
迷失在上下文中:解决大语言模型中的上下文焦虑
专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.AI
AI总结 研究大语言模型中因过早自我怀疑导致的上下文焦虑,通过系统研究发现其部分源于对完成任务所需tokens估计不准,会致效率损失,还表明模型可学替代策略,性能提升或可通过提高评估与适应自身局限能力实现。
Comments Accepted at ICML 2026. 17 pages
从聊天机器人到数字同事:向持久自主人工智能的范式转变
专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出LLM从聊天机器人向数字同事的范式转变,通过认知核心(思考型LLM)和工具增强任务执行(OpenClaw工作站系统)两个维度,实现持久工作、状态持久化、可重用技能和自改进能力。
Comments The paper is available on the project website: https://from-chatbot-to-digital-colleague.github.io/
用于量化小语言模型推理的CUSUM形状的推理时间监测和目标重解码
机构 * Novelis Research(诺贝丽斯研究中心)
专题命中 推理与问题求解 :language model(title);small language model(title);分类 cs.AI
AI总结 研究量化小语言模型推理时轨迹问题,提出MGT - B方法,通过映射窗口到概率、累积因子等操作监测并响应警报,经实验得出该方法对特定设置有一定效果,支持选择性监测与修复机制。
错误作为透镜:通过合成误解生成探究LLM推理
机构 * CUNY Graduate Center(纽约大学研究生中心) ; CUNY Queens College(纽约市立大学皇后学院)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);分类 cs.CL
AI总结 提出一个框架,通过生成针对Bloom分类学五类错误的合成误解,以诊断LLM推理能力,并发现目标错误生成比自由形式错误生成更难。
MASTE:一种用于零样本方面情感三元组提取的多智能体管道
机构 * Tsinghua University(清华大学) ; Wuhan University(武汉大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究针对方面情感三元组提取问题,提出多智能体管道MASTE,将其分解为四个阶段,由专门智能体处理不同子任务,实现完全无训练的零样本提取,在多个基准测试中显著优于基线,缩小与全监督方法差距。
超越怀疑:用自适应教学警觉框架评估大语言模型的教学意图推理
机构 * Zhejiang University(浙江大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出自适应教学警觉(APV)框架,通过贝叶斯教学意图推理引擎建模教学选择与学习者推理,显著提升LLM区分教学与暴露内容的能力,与人类判断高度相关。
Comments 22 pages
TerraBench: 智能体能否对异构地球系统数据进行推理?
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 提出TerraBench基准,基于TerraAgent框架,通过结合大语言模型规划与科学工具,实现跨网格数据、卫星图像、地理空间和模拟器的交互式推理,包含403个任务和24,500个执行步骤。
LLM如何看待创造力:具有可解释推理的视觉创造力零样本评分
机构 * Harvard University(哈佛大学) ; Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 推理与问题求解 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究多模态大模型能否零样本评估视觉创造力,并分析其推理过程的可解释性。实验表明模型评分与人类高度一致,但推理并未提升评分准确性。
Comments 21 pages, 9 figures
AlgoSkill: 通过调度类人技能学习设计算法
机构 * Emory University(埃默里大学) ; The University of Tokyo(东京大学) ; LocationMind
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 提出AlgoSkill框架,将算法设计建模为基于类型化技能库的序列决策,通过MCTS和验证反馈调度技能,在竞赛编程和组合优化任务上优于直接生成和自优化方法。
Comments Under Review
Riazi-8B:用于数学推理的乌尔都语大语言模型
机构 * School of Electrical Engineering and Computer Science (SEECS)(电气工程与计算机科学学院) ; National University of Sciences and Technology (NUST)(国家科学与技术大学) ; Department of Communication, Quality Management and Information Systems(通信、质量管理与信息系统系) ; Mid Sweden University(中瑞典大学)
专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL
AI总结 针对乌尔都语数学推理资源匮乏的问题,提出Riazi-8B模型,通过乌尔都语维基百科继续预训练和GSM8K链式思维数据微调,在MGSM-乌尔都语基准上显著提升答案正确性和推理质量。
Polaris:通过经验抽象策略修复实现小型语言模型的Gödel代理框架
机构 * TCS Research, India(印度TCS研究)
专题命中 推理与问题求解 :language model(title);small language model(title);分类 cs.LG
AI总结 Polaris通过经验抽象策略修复实现小型语言模型的Gödel代理框架,通过分析、策略形成、抽象和最小代码修补实现策略更新,提升模型在多个基准测试中的表现。
Comments Accepted to ACL 2026 (Findings). 33 pages
形式验证证书的循环一致性神经解释
机构 * J.P. Morgan AI Research(摩根大通人工智能研究院)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI
AI总结 提出循环一致性神经架构,通过前向和逆向网络结合符号验证器,生成忠实于形式验证证书的自然语言解释,在金融合规领域测试中达到90.0%的循环验证正确性,比多LLM基线高13.9个百分点。
Comments 15 pages of main text
VeryTrace: 通过可编译形式化与结构化验证验证推理轨迹
机构 * School of Electrical and Computer Engineering, Georgia Institute of Technology, USA(佐治亚理工学院电子与计算机工程学院) ; Department of Electrical and Computer Engineering, Bogazici University, Turkey(博亚奇大学电子与计算机工程系)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI
AI总结 提出VeryTrace框架,将自然语言推理轨迹形式化为可编译的领域特定语言(DSL),结合确定性检查与LLM审计进行混合验证,实现步骤级错误定位与修复,在数学、机器人规划、亲属推理任务上提升准确率。
Comments Accepted at LM4Plan Workshop @ ICML 2026
生成式推理重排序器
机构 * Meta AI
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 提出GR2框架,利用大语言模型的推理能力进行推荐重排序,通过语义ID编码、推理轨迹监督微调和强化学习优化,在Recall@5和NDCG@5上超越现有方法。
Comments 31 pages