Forward-Free Diffusion Language Models
无前向过程的扩散语言模型
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL
AI总结 提出FReDA,一种无需人工设计前向过程的扩散语言模型,通过递归分布细化利用模型生成草稿作为隐式中间状态,在推理和编码任务上超越更大模型,并实现1.5-1.8倍加速。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
无前向过程的扩散语言模型
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL
AI总结 提出FReDA,一种无需人工设计前向过程的扩散语言模型,通过递归分布细化利用模型生成草稿作为隐式中间状态,在推理和编码任务上超越更大模型,并实现1.5-1.8倍加速。
指令层级失效之处:诊断与修复推理语言模型的故障
机构 * NVIDIA(英伟达)
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI
AI总结 提出白盒诊断框架,将指令层级失效定位为指令识别、冲突解决和响应实现三个环节,并设计两种免训练自监控机制,将违规率降低81-99%。
解释何时能帮助上下文学习?自然语言解释类型与忠实度的比较研究
机构 * LMU Munich(慕尼黑大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Imperial College London(伦敦帝国学院) ; Technical University of Munich(慕尼黑工业大学) ; MaiNLP lab, CIS, LMU Munich(慕尼黑大学CIS研究所MaiNLP实验室)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI
AI总结 该研究通过在6个基准和4个指令调优模型上的比较评估,探究不同来源与选择方式的自然语言解释对上下文学习下游性能的影响,为实际提示流程中解释的选择和报告提供了见解。
STAIR:用于时间问答中可解释推理的语义-时间自动机
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.AI
AI总结 本文提出STAIR语义-时间自动机,将语义解读与时间推理分离,规则优先设计减少自由推理,在多个时间问答数据集上优于基线,提升了F1值且可解释性更强。
面向高效测试时推理的声明级可靠性评估
机构 * Sina Weibo Inc.(新浪微博公司)
专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI
AI总结 本研究提出无需训练的CLR框架,将测试时计算从解决方案采样重分配至声明级语义证伪,在匹配预算下于四个LLM及四个推理基准上提升了推理性能,减少了标记使用量。
大语言模型的测试时增强:在计算资源匹配时输入多样性优于输出多样性
机构 * Amazon Web Services(亚马逊网络服务)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出测试时增强(TTA),经匹配计算对比发现,中端大语言模型采用语义复述的TTA策略,比自洽性更高效地将计算转化为准确率,每美元准确率约为自洽性的1.8倍。
Comments Published at the COLM 2026 Workshop on Efficient Reasoning
IB-RL:用于策略性对话智能体的孤立双边强化学习
专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对现有RL训练范式的静态对应智能体不匹配问题,提出IB-RL方法,在Vehicle TeleSales和Deal-or-NoDeal任务上较单边RL基线显著提升了策略对未见过对应智能体的泛化能力。
面向多语言数学推理的在线策略增量蒸馏
机构 * NAVER AI Lab(NAVER AI实验室)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.LG
AI总结 本研究针对多语言数学推理任务,提出OPD²方法,实验表明其在韩语、日语上性能提升显著,且能缩小英语与韩语的性能差距,凸显多语言数据的重要性。
Comments 9 pages, 3 figures, 10 tables
面向技能原生的大语言模型:用于基准测试和训练长程推理的技能熵
机构 * Princeton University(普林斯顿大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Toronto(多伦多大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Stanford University(斯坦福大学) ; University of Oxford(牛津大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.LG
AI总结 该研究针对现有基准无法评估LLM跨技能长程推理能力的问题,提出Skill Entropy(技能熵)并构建Skill²-Bench基准,还开发Skill-Entropy RL训练框架,显著提升了Qwen3模型在该基准上的表现。
CURV:通过课程可视化接地推理增强图表理解
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 针对多模态大语言模型视觉接地与推理不足的问题,提出CURV课程学习框架,结合CCQA数据集,在图表问答任务中实现显著性能提升并具备良好泛化性。
MIRROR:从其他视角学习以进行多模态推理
机构 * University of Southern California(南加州大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 研究视觉语言模型在几何问题多模态推理上的不足,构建ODA-Data数据集,提出模态感知互惠推理优化(MIRROR)方法,通过强化学习自我监督,提升多模态推理能力,在相关基准测试中表现更优。
PoTRE:受认知异质性启发的测试时推理
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 研究针对大语言模型复杂推理难题,提出PoTRE异构框架,将推理解耦为四个智能体,经任务自适应聚合层协调,在三个前沿基准测试中评估,在HLE上达最优准确率,以相似或更少令牌提升推理性能。
Comments Accepted at Transactions on Machine Learning Research (TMLR 2026)
Journal ref Transactions on Machine Learning Research, 2026
HyGRL:用于多实体问题的自适应混合图推理
机构 * Beijing Institute of Technology(北京理工大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对多实体组合问题,传统方法有局限。本文提出HyGRL框架,将文本嵌入知识图谱创建异构网络,通过模仿学习和强化学习进行自适应结构归纳推理,实验证明其在答案准确性、推理保真度等方面表现出色,成本低且推理快。
Comments 8 pages
G-SHARE:一种基于指南的人为因素事件诊断结构化推理框架
机构 * Institute of Nuclear and New Energy Technology, Tsinghua University(清华大学核能与新能源技术研究院) ; National Key Laboratory of Human Factors Engineering(人因工程重点实验室) ; Fujian Fuqing Nuclear Power Co., Ltd.(福建福清核电有限公司)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 研究针对核电站人为因素事件诊断问题,提出基于指南的结构化推理框架G-SHARE,将诊断指南转化为多阶段流程,含证据提取等步骤。通过构建数据集评估,其性能显著优于基线,证明了转化专家指南为推理流程对安全关键行业智能分析的价值。
直通式承保中的智能体人工智能与检索增强模型
机构 * Brigham Young University
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究人工智能在精算实践中的应用,开发用于小型商业企业主保单直通式承保的智能体人工智能框架,通过构建实验环境比较三条承保管道,发现智能体系统总体表现最佳,在特定场景中优势明显。
用于推理泛化的几何自蒸馏
机构 * ILLC, University of Amsterdam(阿姆斯特丹大学伊利沙伯格学院) ; ILCC, University of Edinburgh(爱丁堡大学伊利沙伯格中心)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG
AI总结 研究针对大语言模型特权上下文自蒸馏中监督难以信赖、导致分布外推理能力下降的问题,提出几何自蒸馏目标GeoSD,通过Hellinger损失和近端项对抗漂移,提升了模型分布外推理准确率。
TACTIC-KG:面向网络威胁情报知识图谱构建的小型智能体团队
机构 * SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris(SAMOVAR, Telecom SudParis, Institute of Paris Polytechnic)
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究针对网络威胁情报报告构建知识图谱的问题,提出TACTIC-KG框架,将任务分解给模块化专业语言模型智能体,用轻量级模型提升性能并降低成本,实验表明优于整体式模型。
Comments 20 pages, 2 figures, 10 tables
用于探索、提纯和模型合并的频谱重布线
机构 * SIA-Lab of Tsinghua AIR(清华-字节跳动联合研究中心SIA实验室) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 研究强化学习中参数更新瓶颈,提出子空间对齐重布线方法,保留频谱核心去除正交分量,可提纯训练更新、实现模型合并,提升推理和跨域性能,是无训练机制提升性能。
SkillFuzz: 面向开放技能市场中隐式意图发现的技能组合模糊测试
机构 * School of Computer Science and Informatics, University of Liverpool(利物浦大学计算机科学与信息学学院) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出SkillFuzz,首个无需执行的模糊测试方法,通过提取结构化技能契约并利用契约引导的蒙特卡洛树搜索,在开放技能市场中高效发现因技能组合导致的隐式意图,验证了80%以上高风险组合。
Comments Under Review
等等,我公平吗?刻画演绎刻板印象并用 Fair-GCG 缓解它
机构 * University of Michigan(密歇根大学)
专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文识别出大语言模型中的演绎刻板印象失败模式,提供统计解释,并提出推理时注入框架 Fair-GCG 以发现有效短语,提升多个公平性基准的性能。
ReaORE: 基于大推理模型的推理引导渐进式开放关系抽取
机构 * National Institute for Data Science in Health and Medicine, Xiamen University(厦门大学健康医疗大数据国家研究院) ; School of Informatics, Xiamen University(厦门大学信息学院)
专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出ReaORE框架,通过粗到细的关系推理(关系过滤与关系预测)解决开放关系抽取中关系标签生成和易混淆关系区分难题,在数据集上超越现有方法。
MiniOpt: 在有限资源下推理建模与求解通用优化问题
机构 * East China Normal University(华东师范大学) ; AntGroup(蚂蚁集团) ; Southern University of Science and Technology(南方科技大学) ; Nanjing University(南京大学)
专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出MiniOpt强化学习框架,通过“推理-建模-求解”范式,结合层次化奖励函数OptReward和优化导向策略优化,使3B参数模型在多种优化问题上达到强泛化,且训练资源需求低。
Comments 20 pages, 9 figures, 11 tables, project: https://github.com/Hsiang-1/MiniOpt
内在自我纠正何时有效?一项任务敏感分析
机构 * Bar-Ilan University(巴伊兰大学) ; Independent Researcher(独立研究员)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 本研究采用任务敏感视角分析内在自我纠正(SC),发现当任务结构支持验证约束、重新审视推理或提供第二意见时,SC能带来一致性能提升,表明其有效性取决于任务类型。
解码推理型LLM中的隐藏欺骗:用于欺骗审计的激活解释器
机构 * Zhejiang University(浙江大学) ; Griffith University(格里菲斯大学)
专题命中 推理与问题求解 :LLM(title_cn,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出STATEWITNESS,一种通过解码目标模型隐藏状态来生成自然语言查询答案和结构化报告的激活解释器,在欺骗检测中平均AUROC达0.916,优于现有方法。
Comments Under review
探索代码解释器有效推理的外在属性与内在属性
机构 * Vidyasirimedhi Institute of Science and Technology(维达亚希米科技学院) ; Kasetsart University(科琼大学) ; SCB 10X ; King Mongkut’s University of Technology Thonburi(朱拉隆功技术大学泰竹分校) ; Department of Computer Engineering Chulalongkorn Univesity(朱拉隆功大学计算机工程系) ; Cohere ; AI Singapore(AI新加坡)
专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文从外在属性(关键token)和内在属性(代码特定认知行为)两个角度研究代码解释器推理,发现强模型更频繁出现关键token和验证、回溯等行为,并利用这些属性在推理和训练中提升性能。
STRIDE: 通过判别估计进行策略轨迹推理以实现可验证强化学习
机构 * Kean University(基恩大学) ; Case Western Reserve University(凯斯西储大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; The Ohio State University(俄亥俄州立大学) ; Tongji University(同济大学) ; Duke Kunshan University(昆山杜克大学) ; Royal Melbourne Institute of Technology(皇家墨尔本理工大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 提出STRIDE框架,通过对比成功与失败轨迹估计n-gram策略模式的判别偏好,结合推理显著性熵识别关键策略模式,实现细粒度信用分配,提升可验证强化学习的推理性能。
当没有正确答案时:诊断视频理解中多模态大语言模型的缺失答案检测
机构 * Duke University(杜克大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 研究多模态大语言模型在视频理解中检测缺失答案的能力,发现模型倾向于选择干扰项而非识别无正确答案,时间推理任务中问题更严重,链式思维提示虽提升检测率但仍不理想。
Comments Under review
AI4AI-Bench:用于递归自我改进算法设计中大语言模型智能体的基准测试
机构 * Navers Lab(Navers实验室) ; Tsinghua University(清华大学)
专题命中 推理与问题求解 :LLM(title);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出AI4AI-Bench基准测试,测试大语言模型智能体设计训练算法的能力,实验显示现有智能体仅缩小了已有算法与最优值间不到五分之一的差距,发布相关资源供重复测量。
CL4D:用于动态场景视觉-语言推理的对比语言-4D预训练
机构 * University of Moratuwa(莫拉图瓦大学) ; Singapore-MIT Alliance for Research & Technology (SMART) Centre(新加坡-麻省理工研究与技术联盟(SMART)中心) ; Agency for Science, Technology and Research (A*STAR)(新加坡科学、技术与研究局(A*STAR))
专题命中 推理与问题求解 :pretraining(title);language model(abstract)
AI总结 本研究提出CL4D(首个4D视觉编码器)及基于其的4DVLM,在自建DynAction4D数据集上训练,CL4D性能较现有方法提升约16.75%,4DVLM优于Gemini、GPT-5等前沿视频VLM。
Comments Accepted at the 19th European Conference on Computer Vision (ECCV 2026)
PDDL-ART:基于演示的自主符号抽象方法,用于使用视觉语言模型的长时程机器人操纵
机构 * University of Michigan(密歇根大学)
专题命中 推理与问题求解 :language model(title,abstract)
AI总结 PDDL-ART是一种基于VLM的框架,可自主从演示生成PDDL描述,经多阶段校正确保语义对齐,在发动机维护和家庭操纵任务上平均成功率达93.3%,优于基线规划器。