VeriSkill: A Self-Evolution Framework for Program Verification Skills
VeriSkill:一种用于程序验证技能的自进化框架
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出专为程序验证设计的自进化框架VeriSkill,可将验证失败归因于技能缺陷并迭代优化技能,实验显示其在多种场景下均优于基线方法。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
VeriSkill:一种用于程序验证技能的自进化框架
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出专为程序验证设计的自进化框架VeriSkill,可将验证失败归因于技能缺陷并迭代优化技能,实验显示其在多种场景下均优于基线方法。
See2Think:多模态模型是否真正利用中间视觉状态?
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出See2Think评估框架,通过See2ThinkBench和VAoT测试多模态模型对中间视觉状态的依赖,发现视觉推理具模型与环境依赖性,准确渲染是瓶颈,受损反馈会使模型准确率降超10个百分点。
Comments 10 pages, 5 figures, and 8 tables
MultivationBench:多模态序列动机推理基准
机构 * The Hong Kong University of Science and Technology(香港科技大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出MultivationBench基准,基于心理学框架评估多模态序列动机推理,发现现有模型难以在序列语境中保持一致的动机推理,暴露了静态识别与动态推理的差距。
Comments 31 pages, including appendices; 6 figures and 22 tables. Code: https://github.com/HKUST-KnowComp/MultivationBench
CaM-Wolf:面向社交推理游戏的因果感知多模态智能体
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Nanyang Technological University(南洋理工大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究针对现有SDG智能体多模态特性缺失的问题,提出首个整合多模态感知生成的CaM-Wolf,经实验验证其游戏性能与交互质量均有提升。
Comments Accepted by ACMMM 2026
视频模型的视觉提示工程
专题命中 推理与问题求解 :language model(abstract);foundation model(abstract);分类 cs.AI
AI总结 研究视频模型能否从视觉提示工程中受益,通过自动修改任务图像提升性能,如视觉物理推理任务。发现视觉提示工程(VIPE)能提高视频推理性能,比传统方法更有效,为提升视频模型视觉推理性能提供简单高效途径。
使用和评估生成式人工智能工具以支持系统文献综述的初步指南
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究探讨如何用GenAI支持系统文献综述,通过快速审查、思想实验等方法,识别评估GenAI用于SLRs的问题及过程要点,形成GUEST建议,助研究人员利用GenAI开展可靠综述与评估研究,强调其需人工监督及能提供成本效益帮助。
Comments 58 pages, 2 figures, 11 tables
AdaKP:面向推理强化学习的在线自适应知识点选择
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对强化学习在竞赛级数学中奖励稀疏问题,提出AdaKP在线自适应知识点选择方法,通过熵代理评分,结合三种机制及验证门,改进标准训练器,在竞赛数学基准上优于静态选择基线。
人工智能在协助物理、天体物理和宇宙学科学研究中的能力II:项目规划与提案评估
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究大语言模型在科学项目规划与提案评估中的作用,人类和三个当代模型生成计划,再由人类与前沿模型盲评,结果显示当前模型能产出类似人工的计划,但人工智能评审员更青睐人工智能生成的提案,部署时需谨慎。
Comments 16 pages, 4 figures
用于多模态推理的离线-在线课程强化学习
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; BUPT Shenzhen Institute(北京邮电大学深圳研究院) ; Carnegie Mellon University(卡内基梅隆大学) ; Lancaster University(兰卡斯特大学) ; Nanyang Technological University(南洋理工大学) ; China Telecom Corporation Limited Sichuan Branch(中国电信股份有限公司四川分公司) ; Changsha University of Science & Technology(长沙理工大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究多模态推理中模型中间步骤有缺陷的问题,提出$O^2$-CritiCuRL框架,通过离线多步展开分析和在线渐进式强化学习策略,区分关键与冗余步骤,提升模型性能及训练和推理效率。
你所需要的只是专注:多智能体图系统的自适应目标感知注意力编排
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究多智能体图系统中注意力分配问题,提出自适应目标感知注意力编排框架AGAO,结合目标、拓扑、资源感知注意力,将静态图转变为自适应系统,经实验验证其能提高任务有效性并减少计算等消耗,确立注意力工程方向。
SymStep:用于逻辑推理的符号步骤验证
机构 * Leuphana University of Lüneburg(吕讷堡莱普芬纳大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.AI
AI总结 研究针对约束密集型逻辑推理任务中思维链提示的不足,提出SymStep方法,通过语言模型分步声明、约束传播器检查一致性等进行推理,在多个逻辑推理任务上表现优异,最小剩余值指导和一致性检查起关键作用。
空间智商:通过分层能力测试解构空间智能
机构 * NVIDIA Research(英伟达研究院) ; Yale University(耶鲁大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对多模态大语言模型空间推理能力不足问题,提出Spatial-IQ分层诊断框架,分解物体计数任务为子任务,生成数据集评估模型,发现模型存在问题,且用思维链监督和强化学习训练可提升模型表现。
SEGRA:用于基于Gremlin的问答的结构化经验引导图推理代理
机构 * University of British Columbia(英属哥伦比亚大学) ; Amazon(亚马逊)
专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.AI
AI总结 针对企业文本到Gremlin问答难题,SEGRA引入经验引导代理,集成多种技术,包括意图路由、查询生成等。在企业IT支持基准测试中成绩出色,平均评判分数大幅提高,技能库还降低了成本,提升了企业图问答的准确性与效率。
生成式人工智能心理健康支持的风险治理:一种多轮安全架构
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对大语言模型用于心理健康支持时缺乏风险治理机制的问题,开发了一种多轮安全架构,结合多种方法用于心理健康交互,经测试在多方面表现良好,能改善模型管理风险方式,提供安全部署框架。
评估大语言模型作为动态系统的可解释控制器
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究探讨大语言模型能否成为动态热环境的可解释控制器,评估五个不同规模模型在多场景下的表现。结果显示控制性能与模型复杂度有关,高复杂度模型表现更佳,整合物理模型可提升性能,还揭示了不同规模模型推理的进展,为混合控制策略提供机会。
DeepLook:通过前瞻进行更深入思考
机构 * Technical University of Munich(慕尼黑工业大学) ; LMU Munich(慕尼黑大学) ; MCML, LMU, MemAgents Lab(慕尼黑大学机器学习中心、记忆代理实验室)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究旨在改进大语言模型推理,提出无需训练的DeepLook框架,通过将前瞻计算集中在不确定性瓶颈处,聚合令牌级置信度为段级信号并排序投票。在四个数学基准测试中,该方法改变准确率与令牌成本的帕累托前沿,提升准确率并减少令牌生成。
用于多模态思维链推理的视觉显著性引导蒸馏
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对多模态思维链推理在小模型中存在的问题,提出视觉显著性引导蒸馏方法,利用多模态大语言模型注意力图生成扰动图像,经奇异值分解提取引导向量指导层间蒸馏,实验证明该方法能改进推理生成和答案推理。
用于SeePhys Pro的多智能体辩论与视觉信息提取:ICML 2026 AI4Math赛道3挑战赛的第一名技术报告
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 针对回答含图像的大学物理问题的SeePhys Pro任务,提出两阶段框架,包括视觉信息提取和多智能体辩论推理阶段,提高了准确率,在挑战赛中获第一名,分析得出编排收益及图形辅助价值与问题图像占比相关的结论。
ToolGuardian:人工智能代理与工具交互的声明式安全
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 研究人工智能代理与工具交互安全问题,提出ToolGuardian框架,通过预准入审查和任务感知运行时授权保障安全,利用渐进式特征化和基于ASP的声明式策略层,实验表明该框架在审查和授权方面性能良好。
用于智能工作流合成的拓扑与执行耦合分层搜索
机构 * Baylor University(贝勒大学) ; NEC Laboratories America(美国NEC实验室) ; University of Arkansas(阿肯色大学) ; Southern Illinois University(南伊利诺伊大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对大语言模型结构化工作流创建自动化难题,提出拓扑与执行耦合的搜索范式,引入HierFlow架构,通过反馈引导拓扑调整与树搜索优化子工作流,经多基准测试验证其性能优于基线,平衡了质量与效率且无需额外训练。
GuardianAgentBench:智能体何处失败及如何防范
机构 * Vectara, Inc.(Vectara公司) ; Anthropic(Anthropic公司) ; OpenAI(OpenAI公司) ; Google DeepMind(谷歌DeepMind) ; DeepSeek-AI(DeepSeek人工智能公司)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究大语言模型智能体安全可靠行为问题,提出GuardianAgentBench基准测试,含多阶段验证和攻击模式。实验发现模型有两种失败模式,性能随工具集和轮次深度下降。护栏实现优于系统提示防御,证明执行时结构干预可提升安全性且不影响正确行为。
多模态CoLRAG-TF:复杂PDF的三重过滤检索
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.LG
AI总结 研究针对异构PDF集合检索增强生成的挑战,提出多模态CoLRAG-TF四轴融合架构,集成多种技术。构建多模态索引,经贝叶斯优化确定融合权重。实验显示其检索召回率高,多跳答案相似性提升显著,还适用于视觉输入,提供通用框架。
Comments 18 pages, 8 tables, 9 figures
优化基于超图的RAG:迈向更好的事实提取和块检索
机构 * Qlik(思略特)
专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.AI
AI总结 研究旨在优化基于超图的RAG,以解决事实提取和块检索问题。方法是采用自一致性提示改进提取,运用个性化PageRank算法增强块检索,贡献在于提升了相关任务的性能。
Comments APIA 2026 conference
Audio-Zero:用于细粒度音频推理的无标签自我进化
专题命中 推理与问题求解 :language model(abstract);post-training(abstract);分类 cs.AI
AI总结 研究针对大型音频语言模型细粒度音频推理难题,提出无标签自我进化框架Audio-Zero,通过构建听觉自博弈游戏,利用无标签音频对比对让模型生成线索并推理,实验证明其能提升细粒度音频推理且保持广泛音频理解。
MeetingToM:在多方会议中对具有心理理论推理能力的多模态大语言模型进行评估
机构 * College of AI, Tsinghua University(清华大学人工智能学院) ; Department of Biostatistics and Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究多方会议中多模态大语言模型的心理理论推理,引入MeetingToM基准,分层评估不同粒度社会行为推理,提供评估协议并分析模型,揭示其在整合线索、推断态度及区分共识方面的局限,为推进多模态模型的会议心理理论推理提供试验台。
揪出搭便车者:基于夏普利值的强化学习并行推理奖励归因
机构 * ShanghaiTech University(上海科技大学) ; City University of Hong Kong(香港城市大学) ; Peking University(北京大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Zhejiang University(浙江大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究大型语言模型多步推理中并行推理路径贡献难区分问题,提出基于夏普利值的强化学习框架并行夏普利值方法,通过量化边际贡献等实现按比例分配奖励,实验证明其优于基线且能改进多路径推理。
Comments 19 pages, 4 figures, 8 Tables
CASE:用于提高思维链忠实度的因果对齐和结构强化
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究思维链推理中生成的推理无法忠实支持最终答案的问题,提出CASE框架,通过训练时因果对齐和推理时结构强化,结合构建多种数据集及选择性损失微调、屏蔽注意力等方法,提升CoT忠实度、跨数据集转移能力及平均准确率。
我们能否使大语言模型摆脱自我循环?通过激活引导实现细粒度推理控制
机构 * UC San Diego(加州大学圣地亚哥分校) ; Adobe Research(Adobe研究院) ; University of New South Wales(新南威尔士大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究大语言模型推理过程不可控问题,提出SOPHIA方法,通过将推理轨迹视为潜在状态序列,构建引导向量库,在推理时进行干预,可检测并防止自我循环,提升推理质量。
OrientSAM:通过方向感知空间对齐减轻多模态空间推理中以相机为中心的捷径
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究多模态模型空间推理中以相机为中心的问题,提出OrientSAM框架,通过方向感知令牌、傅里叶角度编码及课程学习策略注入方向信息并改善推理,构建数据管道生成监督,实验证明其在多任务中表现出色,能减轻捷径行为,实现更强大的以对象为中心的空间推理。
约束锚定推理轨迹
机构 * University of Oxford(牛津大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究自回归多模态大语言模型错误滚雪球问题,提出神经符号框架CART,将自然语言推理与符号约束断言交织,经双管齐下的模块验证约束,防止错误传播,在多基准测试中降低滚雪球率、提高准确率并控制推理开销。
Comments 15 pages, ACM MM 2026