Automatic Knowledge Graph Construction and Query for Earthquake Catalogs
地震目录的自动知识图谱构建与查询
专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI、cs.LG
AI总结 研究针对地震目录中开放性问题解答受限的情况,应用GraphRAG直接处理原始表格记录,构建可查询知识图谱,经评估改进并识别陷阱,提供实用查询接口,确保结果准确可靠。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
地震目录的自动知识图谱构建与查询
专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI、cs.LG
AI总结 研究针对地震目录中开放性问题解答受限的情况,应用GraphRAG直接处理原始表格记录,构建可查询知识图谱,经评估改进并识别陷阱,提供实用查询接口,确保结果准确可靠。
推理还是记忆:大语言模型能理解并生成中国歇后语谜语吗?
专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI
AI总结 研究通过在新歇后语游戏中测试大语言模型,用多项选择题、自由形式解释生成和新歇后语创作评估其能力,发现前沿中文模型记忆能力较强,新歇后语创作中Gemini 3.1 Pro表现出色,但LLMs整体创造力仍落后于人类专家,凸显数据污染对评估LLMs推理能力的影响。
Comments 20 pages; exp 3 is work in progress
用于多语言金融问答的语言路由RAG和直接选项评分:FinMMEval上的DS@GT
专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对多语言金融问答基准FinMMEval 2026任务1,构建基于LangGraph的检索增强管道,用RADS评分,通过加权倒数排名融合低资源语言索引,采用语言路由选择模型,揭示语言感知检索等对多语言金融推理的重要性。
Comments Accepted for publication in the CLEF 2026 Working Notes. 15 pages, 3 figures
Tokengeist:智能对话中的多轮归因追踪
机构 * University of Toronto(多伦多大学) ; Microsoft Research(微软研究院)
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI
AI总结 研究多轮对话中语言模型响应的归因问题,提出多轮上下文归因及 Tokengeist 框架,通过有向无环图递归遍历恢复依赖路径,发布基准 MTCABench,实验表明 Tokengeist 能有效解决现有方法多跳依赖恢复不足问题。
J-CoT:J空间中的思维链
机构 * University of Oxford(牛津大学) ; Stanford University(斯坦福大学)
专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL、cs.AI
AI总结 研究针对语言模型推理中仅依赖自然语言受限的问题,提出基于J空间的J-CoT循环推理框架,通过词汇索引系数传递中间状态,在多任务中表现出色,J-CoT-Zero匹配或超基线,J-CoT-Train获高分。
Comments work in progress
LeanFlow:工作流驱动的精益自动形式化案例研究
机构 * Moonshot AI(月球计划人工智能公司) ; epfl-lara(洛桑联邦理工学院拉腊实验室)
专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG
AI总结 研究通过对两篇数学论文案例研究,探讨文档到项目形式化中运行时机制对相关指标的影响,使用Kimi2.6和GPT5.5进行消融实验,报告多项数据,展示LeanFlow在特定任务上的表现及校准成果。
Comments 14 pages, 3 figures, ICML 2026: AI for Math Workshop
多步工具增强智能体中的绑定漂移
专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI
AI总结 研究多步工具增强智能体中实体绑定随时间的变化,区分绑定漂移与错误传播。通过实验发现实体锁定会放大错误操作,实用的重新验证器可减少错误,自然设置下基线智能体有漂移现象,且持久性和重新验证不可互换。
Comments 14 pages, 5 tables, 1 figure. Equal contribution by both authors. Code and data: https://github.com/shashank-indukuri/binding-drift
预言机差距与信号保真度:一种用于测试时协作的固定池诊断方法
机构 * Research Institute of China Telecom(中国电信研究院)
专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI
AI总结 研究测试时协作收益不均衡问题,将固定候选池选择器或验证器净收益分解为可测量因素,通过实验表明收益受预言机差距和信号保真度限制,框架可在协作前进行预部署诊断,估计相关指标。
Comments 13 pages, 2 figures, 8 tables. Code: https://github.com/AmGarfield/OracleGap
隐藏在思维中:可转移的思维链工件引发有害行为
机构 * Applied Artificial Intelligence Initiative, Deakin University, Australia(德克萨斯大学应用人工智能计划,澳大利亚) ; Mila, Quebec AI Institute, Quebec, Canada(魁北克AI研究所)
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.LG
AI总结 研究受损语言模型中有害思维链痕迹能否引发不安全行为及被提炼成越狱攻击,通过实验发现其能转移有害行为,挖掘出有害推理组件,提炼模式可产生有效黑盒越狱,表明有害推理在多层面转移,需评估推理上下文的防御。
大语言模型中的元认知:基础、进展与机遇
机构 * Yale University(耶鲁大学) ; University of California, Irvine(加利福尼亚大学欧文分校)
专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI
AI总结 本文全面概述大语言模型元认知知识现状,分析分类该领域,总结技术进展,涵盖测量评估方法、引发改进应用技术等,还讨论相关应用、问题挑战及未来方向,为该主题研究提供综述与指引。
动作映射策略:通过像素分类学习3D闭环操作
机构 * Northeastern University(东北大学) ; Stanford University(斯坦福大学) ; Brown University(布朗大学)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG
AI总结 研究针对机器人学习中动作空间的挑战,提出动作映射策略(AMP),将3D闭环操作策略学习转为图像空间分类问题,通过投影动作到图像平面,以像素为类别控制维度,实现高精度、快速推理,实验证明其优于基线。
Comments Project Website: https://haojhuang.github.io/amp_page/
用于规则驱动的细粒度分类的约束感知层次搜索
机构 * Gusu Laboratory of Materials(姑苏材料实验室) ; Chongqing Institute of Engineering(重庆工程学院) ; Suzhou Digital China Wuxin Intelligent Technology Co., Ltd.(苏州神州数码五新智能科技有限公司)
专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI
AI总结 针对规则驱动的细粒度分类任务,现有方法存在不足。本文构建基准数据集,提出约束感知层次搜索框架,将监管文件转换为可搜索树,只检索有效局部候选节点,实验证明该方法准确率高且能提供可解释决策路径。
自回归生成中自我修正盲点的频谱起源
机构 * European University of Tirana(地拉那欧洲大学)
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.LG
AI总结 研究大型自回归语言模型自我修正盲点问题,提出频谱代数理论SPARC,定义错误传播算子,推导激活阈值,证明基于强化学习的验证器-校正器训练收敛条件,实验验证定理,频谱预测与盲点率匹配。
用于少样本工业视觉的小视觉语言模型的答案条件思维链蒸馏
机构 * Entropy AI Research Labs Private Limited(熵人工智能研究实验室私人有限公司)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG
AI总结 针对制造业视觉检测难题,提出答案条件思维链蒸馏法,利用最少标注数据让小型视觉语言模型适应新工业任务,经实验验证该方法在多任务中优于直接微调,提升了推理质量和模型性能。
Comments 11 pages, 5 figures, 8 tables
关于视觉推理中的局部性和长度泛化
机构 * Qualcomm AI Research(高通人工智能研究中心)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG
AI总结 研究从视觉状态跟踪和长度泛化角度,探讨局部、顺序视觉模型是否有计算优势。受语言模型启发,研究简单视觉任务中视觉模型行为。发现其会利用全局捷径,基于严格局部感知的策略可缓解此问题,表明局部注意力对稳健组合泛化很关键。
Comments Accepted at ECCV 2026
用于专家模型适配的开放式场景推理
机构 * College of Information Science and Engineering, Northeastern University(东北大学信息科学与工程学院)
专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG
AI总结 研究流程工业专家模型在新场景中退化问题,提出ROAM框架,利用大语言模型知识和推理,在不重训情况下使冻结模型适应新场景,实验证明该框架能有效降低误差并控制开销。
Danus:利用事实图内存编排数学推理智能体
机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) ; Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心) ; Research Institute for Mathematical Sciences, Kyoto University(京都大学数理解析研究所) ; School of Mathematics, Tianjin University(天津大学数学学院) ; Zhongguancun Academy(中关村科学院) ; Department of Mathematics, Stanford University(斯坦福大学数学系) ; Westlake Institute for Advanced Study, Westlake University(西湖大学西湖高等研究院) ; School of Mathematical Sciences, Key Laboratory of Intelligent Computing and Applications (Ministry of Education), Tongji University(同济大学数学科学学院(教育部智能计算与应用重点实验室)) ; Beijing International Center for Mathematical Research and the New Cornerstone Science Laboratory, Peking University(北京大学北京国际数学研究中心与新基石科学实验室) ; Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) ; Center for Intelligent Computing, Great Bay Institute for Advanced Study, Great Bay University(大湾区大学高等研究院智能计算中心)
专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI
AI总结 本文针对基于大语言模型的数学推理智能体扩展和编排难题,提出以共享事实图为全局内存管理机制的Danus系统,由主智能体、工作智能体和验证器构成,通过案例研究评估,展示其构建长证明的能力,为长期研究问题提供有效编排途径。
从文化遗产保护视角重新思考印度人工智能
机构 * International Institute of Information Technology, Bengaluru(班加罗尔国际信息技术学院)
专题命中 推理与问题求解 :foundation model(abstract);分类 cs.CL、cs.AI
AI总结 本文从文化遗产保护角度探讨人工智能对印度语言文化的影响,通过纵向调查自然语言处理技术演变、分析印度语言特征及基础模型作用,提出‘文化感知’方向,为印度自然语言处理下一阶段研究及基础模型发展提供指引。
面向大语言模型的神经元感知主动少样本学习
机构 * University of Pittsburgh, USA(匹兹堡大学)
专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI、cs.LG
AI总结 提出NeuFS框架,利用神经元激活模式从模型内部动态选择最具价值的少样本示例,提升大语言模型在专业领域的适应性和性能。
CAT:面向大型推理模型高效推理的置信度自适应思考
机构 * Laboratory of Intelligent Collaborative Computing, University of Electronic Science and Technology of China(电子科技大学智能协同计算实验室) ; Ubiquitous Intelligence and Trusted Services Key Laboratory of Sichuan Province(四川省泛在智能与可信服务重点实验室)
专题命中 推理与问题求解 :preference optimization(abstract);分类 cs.CL、cs.AI
AI总结 提出置信度自适应思考(CAT)框架,利用模型内在自确信信号作为置信度,通过偏好优化自主调节推理长度,在保持准确率的同时压缩简单问题的推理开销。
Comments Accepted at ACL 2026 Industry Track
掩码语言流模型
机构 * CC BY 4.0(知识共享署名4.0国际许可)
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.LG
AI总结 提出掩码语言流模型(MLFM),通过连续随机插值将掩码机制融入流语言模型,实现并行生成与多步推理的平衡,首次将流模型扩展到推理和指令跟随任务。
Comments Preprint
验证地平线:编码智能体奖励没有银弹
机构 * Qwen Team(Qwen团队)
专题命中 推理与问题求解 :foundation model(abstract);分类 cs.CL、cs.AI
AI总结 本文指出,随着编码智能体能力增强,验证解决方案比生成更难,并沿可扩展性、忠实性和鲁棒性三个维度分析验证信号质量,通过四种奖励构建实验表明验证必须与生成器共同进化。
Comments Authors are listed alphabetically by their first names
Geo-Strat-RL:从可验证任务中学习地质事件推理
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG
AI总结 提出Geo-Strat-RL合成环境,通过可验证奖励的强化学习(RLVR)训练视觉语言模型进行地质事件重建,并证明从地层图学到的推理可迁移至合成地震数据。
Comments 21 pages, 8 figures
链式思维推理的局部因果归因
机构 * IBM Research(IBM研究院)
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.LG
AI总结 提出AttriCoT算法,通过结构因果模型对链式思维推理中的单元进行局部因果归因,仅需O(U)次前向传播即可获得忠实于模型行为的归因结果。
Comments Camera-ready version for the Mechanistic Interpretability Workshop at ICML 2026. 37 pages, 18 figures
Self-CTRL:基于强化学习的自一致性训练
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG
AI总结 提出Self-CTRL方法,通过强化学习优化语言模型自我解释与行为之间的一致性,在概率推理和宪法AI任务上显著提升一致性和安全性。
Comments 34 pages, 12 figures, includes appendices
基于自一致性的叙事问答重排序
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI
AI总结 提出自一致性重排序框架,通过生成多个候选答案并基于语义一致性选择最终答案,提升叙事问答的鲁棒性和准确性。
Vernier: 探测因果推理中词汇间隙背后的表征错位
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI
AI总结 通过配对视图权重更新和激活修补,发现语言模型在因果推理中因变量名替换导致的答案差异源于表征错位而非信息丢失,并在Qwen和Llama模型上验证了反事实增强的对齐效果。
算法推理中代码是否优于语言
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG
AI总结 通过分离中间表示与执行机制,在40个任务上比较代码执行与自然语言推理,发现代码执行优势源于外部执行而非表示变化。
Comments ICML 2026
在你挣扎处采样:通过熵引导的幂采样增强基础模型推理
机构 * Hasso Plattner Institut(霍普夫纳研究所) ; German University of Digital Science(德国数字科学大学)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG
AI总结 提出熵引导的幂采样(EGPS),一种无需训练和验证器的采样方法,通过利用前向传播中的token级熵将MCMC移动定位到高熵区域,在多个基准上以高达12.6倍加速达到最优或并列最优准确率。
模块化AI系统中的参与扩展
机构 * University of Washington(华盛顿大学) ; Stanford University(斯坦福大学)
专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.CL、cs.AI
AI总结 提出参与扩展范式,通过多方贡献小模型构建模块化AI系统,在15项任务上比单体大语言模型提升高达15.4%,并展现涌现能力。