The Yokai Learning Environment: Tracking Beliefs Over Space and Time
Yokai 学习环境:在空间和时间上跟踪信念
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 Yokai学习环境通过跟踪和更新信念来实现有效合作,挑战现有ZSC方法的泛化能力。
Comments RLC 2026
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
Yokai 学习环境:在空间和时间上跟踪信念
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 Yokai学习环境通过跟踪和更新信念来实现有效合作,挑战现有ZSC方法的泛化能力。
Comments RLC 2026
分歧解码:无训练的能力融合
机构 * Peking University(北京大学) ; International Digital Economy Academy (IDEA)(国际数字经济学院) ; The University of Hong Kong(香港大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 针对通用大模型缺领域知识、专家模型逻辑弱的问题,提出无训练的Divergence Decoding框架,通过Jensen-Shannon散度自适应路由,在科学基准上融合两类模型能力,性能优于单模型基线。
人工智能代理中的操作幻觉与安全漂移
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究大型语言模型在多轮执行中引发的可靠性风险,通过多轮评估量化安全漂移和操作幻觉现象,分析其根源,提出行动感知监督层,该层能拦截违规行为且无良性误报,提升了代理可靠性。
双智能体语言模型中继中的状态压缩:约束保留的封闭世界研究
专题命中 逻辑推理 :planning(abstract);分类 cs.CL、cs.AI
AI总结 研究双智能体LLM中继中交接压缩问题,比较无压缩、叙述性总结、JSON提取、基于嵌入的修剪四种交接条件,发现交接表示影响下游可行性,JSON提取可行性准确率最高达0.96,结构化可审计表示利于约束检查。
Comments 8 pages, 2 figures, 3 tables
多智能体系统的可组合验证管道
机构 * Ume University, Sweden(乌梅大学,瑞典)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究多智能体系统的验证问题,基于Tiles和Soda构建模块化框架,通过可执行验证管道操作动作语言语义,以类型化函数管道表示验证过程,含可执行规范层,有开源实现及示例说明。
通过多尺度人工智能群体自主进行结直肠癌脆弱性的机制发现
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究旨在解决自动化科学发现中语言模型与生物物理的认知差距。通过多尺度自主发现引擎Octopus,结合大语言模型群体和算法物理引擎,针对结直肠癌转录组进行无监督扫描,发现IGF2是5-氟尿嘧啶耐药脆弱性,建立了可验证的生物医学发现范式。
RLearner-LLM: 通过混合直接偏好优化平衡大语言模型中的逻辑性与流畅性
机构 * University of Auckland(奥克兰大学) ; Aalto University(阿alto大学)
专题命中 逻辑推理 :verifier(abstract);分类 cs.CL、cs.AI
AI总结 本文提出RLearner-LLM,通过融合DeBERTa-v3 NLI信号与验证器LLM评分,解决直接偏好优化在知识密集型生成中的逻辑对齐问题,实现NLI指标显著提升。
人工智能虚构悖论
机构 * Integrated Program in Humane Studies, Kenyon College(肯尼恩学院人文学研究整合项目) ; AI CoLab, Kenyon College(肯尼恩学院人工智能协作实验室) ; Human-Centered AI Lab(以人为中心的人工智能实验室)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文探讨人工智能生成虚构内容的困境,指出叙事因果、信息重评和多尺度情感架构三大挑战,揭示AI生成虚构的难题及潜在风险。
Comments 15 pages, Presented at the MFS Cultural AI Conference, Purdue University, September 18, 2025. Accepted for publication as a collection of essays for a special issue of MFS Modern Fiction Studies on Cultural AI
NL2LOGIC: 基于抽象语法树的自然语言到一阶逻辑翻译框架
机构 * Virginia Tech(弗吉尼亚理工大学) ; Universitas Ary Ginanjar(阿里·金纳jar大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 NL2LOGIC通过引入抽象语法树,结合递归大语言模型和生成器,实现了高准确性的自然语言到一阶逻辑转换,提升了逻辑求解的准确性和可执行性。
Comments Accepted to Findings of EACL 2026. 17 pages, 6 figures
Journal ref 2026.findings-eacl.317
双焦点注意力:协调几何与谱域的位置嵌入以实现算法泛化
机构 * Indian Institute of Technology, Delhi(印度理工学院德里分校)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本研究提出双焦点注意力机制,通过协调几何与谱域的位置嵌入,解决算法泛化中的结构间隙问题,提升模型对递归推理的处理能力。
Comments There is issue with affiliation, any further updates will be communicated but right now removal is necessary
Groc-PO:用于真实多模态大语言模型的基于上下文的偏好优化
机构 * University of Science and Technology of China(中国科学技术大学) ; Xiaomi Corporation(小米公司) ; State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民日报社传播内容认知国家重点实验室)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究针对多模态大语言模型的不真实问题,提出基于上下文的偏好优化框架Groc-PO,构建相关数据集,通过多阶段偏好样本捕捉基础上下文,加强上下文相关推理,减轻跨阶段错误传播,提升模型性能。
Comments Accepted by ACM-MM 2026
基于论证的话语感知政策分析:灾害治理的混合大语言模型-符号框架
机构 * New Mexico State University(新墨西哥州立大学) ; Sun Yat-Sen University(中山大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究灾害治理中政策文件推理隐含问题,提出混合大语言模型-符号框架Apaf,通过分类论点、生成框架介导关系子类型进行关键话语分析,发布新数据集,论证图准确、可解释且跨辖区稳定。
DDL2PropBank Agent:通过一种新的关系模式映射任务评估多智能体框架的开发者体验
机构 * Center for Advanced AI, Accenture(Accenture高级人工智能中心)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 DDL2PropBank Agent通过新的关系模式映射任务评估多智能体框架的开发者体验,揭示了不同框架在代码复杂性和AI辅助性上的差异,Agno表现出最佳性能。
Comments ACM Submission
用于确定性、自扩展反应分类的可验证规则的智能体生成
机构 * École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) ; Laboratory for Chemical Technology, Ghent University(根特大学化学技术实验室) ; NCCR Catalysis(瑞士国家研究能力中心催化项目)
专题命中 逻辑推理 :planning(abstract);分类 cs.CL、cs.AI
AI总结 提出多智能体LLM框架,通过验证循环自动生成反应规则,将标准分类从68类扩展到14,073类,并实现97.7%的未知反应分类准确率。
我们能信任大语言模型的逻辑吗?通过基于图的框架量化不确定性、连贯性和鲁棒性
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) ; Department of Biochemistry and Molecular Genetics(生物化学与分子遗传学系) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型推理问题,引入基于图的GRAPHEVAL框架,提出GRCS度量和GSC解码策略,量化不确定性等,发现GRCS与推理忠实度负相关,证明GSC所选路径对推理的重要性。
Comments 42 pages, 14 figures, 12 tables
小心你的自动补全内容:后门代码补全的取证溯源
机构 * University of Louisville(路易斯维尔大学) ; University of North Texas(德克萨斯大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究针对大型语言模型代码补全易受后门攻击的问题,提出CodeTracer取证框架,它仅靠微调语料库和错误补全事件,提取行为指纹,经推理将不安全逻辑归因于特定后门数据,评估显示其有高准确性、低误识率和强鲁棒性。
Comments To appear in COLM 2026
如何避免辩论:通过双高效交互式证明实现可扩展的人工智能安全
机构 * MIT(麻省理工学院)
专题命中 逻辑推理 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 研究如何避免人工智能模型间的辩论来实现安全验证,提出单证明者交互式证明,给出双高效单证明者交互式证明及论证,用于神谕辅助计算,表明无辩论时交互式验证也可行。
Comments ICML 2026
用真理欺骗:通过生成蒙太奇进行开放式通道多智能体合谋以操纵信念
机构 * University of Liverpool(利物浦大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了通过公开通道分发真实证据片段,利用多智能体合谋操纵信念的新威胁,提出了生成蒙太奇框架,展示了在14种LLM家族中74.4%的攻击成功率,并揭示了更强的推理能力反而增加了易受攻击的风险。
Comments Accepted to the ACL 2026 Main Conference (Oral Presentation)
Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 5979-5996, San Diego, California, United States, July 2026
前馈层中的显式模糊逻辑:自遗忘量词发现可读的语法许可检测器
机构 * University of Washington(华盛顿大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 提出参数中性的显式模糊逻辑前馈层(NC-FFN),通过交集和集差操作实现逻辑推理,在125M参数语言模型上达到与GELU基线相当的困惑度,并通过自遗忘量词使前馈层可解释为语法许可检测器。
VLM能稳健推理吗?一项神经符号研究
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Edinburgh(爱丁堡大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究视觉语言模型在分布偏移下的推理稳健性,提出结合VLM概念识别与电路符号推理的神经符号方法VLC,在三个视觉演绎推理任务上实现更高的分布外准确率。
Comments TMLR 2026
覆盖驱动的KV缓存淘汰策略用于高效且改进的大语言模型推理
机构 * RBC Borealis(RBC 培生)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型推理中KV缓存内存开销大、现有淘汰策略导致长上下文任务性能下降的问题,提出覆盖感知的K-VEC策略,通过跨头跨层覆盖模块提升token保留,在LongBench上最高提升10.35点。
三狼人杀:大型语言模型中多跳心智理论的丑角角色
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 通过引入第三阵营“丑角”(Jester),将狼人杀游戏扩展为三方博弈,测试LLM的多跳心智理论能力。实验表明,模型常做出自毁行为,而自我学习能帮助部分模型学会微妙策略。
保持VIGILant:通过多模态大语言模型中的反事实视觉对齐缓解视觉懒惰
机构 * UAB(阿拉巴马大学伯明翰分校) ; Yale(耶鲁大学) ; UNSW(新南威尔士大学) ; Tulane(杜兰大学) ; Georgia Tech(佐治亚理工学院) ; NEU(东北大学) ; OSU(俄亥俄州立大学) ; UIowa(爱荷华大学) ; Harvard(哈佛大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 提出VIGIL框架,通过强化学习后训练最大化视觉输入与生成响应间的互信息,惩罚“盲目自信”实例,有效缓解MLLMs的视觉懒惰问题,在幻觉和推理基准上优于现有方法。
Comments ECCV 2026
ATHENA:分层进化数值算法的智能团队
机构 * Division of Applied Mathematics, Brown University(布朗大学应用数学系)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 ATHENA通过知识驱动的诊断流程,实现科学计算与科学机器学习的自动化,结合专家蓝图和组合空间,生成高精度数值解和稳定求解器,达到10^-14的验证误差。
VeriGraph: 迈向可验证的数据分析智能体
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出VeriGraph框架,通过构建显式异质证据有向无环图(DAG)实现数据分析智能体的可验证性,并设计基于图的策略优化提升正确性与可审计性。
Comments 10 pages
波的语法:通过神经符号VLM智能体实现可解释的多变量时间序列事件检测
机构 * AI Lab, SLB(SLB人工智能实验室) ; Télécom Paris, Institut Polytechnique de Paris, France(巴黎电信学院,巴黎高等理工学院,法国)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出语言引导的时间序列事件检测(TSED)任务,通过事件逻辑树(ELT)将文本描述转化为结构化时序逻辑,并构建神经符号VLM智能体SELA,实现零/少样本事件检测与可解释推理。
Comments 8 pages (main text), 28 pages total including appendix. 9 figures, 7 tables
枢纽或边缘:基于网页图中心性的预训练数据选择
机构 * Princeton Language and Intelligence(普林斯顿语言与智能) ; Princeton University(普林斯顿大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出WebGraphMix框架,利用Common Crawl主机级网页图的结构中心性得分调整预训练数据中中心与边缘文档的比例,无需模型训练或标注数据,在400M和1B参数模型上平均性能提升至41.4%。
Comments 10 pages
内化几何法则:从求解器残差中学习以实现精度关键生成
机构 * Huawei Celia Team(华为Celia团队)
专题命中 逻辑推理 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 针对大语言模型在精度关键领域(如技术图表和机械设计)中的幻觉问题,提出可编程几何DSL PyGeoX及分层基准PyGeoX-Bench,并设计饱和加性奖励(SAR)方法,将奖励分解为有界逐约束项,解决异常梯度掩盖问题,使8B模型在基准上达到与更大前沿系统竞争的水平。
SEF-CLGC在SemEval-2026任务11中的应用:逻辑符号对语言模型性能的影响
机构 * Université Côte d’Azur, Inria, CNRS, I3S, Sophia Antipolis, France(蔚蓝海岸大学, 法国国家信息与自动化研究所, 法国国家科学研究中心, 信息与系统科学实验室, 索菲亚安蒂波利斯, 法国) ; Data ScienceTech Institute, Paris, France(数据科学技术学院, 巴黎, 法国)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出SEF-CLGC管道,结合形式逻辑符号与小语言模型,在SemEval-2026任务11中评估推理性能,最佳模型在降低内容偏差的同时达到27.80%的内容分数。
Comments Accepted to SemEval-2026 co-located with ACL 2026
生成AI的另一种轨迹
机构 * Princeton University(普林斯顿大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出通过构建领域特定超智能(DSS)来改进生成AI,利用符号抽象提升领域推理能力,避免LLM合成数据的模型崩溃问题,实现可持续发展。