Exploiting Transformer in Sparse Reward Reinforcement Learning for Interpretable Temporal Logic Motion Planning
专题命中 逻辑推理 :planning(title);分类 cs.AI
Comments IEEE Robotics and Automation Letters
Journal ref IEEE Robotics and Automation Letters, 2023
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 逻辑推理 :planning(title);分类 cs.AI
Comments IEEE Robotics and Automation Letters
Journal ref IEEE Robotics and Automation Letters, 2023
专题命中 逻辑推理 :reasoning(title);分类 cs.AI
Comments Under consideration in Theory and Practice of Logic Programming (TPLP). arXiv admin note: substantial text overlap with arXiv:2005.09998
专题命中 逻辑推理 :reasoning(title);分类 cs.CL
Comments Accepted at EMNLP2021 Findings
专题命中 逻辑推理 :reasoning(title);分类 cs.AI
Comments Short version submitted to DL2021
专题命中 逻辑推理 :reasoning(title);分类 cs.AI
Journal ref In Proceedings of the European Conference on Logics in Artificial Intelligence (JELIA), volume 7519 of LNCS, pages 437-449, 2012
专题命中 逻辑推理 :reasoning(title);分类 cs.AI
Comments Some of the material in this paper appeared in preliminary form in "Ambiguous langage and differences of belief" (see arXiv:1203.0699)
专题命中 逻辑推理 :reasoning(title);分类 cs.AI
Comments In Proceedings of Twelfth Conference on Theoretical Aspects of Rationality and Knowledge, 2009, pp. 166-173
专题命中 逻辑推理 :reasoning(title);分类 cs.AI
Comments A preliminary version of this paper appeared in Proc. of the 17th Conference on Uncertainty in AI, 2001
Journal ref Journal of AI Research 17, 2001, pp. 57-81
专题命中 逻辑推理 :reasoning(title);分类 cs.AI
Comments To appear, SIAM Journal on Computing
DiffusionGemma 的透明度如何?
机构 * Google(谷歌)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究DiffusionGemma在连续潜空间中的推理透明度,通过变量透明度和算法透明度分解,发现可解释的令牌瓶颈将不透明串行深度降至Gemma 4的1.1倍,并揭示扩散特有现象。
Comments 20 main text pages and 6 pages of references and appendices
说服悖论:当LLM解释未能提升人机团队表现时
机构 * Bar-Ilan University(巴伊兰大学) ; University of Virginia(弗吉尼亚大学) ; Department of Psychology, Ariel University(阿里尔大学心理学系)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究揭示LLM解释在提升人机团队表现上的矛盾效果,通过三组实验发现解释增加信心但未必提升准确性,且可能抑制错误恢复能力,强调需转向校准依赖与有效错误恢复的设计。
大语言模型能遵循指令,但无法同时遵循太多:组合约束满足中的相变
机构 * Meta Superintelligence Labs(元超级智能实验室)
专题命中 逻辑推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出约束饱和评估基准,发现大语言模型在同时遵循5-6个以上指令约束时可靠性崩溃,不同类型约束的性能下降幅度存在差异,失败呈近独立的乘法累积效应。
Comments 35 pages, 7 figures, 13 tables. Reviewed in the ARR May 2026 cycle
超越可解性:任务可学习性作为大语言模型强化学习后训练的静态先验
机构 * Sun Yat-Sen University(中山大学) ; Alibaba Group(阿里巴巴集团)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出TrajVal估计任务可学习性,将其作为静态先验用于LLM的RL后训练任务采样,可提升数据效率并与在线调度方法互补。
CresOWLve:基于现实世界知识的创造性问题解决基准测试
机构 * EPFL(瑞士联邦理工学院洛桑) ; Università della Svizzera italiana (USI)(意大利语区瑞士大学)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出CresOWLve基准测试,评估创造性问题解决能力,通过现实世界知识中的谜题,发现模型在事实性问题与创造性问题上的表现差异显著。
Comments Accepted at COLM 2026
基于概率算子的逻辑推理能力大语言模型基准测试
机构 * Haverford College(哈维福德学院)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究构建含14320个提示的概率算子推理基准,评估29个大语言模型,发现多数模型存在答案偏差,仅9个超随机水平,且各维度均有偏差。
Comments Under review
Learn2Zinc:微调小型语言模型以实现MiniZinc中的文本到模型翻译
机构 * AI Center of Excellence, Fidelity Investments(富达投资卓越人工智能中心) ; Department of Computer Science, Brown University(布朗大学计算机科学系)
专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 研究针对小型语言模型在MiniZinc文本到模型翻译的难题,提出跨模型错误引导方法,收集语法错误构建训练数据集微调模型,提升执行准确率至98%,虽语法可学但约束推理仍具挑战,且开源相关资源供后续研究。
Comments CP 2026 Workshop on LLMs meet Constraint Solving
迈向人工智能流行病学:一种用于前瞻性风险检测的测量标准化框架
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种测量标准化框架,用于在没有访问模型内部信息的情况下,将专家-人工智能交互压缩为结构化、可比较的领域,以进行前瞻性风险检测。该框架旨在定义其范围,包括语义和统计层面,并指定未来工作的实证测试协议。
Comments 38 pages, 3 figures, 4 tables. Accepted for publication in AI & Society
大语言模型中逻辑一致性的可控重新表述测试
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型在逻辑等价问题表面形式改变时的逻辑一致性,提出CRTBench基准,评估多个前沿LLMs,发现存在准确率 - 一致性差距,揭示失败集中在逻辑非平凡变换,表明仅靠准确率无法评估LLMs的逻辑推理。
Comments 10 pages
HABIB_TAZ参加SemEval-2026任务11:通过合成训练和多目标优化从内容中分离形式逻辑
机构 * Dhanani School of Science & Engineering Habib University(哈比卜大学达纳尼科学与工程学院)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文针对SemEval-2026任务11,用基于三段论合成数据集微调的mDeBERTa-v3网络,结合多目标损失函数应对大语言模型形式推理受内容影响的问题,在多个子任务中取得优异成绩,还公开了数据集生成引擎和代码库。
Journal ref Proceedings of the 20th International Workshop on Semantic Evaluation (2026), pp. 1006-1014 (2026)
衡量AI完成长期软件任务的能力
机构 * Model Evaluation & Threat Research (METR)(模型评估与威胁研究(METR)) ; Ohm Chip ; Anthropic
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出50%任务完成时间跨度指标,用于衡量AI在完成长期软件任务方面的能力,结果显示AI模型的时间跨度呈指数增长,预计5年后将能自动化许多人类月度完成的软件任务。
Comments v4: added Chris Painter as listed author, consistent with listing in the pdf
Journal ref NeurIPS 2025
被叙事诱惑:评估半开放文本沙盒中的规则遵守情况
机构 * University of Alberta(阿尔伯塔大学) ; Qilu University of Technology(齐鲁工业大学) ; N-Dice Association(N-Dice协会)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究在半开放文本游戏环境中,当用户意图与系统规则冲突时大语言模型的规则遵守问题。基于桌面角色扮演游戏机制构建多智能体对抗基准CoC-Seduce,用前沿模型生成样本,对20个目标裁决器进行基准测试。
安全且自适应的云修复:使用神经符号世界模型验证LLM生成的恢复计划
机构 * Zhejiang University(浙江大学)
专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 提出PASE框架,将LLM作为规划引擎生成恢复计划,通过神经符号世界模型验证可行性,并利用DRL优化提示,实现动态自适应修复,显著降低恢复时间并提高未知故障检测精度。
Comments 13 pages
CreativityPrism:大语言模型创造力的跨域评估框架
机构 * University of Pittsburgh(匹兹堡大学) ; Johns Hopkins University(约翰霍普金斯大学) ; University of Notre Dame(诺特丹大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Washington(华盛顿大学) ; Allen Institute for Artificial Intelligence(人工智能研究院) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出CreativityPrism框架,整合发散思维、创意写作和逻辑推理三个领域的八项任务,从质量、新颖性和多样性三个维度评估LLM创造力,发现前沿模型在创意写作和逻辑推理上领先,但在发散思维上无显著优势,且各维度间相关性弱。
Comments Published in Transactions on Machine Learning Research (06/2026)
MAGIK: 通过想象力驱动的知识迁移映射到类比目标
机构 * Applied Artificial Intelligence Initiative, Deakin University School of IT, Deakin University(应用人工智能倡议,德克萨斯大学IT学院,德克萨斯大学)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出MAGIK框架,利用想象力机制将目标任务实体映射到源域类比物,实现零样本知识迁移,在MiniGrid和MuJoCo任务上验证有效性。
STaR-DRO: 面向群体鲁棒结构化预测的状态化Tsallis重加权
机构 * Yale University(耶鲁大学) ; Yale School of Medicine(耶鲁医学院)
专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 提出STaR-DRO框架,结合Tsallis镜像上升和稀疏entmax映射,仅对持续困难群体上权重,在结构化预测中提升标签准确性和鲁棒性,在EPPC Miner任务上相比SFT和标准DRO分别提升F1分数1.08和2.20。
RLCSD: 基于对比策略自蒸馏的强化学习
机构 * Tsinghua University(清华大学) ; Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) ; Peking University(北京大学)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.LG
AI总结 针对策略自蒸馏中特权诱导的风格漂移问题,提出RLCSD方法,通过对比正确与错误提示下的师生差距来抑制风格偏移,提升推理模型在数学和逻辑推理任务上的性能。
Comments 20 pages, 9 figures, 9 tables
CA-BED:对话感知的贝叶斯实验设计
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; University of Toronto(多伦多大学)
专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 提出对话感知的贝叶斯实验设计(CA-BED),一种推理时概率对话规划框架,通过结合贝叶斯实验设计与LLM似然估计,在多个对话轮次中优化问题选择,在结构化实体推断基准上平均成功率提升21.8%,仅增加1.8轮对话。
Comments Reliable Autonomy Workshop at ICLR 2026
超越二元道德判断:在AI中建模伦理多元主义
机构 * Department of Computer Science and Engineering, IIIT Delhi(印度德里理工学院计算机科学与工程系) ; Mehta Family School of Data Science and AI, IIT Palakkad(印度帕拉卡德理工学院梅塔家庭数据科学与人工智能学院)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出将道德推理建模为规范性伦理理论分布(伦理多元主义)的框架,通过规范-语义双流架构和堆叠集成学习实现,在450个案例上达到88.89%的准确率。
SEAL: 面向知识图谱对话问答的自我演进智能体学习
机构 * Institute of Big Data and Artificial Intelligence, China Telecom Research Institute(大数据与人工智能研究院,中国电信研究院) ; Wangxuan Institute of Computer Technology, Peking University(王宣计算机技术研究所,北京大学) ; School of Artificial Intelligence, China University of Geosciences (Beijing)(人工智能学院,中国地质大学(北京)) ; Center for Cognition and Neuroergonomics, State Key Laboratory of Cognitive Neuroscience and Learning, Beijing Normal University(认知与神经工效学中心,认知神经科学与学习国家重点实验室,北京师范大学) ; Institute of Artificial Intelligence and Future Networks, Beijing Normal University(人工智能与未来网络研究院,北京师范大学)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出SEAL两阶段语义解析框架,通过自我演进智能体学习解决知识图谱对话问答中的指代消解、上下文依赖和复杂逻辑推理问题,在SPICE基准上达到最先进性能。
Comments Accept by NeuroComputing
一种用于LLM可靠证明生成的神经符号方法:以欧几里得几何为例
机构 * The Hebrew University of Jerusalem(特拉维夫大学)
专题命中 逻辑推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI
AI总结 提出一种结合LLM生成能力与结构化组件的神经符号方法,通过类比问题检索和形式验证器反馈,显著提升欧几里得几何证明的准确性。
Comments long paper