Cognitive Argumentation and the Suppression Task
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI
专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.LG
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.LG
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI
专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI
专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI
Comments Paper presented at the 34nd International Conference on Logic Programming (ICLP 2018), Oxford, UK, July 14 to July 17, 2018 18 pages, LaTeX, 8 PDF figures (arXiv:YYMM.NNNNN)
专题命中 逻辑推理 :planning(abstract);verifier(abstract);分类 cs.AI
Comments 26th International Joint Conference on Artificial Intelligence 2017; Special Track on AI & Autonomy
专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI
专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI
Comments 14 pages, a 12-page version accepted by LORI V
专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI
Comments 16 pages, 1 figure, International Conference on Logic Programming 2010
Journal ref Theory and Practice of Logic Programming, Volume 10, Special Issue 4-6, July 2010, pages 675-690
专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI
Comments 66 pages, 1 figure, to be published in "Theory and Practice of Logic Programming"
从错误到证明:最小核心引导的神经符号约束求解修复
专题命中 逻辑推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG;reasoning(comments)
AI总结 该研究提出最小核心引导的修复方法,将语言模型生成的不可满足程序的错误消息替换为最小不可满足核心,在77个问题的基准上使弱模型编造不可行问题解的比例从79%降至7%,核心价值是提供证书并拒绝编造解。
Comments 7 pages, 2 figures. Accepted at the IJCAI-ECAI 2026 Workshop on Logic and Symbolic Reasoning (LogiSymb), poster
EnvHarness:为智能体学习唤醒静态环境
专题命中 逻辑推理 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 EnvHarness是包裹静态环境的可编程插件层,结合EnvRigger自动合成组件,在多领域基准测试中提升智能体学习性能,减少执行步骤并支持策略与环境协同进化。
StocksTalk:一种面向网络数据结构化查询生成的语音赋能对话智能体
机构 * IIIT-Delhi(德里印度信息技术学院) ; Singapore Institute of Technology(新加坡理工学院)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 StocksTalk是一种语音赋能对话系统,可将口语化金融请求转为结构化查询,通过多模块提升准确性,为股票筛选决策提供支持。
PDDL-ART:基于演示的自主符号抽象方法,用于使用视觉语言模型的长时程机器人操纵
机构 * University of Michigan(密歇根大学)
专题命中 逻辑推理 :reasoning(abstract);planning(abstract)
AI总结 PDDL-ART是一种基于VLM的框架,可自主从演示生成PDDL描述,经多阶段校正确保语义对齐,在发动机维护和家庭操纵任务上平均成功率达93.3%,优于基线规划器。
错误但有用:多智能体消息中超越答案正确性的轨迹价值
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出DHD协议,发现多智能体错误消息含有用信息,错误但有帮助的消息普遍存在,其轨迹价值可辅助决策,答案正确性不决定轨迹价值。
Comments 24 pages, 9 figures. Includes an appendix and an ancillary reproducibility artifact
监督之前的感知:来自反事实盲区的自包含视觉蒸馏
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Aalto University(阿尔托大学)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)
AI总结 该研究提出首个完全自包含的视觉自蒸馏框架 CVPD,通过识别模型视觉盲区生成密集对比监督,在 Qwen3-VL-8B-Instruct 上的 12 个基准中优于 6 个自进化基线,取得多项指标提升且无性能倒退。
Comments BMVC 2026
ACEM:面向智能体软件工程的成本估算模型
专题命中 逻辑推理 :reasoning(abstract);planning(abstract)
AI总结 针对智能体软件工程成本估算问题,本文提出ACEM模型,分解成本为LLM、HITL、基础设施三类,引入RF、CF、HIS构念并映射传统度量,为智能体开发成本估算提供早期方案。
Comments 27 pages, under journal publication
AgentModernize: 通过多智能体LLM和行为规范图在遗留系统现代化中保留业务逻辑
专题命中 逻辑推理 :CoT(abstract,abstract_cn)
AI总结 本文提出AgentModernize框架,通过多智能体系统和行为规范图来保留业务逻辑,解决传统方法在遗留系统现代化中丢失隐含规则和交叉模块约束的问题,实验表明该方法在多个场景中表现优异。
Comments 10 pages, 8 tables, 1 figure
冲突感知融合:通过结构化认知先验缓解大语言模型中的逻辑惯性
机构 * Xtracta & Strong AI Lab, University of Auckland(Xtracta与强人工智能实验室,奥克兰大学) ; School of Humanities, China University of Political Science and Law(人文学院,中国政法大学) ; Strong AI Lab, University of Auckland(强人工智能实验室,奥克兰大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对大语言模型在规则系统结构扰动下表现脆弱的问题,提出冲突感知融合训练流程,通过验证-演绎结构先验和符号推理奖励,在多个压力测试中实现鲁棒性饱和。
认知YOLO:基于数据第一性原理的大语言模型驱动的架构合成用于目标检测
机构 * Xi’an University of Posts and Telecommunications(西安邮电大学)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)
AI总结 针对通用目标检测算法在垂直场景的问题,认知YOLO利用大语言模型与自主智能体协作,构建“分析-合成-编译”管道,合成轻量级模型,显著压缩参数数量,在mAP@0.5:0.95上表现良好,平衡了模型紧凑性和特征表示能力。
Comments 11 pages, 3 figures, 6 tables
自动化即时Python类型注释更新
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)
AI总结 研究Python项目中类型注释易过时问题,提出基于大语言模型的TypeUp方法自动更新类型注释,能依据旧注释和代码更改生成新注释,性能优于现有方法,在实际项目评估中展现实用价值。
Comments 12 pages, accepted by ICSE 2026
图原生强化学习通过概念重组实现可追溯的科学假设生成
机构 * Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出图原生推理模型Graph-PRefLexOR,结合GRPO强化学习将推理组织为显式阶段,在材料科学100个开放问题上推理可追溯性提升40-65%,语义多样性增加2-3倍。
注意力-only变换器中间接对象识别最小电路的涌现
机构 * Saarland University(萨尔大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过从头训练小型注意力-only变换器,在符号化的间接对象识别任务中发现,单层模型仅需两个注意力头即可实现完美准确率,揭示了任务特定训练如何诱导可解释的最小电路。
Comments Published at ACL (Volume 4: Student Research Workshop) ISBN: 979-8-89176-393-7 URL: https://aclanthology.org/2026.acl-srw.4
VDAWorld: 通过VLM导向的抽象与模拟进行世界建模
机构 * University of Cambridge(剑桥大学)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)
AI总结 提出VDAWorld框架,利用视觉语言模型自主构建场景表示并选择物理模拟器,通过抽象与自适应模拟实现高质量世界建模,在交互控制、反事实生成和物理逻辑推理任务上取得最优结果。
Comments Website: https://felixomahony.github.io/vdaworld/
视觉会撒谎,一致性说话:在视觉-语言模型中解耦空间注意力与可靠性
机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) ; Algoverse AI Research(Algoverse AI研究) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出VLM可靠性探针(VRP),通过结构注意力指标和生成动态分析,发现空间注意力与准确性几乎无关(R≈0.001),而自一致性是可靠性的主要预测因子(R=0.429),揭示了视觉特征与最终生成之间的符号脱离现象。
Comments 16 pages. Accepted to the ICLR 2026 Workshop on Multimodal Intelligence. Code: https://github.com/itsloganmann/VLM-Reliability-Probe
零源大语言模型幻觉检测:类人类标准探测
机构 * South China University of Technology(华南理工大学) ; The University of Melbourne(墨尔本大学) ; Pazhou Laboratory(帕乔实验室) ; Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出HCPD范式,通过类人类标准探测机制模拟人类评估者的多面推理,结合奖励对齐和多样本聚合,实现零源条件下的有效可解释幻觉检测。
Comments Accepted at ICML 2026
灵活性陷阱:重新思考扩散语言模型中任意顺序的价值
机构 * LeapLab, Tsinghua University(清华大学Leap实验室) ; NLPLab, Tsinghua University(清华大学自然语言处理实验室) ; Tsinghua University(清华大学) ; Alibaba Group(阿里巴巴集团) ; BNRist, Tsinghua University(清华大学北京研究院)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文发现,尽管扩散语言模型(dLLMs)允许任意生成顺序,但这种灵活性可能限制其推理能力,通过采用标准的Group Relative Policy Optimization(GRPO)方法,即JustGRPO,在保持并行解码能力的同时提升了推理性能。
Comments Code and pre-trained models: https://github.com/LeapLabTHU/JustGRPO
OpenSkill: 面向LLM智能体的开放世界自我进化
机构 * Lehigh University(莱维大学) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; Salesforce AI Research(Salesforce人工智能研究) ; Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院)
专题命中 逻辑推理 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出OpenSkill框架,使智能体在无目标任务监督下,利用开放世界资源自举构建技能和验证信号,实现自我进化,在多个基准上取得最佳自动通过率。
Comments 20 pages, 4 figures and 8 tables. Code is avalable at https://github.com/OpenLAIR/OpenSkill
保护沙箱:计算机图形学教育中面向过程监控的无根容器化框架
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)
AI总结 提出VISMATIC框架,通过无根容器隔离和API级用户交互追踪,在计算机科学教育中实现过程监控的同时保障基础设施安全。
Comments 13 pages, 7 figures. Source code: https://github.com/german-arroyo-moreno/VISMATIC