Your Code Agent Can Grow Alongside You with Structured Memory
你的代码代理可以与你一同成长,借助结构化记忆
机构 * Tsinghua University(清华大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出MemCoder框架,通过结构化记忆和实时反馈实现人类与AI的持续共进化,提升代码代理在复杂软件工程任务中的性能。
Comments Code Agent
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
你的代码代理可以与你一同成长,借助结构化记忆
机构 * Tsinghua University(清华大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出MemCoder框架,通过结构化记忆和实时反馈实现人类与AI的持续共进化,提升代码代理在复杂软件工程任务中的性能。
Comments Code Agent
HCP-DCNet:一种用于自我改进因果理解的分层因果原语动态组合网络
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出HCP-DCNet,通过分层因果原语动态组合网络实现因果理解的自我改进,提升因果发现、反事实推理和组合泛化能力。
Comments 17 pages, 2 figures, submitted to a journal and under review
从像素到谓词:通过预训练视觉-语言模型学习符号世界模型
机构 * MIT(麻省理工学院) ; Princeton University(普林斯顿大学) ; University of Cambridge(剑桥大学) ; RAI Institute(RAI研究院)
专题命中 逻辑推理 :planning(abstract);分类 cs.AI、cs.LG
AI总结 通过预训练视觉-语言模型学习符号世界模型,以实现复杂机器人领域中长周期决策制定的零样本泛化。
Comments A version of this paper appears in the official proceedings of RA-L, Volume 11, Issue 4
多模态模型在心电图信号上的推理能力如何?
机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Rush University(拉什大学) ; ETH Zurich(苏黎世联邦理工学院) ; St. Christopher's Hospital for Children(圣克里斯opher儿童医院) ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; Google Inc(谷歌公司)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种评估多模态模型在ECG信号上推理能力的框架,通过感知和演绎两个方面验证模型的逻辑和模式识别能力。
第三项雄心:人工智能与人类行为的科学
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出利用大型语言模型作为研究人类行为、文化及道德推理的科学工具,探讨其在社会科学中的应用与方法论创新。
ARC-AGI-2技术报告
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于变压器的ARC求解系统,结合神经推理、结构感知先验和在线任务适应,通过多视角推理提升模型一般化能力,显著超越现有基线和神经求解器。
Comments 59 pages
EpisTwin:一种基于知识图谱的神经符号架构用于个人AI
机构 * Politecnico di Bari(巴里理工大学) ; Università degli Studi della Tuscia(图斯卡大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 EpisTwin通过构建个人知识图谱,结合多模态语言模型和代理协调器,实现对用户数据的语义理解和复杂推理,提升个人AI的可信度和整体认知能力。
像科学家一样思考:基于物理的LLM代理用于方程发现
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 KeplerAgent通过模拟科学家的推理过程,利用物理知识和符号回归引擎,在方程发现任务中实现了更高的准确性和鲁棒性。
通过迭代策略优化实现大语言模型的感官-运动控制
机构 * Federal University of Santa Catarina (UFSC)(圣卡塔琳娜联邦大学) ; Institute of Cognitive Sciences and Technologies (ISTC-CNR)(认知科学与技术研究所)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出通过迭代策略优化,利用大语言模型控制具身代理,结合符号知识与子符号感官运动数据实现高效控制。
Comments Final version of the article accepted for publication on Scientific Reports. 29 pages (13 pages are from appendix), 8 figures, 2 tables, code for experiments replication and supplementary material provided at https://github.com/jtyska/llm-robotics-article/
从竞争到协调:市场制作作为安全且对齐的多智能体大语言模型系统的可扩展框架
机构 * Algoverse AI Research(Algoverse AI研究院)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种基于市场机制的多智能体大语言模型协调框架,通过结构化经济交换提升推理准确性和透明度,实现自我组织和可验证推理,为安全、对齐的AI系统提供可扩展解决方案。
验证论证中政治立场预测的准确性
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出双尺度验证框架,通过点评和成对验证方法验证论证中政治立场预测的准确性,构建了大规模政治立场知识库,提升了政治领域知识表示能力。
Comments 13 pages, 6 figures, 6 tables. Under review
LogiPart: 用于大规模数据探索的本地大语言模型与逻辑分区
机构 * Tiago Fernandes Tavares(独立研究者)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 LogiPart通过本地大语言模型与逻辑分区技术,在大规模数据探索中实现高效、可解释的税目发现,克服传统方法的效率与成本限制。
Comments This version introduces a major architectural shift to Local LLMs and NLI-based assignment, scaling the framework to O(1) generative complexity. Formerly titled 'Question-Driven Analysis and Synthesis'
看见以泛化:视觉数据如何纠正绑定捷径
机构 * Department of Computer Science, Pontificia Universidad Católica, Santiago, Chile(计算机科学系,天主教大学,圣地亚哥,智利)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 视觉数据训练可增强模型在单模态任务中的推理与泛化能力,通过改变绑定策略提升分布外性能。
Comments Submitted to ICML 2026
神经符号动作遮蔽用于深度强化学习
机构 * Utrecht University(乌得勒支大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 NSAM通过自动学习符号模型与深度策略优化结合,提升深度强化学习的样本效率并减少约束违规。
SWE-AGI:在自主代理时代利用MoonBit进行规范驱动软件构建的基准测试
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 SWE-AGI通过MoonBit评估LLM在规范驱动下的软件构建能力,揭示了AI辅助开发中代码阅读瓶颈及模型性能随任务难度变化的特性。
Comments 20 pages, 3 figures
ReasonCACHE: 教授大语言模型进行推理而不进行权重更新
机构 * FAIR at Meta(Meta 的 FAIR) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 ReasonCACHE通过前缀微调实现无需权重更新的推理学习,在效率和表现上超越传统ICL和IWL方法。
Comments 26 pages, 17 Figures
ASP-Bench: 从自然语言到逻辑程序
机构 * Algorithms and Complexity Group TU Wien(算法与复杂性组维也纳技术大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 ASP-Bench通过自然语言到逻辑程序的转换基准,评估了基于ReAct框架的代理方法,揭示了建模难度的多维因素。
MultiVis-Agent:一种带有逻辑规则的多智能体框架,用于可靠且全面的跨模态数据可视化
机构 * The Hong Kong Polytechnic University(香港理工大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; The Hong Kong University of Science(香港科学大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 MultiVis-Agent通过引入逻辑规则的多智能体框架,提升多模态数据可视化的可靠性与全面性,实现高评分和高完成率。
Comments Accepted to SIGMOD 2026
逻辑的粘度:DPO对齐中的相变与滞后效应
机构 * Department of Mathematics, Trent University, Peterborough, ON, Canada(数学系,特伦特大学,彼得伯勒,加拿大)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究发现DPO对齐中β参数的非单调性及滞后效应,揭示能力与边际的反相关性,推动能力解析评估方法的发展。
Comments 10 Pages, 5 Figures
用于神经符号AI的张量网络形式化
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种张量网络形式化方法,用于统一神经和符号AI,通过结构化张量分解实现逻辑与概率模型的混合训练。
Comments 51 pages, 14 figures
具有贝叶斯深度学习的约束感知神经符号不确定性量化框架用于科学发现
机构 * Department of Computer Science and Engineering Muffakham Jah College of Engineering and Technology (MJCET)(计算机科学与工程系穆法卡姆·贾赫工程与技术学院)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 CANUF通过结合贝叶斯深度学习与可微符号推理,首次实现科学预测中的不确定性量化、约束满足和可解释性解释。
评估LLM在招聘中的行为:隐含权重、群体公平性及与人类偏好的一致性
机构 * Malt
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出评估LLM招聘决策的框架,发现模型重视核心生产力信号,但对某些特征的解释超出显性匹配价值,且不同群体间权重存在差异。
SIN-Bench:在长上下文多模态科学交织文献中追踪原生证据链
机构 * Tsinghua University(清华大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; KuaiShou Inc.(快手公司) ; Stanford University(斯坦福大学) ; Harvard University(哈佛大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 SIN-Bench 通过构建科学交织语料库和四个逐步任务,评估多模态模型在长上下文科学文献中追踪证据链的能力,揭示接地是主要瓶颈。
通过参数化阶段令牌消除引言生成中的代理工作流
机构 * School of Economics and Management, East China Normal University(经济管理学院,东华大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出STIG方法,通过参数化阶段令牌消除代理工作流,使LLM在单次推理中生成连贯的引言,提升逻辑结构和语义相似性。
Grokking是否值得?Transformer中泛化电路的功能分析与可迁移性
机构 * Department of Computer Science University of Texas at Dallas(计算机科学系 德克萨斯大学达拉斯分校)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了Transformer中泛化电路的功能与可迁移性,发现grokking过程是整合记忆事实到自然推理路径,而非突然获得新范式,且其在迁移新知识时存在局限。
神经符号合规:整合大语言模型与SMT求解器用于自动化金融法律分析
机构 * Department of Management Information Systems, National ChengChi University, Taipei, Taiwan(管理信息系,中华大学,台北,台湾) ; Department of Electrical Engineering, National Taiwan University, Taipei, Taiwan(电子工程系,台湾大学,台北,台湾)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本研究整合大语言模型与SMT求解器,提出神经符号合规框架,用于自动化金融法律分析,实现形式可验证性和基于优化的合规修正。
Comments 10 pages, 6 tables, 3 figures, accepted by the 2nd ACM AIware Conference
迈向符号化XAI——通过人类可理解的特征间逻辑关系进行解释
机构 * Berlin Institute for the Foundations of Learning(柏林学习与数据基础研究所) ; Machine Learning Group, Technical University of Berlin(柏林技术大学机器学习组) ; Department of Artificial Intelligence, Korea University(韩国大学人工智能系) ; Department of Mathematics and Computer Science, Free University of Berlin(柏林自由大学数学与计算机科学系)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出符号化XAI框架,通过人类可理解的逻辑关系解释模型决策,提升AI透明度和可解释性。
从策略到逻辑:为高效和可解释的覆盖评估而设
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种结合覆盖意识检索器和符号规则推理的方法,以提高医疗覆盖政策审查的效率和可解释性,同时降低模型成本并提升评估准确性。
Comments Accepted at AIMedHealth @ AAAI 2026
DeepResearch-Slice: 通过显式文本切片弥合检索-利用差距
机构 * NLPR & MAIS CASIA(CASIA NLPR与MAIS) ; School of AI UCAS(UCAS人工智能学院) ; Meituan Inc.(美团公司)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 DeepResearch-Slice通过显式文本切片技术,有效解决检索与利用之间的差距问题,提升模型在嘈杂环境中的鲁棒性。
Comments Ongoing work
LAG: 从笛卡尔视角出发的逻辑增强生成
机构 * The Hong Kong Polytechnic University(香港理工大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 LAG通过系统的问题分解、原子记忆库和逻辑感知推理,提升知识密集型任务的准确性和减少幻觉。