When Agents Do Not Stop: Uncovering Infinite Agentic Loops in LLM Agents
当智能体不停止:揭示LLM智能体中的无限循环
专题命中 逻辑推理 :planning(abstract)
AI总结 提出IAL-Scan静态分析工具,通过抽象智能体代码为Agent IR并构建循环依赖图,检测LLM智能体项目中因反馈路径未有效约束导致的无限循环故障,在6549个仓库中达到91.9%精度。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
当智能体不停止:揭示LLM智能体中的无限循环
专题命中 逻辑推理 :planning(abstract)
AI总结 提出IAL-Scan静态分析工具,通过抽象智能体代码为Agent IR并构建循环依赖图,检测LLM智能体项目中因反馈路径未有效约束导致的无限循环故障,在6549个仓库中达到91.9%精度。
探究性行动逻辑
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出探究性行动逻辑InqAL,一种用于推理行动的多主体模态逻辑,通过问题模态分析主体对结果的确定作用,并证明其完备性和可判定性。
Comments In Proceedings AiML 2026, arXiv:2606.29444
Journal ref EPTCS 447, 2026, pp. 222-241
验证门控的智能工业多机器人系统任务状态治理
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出验证门控任务状态治理框架,通过同步任务森林与黑板状态,经确定性验证后原子提交,减少无效提交和冲突,提升工业多机器人系统安全与效率。
EEmo-Logic:面向全面图像诱发情感评估的统一数据集与多阶段框架
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出最大图像诱发情感理解数据集EEmoDB和统一多模态大语言模型EEmo-Logic,通过指令微调和任务定制GRPO实现细粒度情感问答与评估。
未来是代理的:多代理推荐系统定义、视角和开放挑战
专题命中 逻辑推理 :reasoning(abstract)
AI总结 本文探讨多代理推荐系统从被动生成到主动规划的转变,提出基于状态代理的框架,分析其在提升推荐效果中的作用,并通过实验验证代理系统在不同场景下的有效性。
Comments Added controlled experiments to illustrate the points of the paper. Also edited for more clarity in conveying the concepts
ConcoLixir:用于Python符号执行的响应式LLM发现预言
专题命中 逻辑推理 :reasoning(abstract)
AI总结 针对Python符号执行中库调用降级、语义操作难解和路径覆盖停滞问题,提出ConcoLixir,利用LLM作为发现预言生成种子、输入并引导覆盖,平均行覆盖率提升8.6-17.0个百分点,成本仅$1.63。
TabClean: 用于表格数据清洗的可复用LLM合成程序
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出TabClean系统,通过将LLM推理编译为可复用的带守卫修复程序,实现无模型训练的表格数据清洗,在五个基准数据集上F1优于基线,并大幅降低重复运行成本。
Comments 13 pages
从局部修正到通用技能:利用MEMO改进神经符号策略
机构 * Collab ; Dept. of Mechanical Engineering, Virginia Tech, Blacksburg, USA.(机械工程系,弗吉尼亚理工学院,黑斯堡,美国) ; TEA Lab(TEA实验室)
专题命中 逻辑推理 :reasoning(abstract)
AI总结 针对机器人神经符号策略中技能不足的问题,提出MEMO框架,通过收集、聚类和改写多用户自然语言修正,构建检索增强的技能手册,动态扩展技能库,实现新任务泛化。
CEDAR-42001: 从ISO/IEC 42001符合性到面向架构、可审计可见的AI信息物理系统保障态势
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出CEDAR-42001方法,将ISO/IEC 42001审计证据转化为架构感知的保障态势,通过分层归因、成熟度评估和行动推荐,揭示符合性审计的局限性,并在自动驾驶案例中验证。
Comments 19 Pages, 3 figures, 4 tables. Code and data are available in the accompanying artifact repository
AgenticOS: 面向自主AI代理的意图导向安全操作系统架构
专题命中 逻辑推理 :planning(abstract)
AI总结 针对LLM驱动代理面临的结构性安全挑战,提出AgenticOS架构,将OS从资源管理器重构为意图过滤器,通过四层架构和意图ABI实现最小权限环境。
Comments 11 pages,5 figures,1 tables
LLM4CAD-Editor:一种面向多层级计算机辅助设计编辑的意图感知大语言模型框架
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出LLM4CAD-Editor框架,通过结构化领域特定语言LLM4CAD-DSL实现自然语言驱动的CAD编辑,支持功能、操作和参数三级编辑,在参数级编辑上达到96.3%解析准确率和0.935 IoU。
通过知识增强的LLM智能体实现左移高层次综合验证
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出一种知识增强的智能体驱动左移验证框架,通过双层级一致性检查、符号执行和HLS验证知识图谱,在综合前自动验证C与HLS-C的功能一致性,覆盖率达98.26%。
超越线性可分上限:对齐视觉-语言模型中的表征
机构 * Applied Artificial Intelligence Group(应用人工智能小组) ; Tallinn University of Technology(塔林技术大学)
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出线性可分上限(LSC)诊断框架,发现VLM存在对齐差距,并通过对比目标重塑视觉流形,使模型在抽象组合推理任务上显著超越LSC。
Comments Accepted TMLR
神经符号AI中的安全性、安全性和认知风险
专题命中 逻辑推理 :reasoning(abstract)
AI总结 本文系统分析了神经符号AI在五层架构中的攻击面,提出统一威胁模型、符号层威胁目录及认知风险分析,并通过三个实证基准验证了攻击的有效性与检测挑战。
Comments 28 pages, 1 figure, 10 tables
注意差距:诊断图像内文本编辑中的约束发现失败
专题命中 逻辑推理 :reasoning(abstract)
AI总结 通过图像内文本编辑的受控诊断,研究多模态模型在发现未明确指定的视觉依赖约束时的失败,发现模型仅能自行发现46%的约束,而明确提供时可达94%。
从帧到时间图:基于视觉语言模型的上下文第一人称动作识别
机构 * University of Alicante(阿利坎特大学) ; ETH Zürich(苏黎世联邦理工学院) ; Microsoft(微软)
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出将视频转换为时间动作图,通过多阶段提示生成自然语言叙述并结构化,实现上下文学习,在EGTEA和Epic-Kitchens-100上显著提升零样本和少样本动作识别性能。
OSDAG: 面向高效多机器人协作的在线调度
机构 * Japan Advanced Institute of Science and Technology(日本北陆先端科学技术大学院大学) ; University of Engineering and Technology, Vietnam National University(越南国立大学工程技术大学) ; Hanyang University(汉阳大学)
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出OSDAG框架,结合LLM任务推理与DAG在线调度,通过一次性分解指令为依赖图并实时分配任务,相比对话式方法推理速度提升5-15倍,调度时间缩短38%。
产生义务的动作
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出情境演算中处理产生义务动作的框架问题的解决方案,通过简化可达关系并扩展Reiter的基本动作理论,实现了义务的直觉性质。
KnowML: 利用攻击知识图提升ML-NIDS的泛化能力
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出KnowML框架,通过LLM构建攻击知识图并编码到特征空间,解决异常检测NIDS因特征空间缺陷导致的泛化问题,在仅用良性流量训练时实现高达99%检测率且误报率≤0.0137%。
Comments Accepted at EuroS&P 2026
Acoda:对抗性代码混淆防御基于LLM的分析
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出基于遗传算法的对抗性代码混淆框架Acoda,通过8种语义保留的混淆方法迭代优化,有效诱导LLM拒绝或误判代码分析,在7个先进LLM上攻击成功率高达70%。
一种用于LLM驱动服务放置的神经符号Prolog技能
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出一种基于Prolog技能的神经符号方法,将服务放置意图转化为符号事实和规则,利用Prolog进行约束验证和推理,实现可检查的策略感知放置。
RECON:一种增强LLM的逆向约束分析框架
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出RECON框架,结合LLM语义理解与静态分析,从Android字节码中提取精确执行约束,比传统符号执行快5.8倍且成功率达100%。
证据市场
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出证据市场,通过动态调整流动性的对数市场评分规则,激励提交证据和信念,支持内生解决,证明有界损失、证据按市场不确定性奖励,并实现ε-DSIC策略。
MedSIGHT:迈向医学大型视觉语言模型中的基础视觉理解
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出MedSIGHT框架,通过区域感知器、医学区域码本和渐进训练策略,统一医学视觉语言模型的语义理解和像素级分割,在72K数据上达到多模态理解与分割的SOTA。
Comments Accepted at ICML 2026
基于循环线性时序逻辑的多机器人系统高效协调与同步
机构 * Department of Information Engineering, University of Padova(帕多瓦大学信息工程系) ; Division of Decision and Control Systems, School of Electrical Engineering and Computer Science, KTH Royal Institute of Technology(皇家理工学院电气工程与计算机科学学院决策与控制系统系)
专题命中 逻辑推理 :planning(abstract)
AI总结 提出一种结合离线计划综合与在线协调的底层方法,通过实时通信动态调整计划,并引入同步机制处理动作延迟,实现多机器人系统的可扩展协调与同步框架。
Comments Submitted for publication at IEEE ICRA 2025
Journal ref Proc. IEEE ICRA, 2025, pp. 10194-10200
面向自主数据科学的持久化案例记忆:一种CBR增强的R&D-Agent与本地可部署的小语言模型
专题命中 逻辑推理 :reasoning(abstract)
AI总结 本文提出一种CBR增强的R&D-Agent,通过持久化案例库和小语言模型Gemma 4 31B Dense,在Kaggle竞赛中实现方向性精度提升和方差降低。
Comments 14 pages, 8 figures, 8 tables; preprint, not submitted to any venue; code available at https://github.com/stofe94/cbr-rd-agent
基于时间逻辑规范的主动感知与控制
专题命中 逻辑推理 :planning(abstract)
AI总结 本文提出一种结合信念空间规划和符号控制的可扩展任务与运动规划框架,用于不确定环境,通过概率时间逻辑(PRTL)规范的反例引导归纳合成算法实现主动感知以满足规范要求。
Comments L-CSS submission
多机器人系统中使用编织群的机器人交互
专题命中 逻辑推理 :planning(abstract)
AI总结 本文提出利用编织群元素描述机器人交互模式,以实现安全的协作运动和传感器信息交换。
TimeLogic Challenge @ CVPR 2026: 强多模态大语言模型遇见面向时序逻辑视频问答的证据搜索智能体
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出一种基于证据搜索智能体的无训练时序逻辑视频问答方法,通过多粒度采样工具包和分类引导策略,在TimeLogic测试集上达到77.13 AvgAcc。
Agent技能应超越文本:视觉技能的必要性
机构 * Peking University(北京大学) ; University of Wisconsin(威斯康星大学) ; MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)
专题命中 逻辑推理 :reasoning(abstract)
AI总结 针对现有技能学习方法仅存储文本经验导致视觉任务瓶颈的问题,提出多模态技能范式,结合文本逻辑与视觉支持,通过自动系统将经验转化为可复用的视觉技能,在GUI等视觉任务中显著优于纯文本技能。