ConcoLixir: Reactive LLM Discovery Oracles for Python Concolic Testing
ConcoLixir:用于Python符号执行的响应式LLM发现预言
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 针对Python符号执行中库调用降级、语义操作难解和路径覆盖停滞问题,提出ConcoLixir,利用LLM作为发现预言生成种子、输入并引导覆盖,平均行覆盖率提升8.6-17.0个百分点,成本仅$1.63。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
ConcoLixir:用于Python符号执行的响应式LLM发现预言
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 针对Python符号执行中库调用降级、语义操作难解和路径覆盖停滞问题,提出ConcoLixir,利用LLM作为发现预言生成种子、输入并引导覆盖,平均行覆盖率提升8.6-17.0个百分点,成本仅$1.63。
验证意图与危害:针对LLM生成威胁的统一防御
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出一种联合验证用户提示意图和模型响应危害的防御框架,通过专门分析器与裁决器协同工作,在五个威胁类别上平均F1提升至0.95,攻击成功率降至4.1%。
SAGE-Nav:利用LLM规划与对齐融合的分层场景图引导导航
机构 * Zhejiang University(浙江大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出SAGE-Nav分层框架,结合大语言模型与动态场景图,通过解耦全局语义规划与高频反应控制,实现高效目标导航,在i-THOR和RoboTHOR中达到最优性能。
Comments Accepted by IROS 2026
TabClean: 用于表格数据清洗的可复用LLM合成程序
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 提出TabClean系统,通过将LLM推理编译为可复用的带守卫修复程序,实现无模型训练的表格数据清洗,在五个基准数据集上F1优于基线,并大幅降低重复运行成本。
Comments 13 pages
通用指南驱动图像聚类:基于混合LLM代理
机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校) ; Amazon(亚马逊)
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 提出首个通用图像聚类框架,通过文本指南弥合任务差异,利用生成式概念代理建模和基于最小生成树的LLM遍历,在多种聚类场景中超越专用方法。
Comments CVPR 2026
理论家工具箱:基于智能体的LLM辅助经济理论研究工具
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出一种验证优先的经济理论LLM辅助协议,通过三种可重用方法(单次检查、对抗性证明-验证对、多智能体项目)在等级膨胀的Gans-Kominers特征模型上设计Groves/Pigouvian激励机制的实例验证。
三思而后行:通过隔离规划保护LLM代理免受工具描述投毒攻击
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出Tool-Guard系统级防御,通过隔离规划机制将可疑工具调用隔离到受感染列表,阻断投毒描述持续影响,在AgentDojo和ASB基准上显著降低攻击成功率并保持任务效用。
Comments Accepted to ICML 2026
基于LLM的异构机器人团队通用分层任务规划与执行及事件驱动重规划
机构 * Department of Mechanical Engineering, IIT Gandhinagar(印度加尔各直辖区理工学院机械工程系) ; Sahyadri College of Engineering and Management(萨哈亚德里工程与管理学院) ; Vishwakarma Institute of Information Technology(维什瓦克arma信息技术学院)
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 提出CoMuRoS架构,结合集中式规划与分布式执行,通过LLM解释自然语言目标、分配子任务,并支持事件驱动重规划,在硬件实验中实现自主恢复和协调运输。
Comments full version of this short paper is accepted at Frontiers in Robotics and AI Journal
对抗性同伴下的异构LLM辩论:诚实增益、替代成本与韧性
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 研究异构LLM辩论中诚实与对抗性同伴对修正行为的影响,发现诚实同伴降低有害修正率,对抗性同伴则逆转,且异构性在已有对手时也能作为防御。
文档到LLM供应链中的语义完整性失败
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 研究文档到LLM应用中的隐藏提取层导致的split-view PDF攻击,发现25种提取间隙,评估16个处理栈和7个商业LLM服务,提出静态扫描工具。
基于分解潜在推理的LLM推荐方法
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 针对现有潜在推理方法用单向量表示用户意图难以捕捉多面偏好的问题,提出分解潜在推理框架,通过多因子注意力模块解耦偏好因子,结合正则化与强化学习提升推荐性能与可解释性。
多LLM能量推理用于无二进制零日物联网检测
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 提出一种无需二进制文件、架构无关的方法,通过三LLM推理架构和能量感知符号负载模型,利用高层描述符估计零日漏洞可能性,模拟评估显示高风险条件下预测概率提升20-35%。
GaussTrace:基于证据的LLM推理的3D高斯泼溅模型溯源分析
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出GaussTrace框架,通过属性统计分析和假设驱动的编辑模拟,结合大语言模型链式推理,构建3D高斯泼溅模型的有向溯源图,无需训练或编辑历史。
Comments Accepted by ICML2026
SGTO-MAS:面向多智能体大语言模型系统的安全大猩猩部队优化
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 提出一种基于大猩猩部队优化的安全感知多智能体LLM协调方法,通过信任建模、风险感知和集体智能的联合优化,在性能、安全性和效率间取得平衡。
基于思维图的奖励进化:一种用于强化学习的双层语言模型框架
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Tokyo(东京大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract)
AI总结 本文提出RE-GoT框架,结合LLM与VLM的图思维推理,通过任务分解和视觉反馈迭代优化奖励函数,实验表明在RoboGen和ManiSkill2任务中均优于现有方法。
Journal ref IEEE International Conference on Robotics and Automation (ICRA 2026)
WildCode 再探:关于 LLM 生成代码安全性的综合实证研究
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 通过大规模实证分析真实场景下 ChatGPT 生成的代码,研究其正确性与安全性,并评估常见提示工程策略的有效性,发现 LLM 生成的代码在安全性方面经常不足。
匹配机制在LLM智能体市场中是否有效?
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 研究通过对比自由协商与集中式机制市场,发现基于机制的匹配市场在稳定性和效率上更优,且LLM智能体比人类更倾向于真实报告偏好,但策略证明性并非总能提高真实报告率。
NeuroLog: 可审计的推理——通过LLM事实、Datalog和SMT进行神经符号漏洞发现
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 提出NeuroLog流水线,结合LLM提取事实、Souffle规则组合和Z3后处理,实现无需构建的漏洞发现,并在多个真实项目中重新发现CVE级漏洞。
REALISTA: 引发LLM幻觉的逼真潜在对抗攻击
机构 * University of Waterloo(滑铁卢大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出REALISTA框架,通过潜在空间优化语义等价的对抗提示,有效引发大语言模型幻觉,优于现有方法。
Comments Accepted at ICML 2026. Code is available at https://github.com/Buyun-Liang/REALISTA
辅导效果指数:从四个对话信号预测LLM数学辅导质量
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出无需训练和外部评判的辅导效果指数(TEI),通过四个内部推理信号选择冻结模型,将预错误场景的改进率从59.0%提升至81.9%。
LLM支持的气候变化动机推理内容分析
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本研究利用大语言模型对YouTube评论进行定性标注,结合社会网络分析和线性混合效应模型,发现气候变化讨论中不同话题的互动模式差异反映了动机推理。
Comments 11 pages, 3 figures. Accepted for ASIS&T 2025
SAINT: 基于程序分析和LLM智能体的服务级集成测试生成
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出SAINT方法,结合静态分析、大语言模型和智能体,自动生成企业Java应用的服务级端点测试和场景测试,提升覆盖率和缺陷检测能力。
Comments Accepted at ICSE'26
LLM Agents Make Collective Belief Dynamics Programmable: Challenges and Research Directions
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 本文研究了LLM代理如何使集体信念动态变得可编程,探讨了挑战和研究方向,通过多智能体模拟证明协调AI代理可以诱导可测量的信念变化,并识别了使检测和防御困难的四个结构性质。
你无法欺骗我们:理解由LLM驱动的代理社区对谣言的韧性
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 本文研究了由LLM驱动的代理社区在面对可信谣言冲击时的韧性,通过构建基于LLM的代理模拟,从主动开放思维(AOT)和政治意识形态(PI)两个维度分析社区对谣言的反应机制,发现高AOT提升抗谣言冲击能力和恢复力,而PI影响恢复路径,中等意识形态社区恢复更可靠,极化社区则保留更多支持。
Comments 26 pages, 7 figures, 1 table
像人类一样调试:通过块级指令导向切片扩展基于LLM的故障定位到处理器设计
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 本文提出BluesFL框架,通过块级指令导向切片算法,利用LLM模拟人类调试过程,有效定位处理器设计中的故障,相比现有方法提升了242.9%的定位准确率。
探索VLM-LLM导航中的瓶颈:3D场景理解能力如何影响零样本VLN
机构 * Shanghai Key Laboratory of Navigation and Location Based Services, Shanghai Jiao Tong University(上海导航与基于位置的服务关键实验室,上海交通大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文研究了零样本视觉-语言导航中3D场景理解能力对性能的影响,提出了统计成功率上限,揭示了感知饱和现象,建议转向导航相关的核心词汇和准确的边界框比例。
Comments Accepted by ICRA Workshop MM-Spatial AI, Oral
SkillOps:将LLM代理技能库视为自维护的软件生态系统进行管理
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 SkillOps通过自维护软件生态系统方法管理LLM代理技能库,解决技能库中的技术债务问题,提升技能检索、组合和执行效率,实验表明其在ALFWorld上任务成功率高达79.5%。
Comments 23 pages, 9 figures. Submitted to NeurIPS 2026. Code is available at https://github.com/Hik289/SkillOps.git
PoC-Gym: 向更可靠的LLM辅助漏洞利用证明概念生成迈进
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 PoC-Gym通过结合静态与动态信息,迭代生成Java漏洞PoC,并通过多阶段验证提升可靠性,覆盖12个CVE,优于现有方法。
自洽潜在推理:面向视觉语言模型的长潜在序列推理
机构 * University of Science and Technology of China(中国科学技术大学) ; Li Auto Inc.(利亚自动化公司)
专题命中 推理与问题求解 :SFT(summary_cn,abstract);language model(title);LLM(abstract,abstract_cn)
AI总结 本文提出SCOLAR模型,通过轻量级detransformer生成辅助视觉token,结合三阶段SFT和ALPO强化学习,显著提升视觉语言模型的长序列推理能力,达到开源模型在现实任务中的最佳性能。
Comments 17 pages, 6 figures
从线程到轨迹:一个多LLM管道用于从GitHub问题讨论中提取社区知识
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 本文提出SWE-MIMIC-Bench数据集,通过多LLM管道从GitHub讨论生成问题轨迹,用于提取复杂问题的结构化知识,提升软件工程社区的协作理解与LLM训练效果。