Reassembling Distributed Risk: Trajectory-Conditioned Action Generation for Multi-Turn Agent Safety
重构分布式风险:面向多轮智能体安全的轨迹条件动作生成
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 针对多轮分解攻击下使用工具的LLM智能体的安全风险,提出生成时防御方法ReDiR,通过轨迹级安全条件整合跨轮安全信息,将攻击成功率降至8%以下,可迁移且开销低。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
重构分布式风险:面向多轮智能体安全的轨迹条件动作生成
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 针对多轮分解攻击下使用工具的LLM智能体的安全风险,提出生成时防御方法ReDiR,通过轨迹级安全条件整合跨轮安全信息,将攻击成功率降至8%以下,可迁移且开销低。
面向多智能体AI中资源感知共识的控制论方法
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 该研究针对LLM-MAS共识性能与计算资源关联保证不足的问题,提出将集体信念动态表征为离散时间切换系统的控制论方法,构建共识-预算证书区域,实现资源感知的多智能体协调。
具身学习的可扩展任务生成:基于 affordance 的任务世界
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文提出 AGT-World 框架,通过结构化图方法实现任务空间的精确分解,并结合混合反馈机制实现策略的自进化,从而提升机器人任务生成的可扩展性和泛化能力。
CoSTALA:基于多粒度层次对比学习的组合式时空音频-语言对齐
机构 * Xi’an Jiaotong Liverpool University(西交利物浦大学) ; MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus) ; University of Oulu(奥卢大学) ; Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所)
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 CoSTALA通过多粒度层次对比学习构建新型训练范式,解决传统ALM难以处理多事件音频序列的问题,为时空音频理解提供强大新框架。
EgoErrorVQA:通过程序错误评估自我主体人工智能的以自我为中心的理解能力
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Nanyang Technological University(南洋理工大学)
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 针对现有视觉智能体和VLMs忽略以自我为中心视角评估程序理解能力的问题,本文提出EgoErrorVQA任务,开发基于A2A协议的评估智能体,引入Ego-ADR框架提升模型对程序错误的理解,取得良好效果。
是什么让初始反应适合讨论?:用于立场反思与写作的多角色AI支持
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本研究提出多角色AI工具StanceLab,通过对比三角色模式与独立LLM模式的试点,明确了设计需求并规划了未来工作流,助力用户准备讨论立场。
Comments 5 pages, 3 figures, 2 tables. Accepted to TAICHI 2026 (https://taichi2026.taiwanchi.org/program)
基于大语言模型辅助兼容性分析的数字孪生集成与重用多视点建模框架
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文提出基于RM-ODP的多视点DT集成建模框架,结合LLM辅助的不匹配检测,实现结构化兼容性推理,提升互操作性,支持异构DT生态系统的可扩展模型重用。
Comments 45 page, 14 figs, 6 tables, 2 Appendix, Submitted to the International Journal on Software and Systems Modeling (SoSyM)
面向可操作的可视化:十年之后,生成式AI带来了什么改变,又有什么是它做不到的
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 该研究回顾了十年前软件可视化领域的研究现状,探讨生成式AI对该领域的改变与局限,提出未来应聚焦于帮助人类理解复杂软件系统及AI生成内容,并指出可操作可视化已成为该领域可达成的标准。
Comments 2026 IEEE Working Conference on Software Visualization (VISSOFT)
SkyNative: 一种面向遥感视觉证据推理的原生多模态框架
机构 * College of Computer Science and Technology, Jilin University, China(吉林大学计算机科学与技术学院) ; Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室)
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文提出SkyNative,一种原生多模态框架,通过去除预训练视觉骨干,直接在语言模型token空间中表示图像为原始patch tokens,以提升遥感图像的细粒度空间推理能力。
SurgTEMP:基于文本引导的视觉记忆的时序感知手术视频问答系统用于腹腔镜胆囊切除术
机构 * University of Strasbourg(斯特拉斯堡大学) ; CNRS(法国国家科学研究中心) ; INSERM(法国国家健康与医学研究院) ; ICube, UMR7357(ICube实验室,UMR7357)
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 SurgTEMP通过文本引导的视觉记忆和时序感知模块,提升手术视频问答的性能,其核心方法是构建层次化的视觉记忆并采用手术能力进步训练方案,从而在复杂手术场景中实现更准确的问答与评估。
Comments 29 pages, 14 figures, 9 tables
视觉语言模型如何失败?组合式视觉问答中的视觉-操作不对齐
机构 * Singapore Institute of Technology(新加坡科技学院) ; NVIDIA(英伟达)
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 研究组合式视觉问答中视觉语言模型失败的机制,引入以操作为中心的框架分解失败模式,揭示四种失败模式及传播路径,表明不同失败类型需不同纠正策略,为提升模型可靠性提供基础。
Comments Accepted at ACM Multimedia 2026
COMA:针对安全检索增强生成(Security-RAG)的组合式误导攻击类别及因果反事实防御
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 该研究针对Security-RAG提出COMA组合式误导攻击,含行动破坏与结论翻转两种实现,提出因果反事实防御(ccd)可有效定位并防御该攻击,已发布攻击种子与ccd参考实现。
Comments Accepted at the IEEE Conference on Generative AI for Secure Systems (GAISS) 2026
别让AI代理占用你的文件:将信息和控制移交给文件系统以实现代理安全和自主性
专题命中 复杂问题求解 :self-correction(abstract)
AI总结 本文研究了AI代理对文件系统的滥用问题,提出YoloFS文件系统通过三种技术提升代理的安全性和自主性,减少用户交互并提高任务完成率。
大语言模型可以成为基数估计器吗?一项实证研究
专题命中 复杂问题求解 :self-correction(abstract)
AI总结 本文探讨了大语言模型在基数估计中的应用,通过实验证明其在泛化能力、复杂查询支持和数据效率方面的优势,展示了其在数据库管理系统中的潜力。
先结构后查询:支持对非结构化文档进行精确分析查询
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 AnnoIndex通过注释索引与结构化查询引擎,解决非结构化文档精确分析查询难题,在三个数据集上平均F1达0.87,优于现有基线方法。
生成后优化:面向基于大语言模型的程序修复中正确且简洁的补丁
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 针对基于LLM的程序修复中补丁冗余问题,提出RECAP适配器,在保留或提升解决率的同时,大幅降低补丁大小,实现更优的大小-正确性权衡。
探究人工智能生成的物理解答并培养学生对其进行评判的能力
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本研究通过调整框架评估OpenAI的o4-mini生成的物理解答,发现明确提示可提升解答完整性,MAPS指导能让学生更精准评判AI解答,为物理教育研究提供了新视角。
Comments 6 pages, 1 figure, Physics Education Research Conference 2026
LDI:面向文本丰富表的局部数据填补
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文提出LDI框架,通过局部推理利用LLM填补文本丰富表中的缺失值,提升准确性和可解释性,实验证明其优于现有方法。
ConnectionMind:利用社交网络与大语言模型实现 Meta 平台的个性化推荐
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 该研究提出 ConnectionMind 框架,结合社交网络与 LLM,经两阶段学习训练后,在 Meta 部署并通过 A/B 测试实现视频观看时长 0.43% 的提升,解决传统推荐模型的多关系上下文整合不足问题。
SocialFiVis:面向社会金融中基于大语言模型的多智能体模拟的可视分析沙箱
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 该研究提出嵌入IAD框架的可视分析沙箱SocialFiVis,结合LLM与PRA引擎模拟多智能体,支持探索社会金融领域反事实政策并解释相关涌现现象。
Comments 11 pages, 7 figures, 2 tables. Accepted to IEEE VIS 2026; to appear in IEEE Transactions on Visualization and Computer Graphics
Tangent:基于大语言模型的智能体应用测试实践的实证研究
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 Tangent通过对开源项目和行业从业者的研究,分析了LLM智能体应用的测试现状,发现其以单元测试为主、存在覆盖不足等问题,并提出了相关研究方向。
Comments Accepted at ASE'26
触摸还是聊天:大语言模型和触觉图表对视力障碍者学习复杂图表类型的效用
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 研究探讨大语言模型对视力障碍者图表类型学习的影响及触觉学习的作用,通过扩展触觉图表学习工具并比较两种学习形式,发现触觉模板有助于形成心理模型,利于后续数据探索,无触觉支持的文本加LLM解释在空间推理任务中有弱点。
如何构建马库斯的代数思维:从明斯基的情感机器视角出发
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文从明斯基的《情感机器》视角解读VaCoAl架构,探讨如何构建马库斯的代数思维。通过精确可逆性实现内省,将思考分三层,还承载泛类比和信用分配观点,有助于提升到内省层次并找到交叉点,为构建代数思维提供新视角。
Comments 19 pages
如何构建马库斯的代数思维:从萨伽德的脑-心观点出发
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 该研究从萨伽德的脑-心观点出发,探讨如何构建马库斯的代数思维。提出VaCoAl和PyVaCoAl架构,其绑定操作具有可逆等特性,能填补马库斯代数思维组件空缺,消除卷积退化,还通过相关主张阐述了能力、必要性及自身立场。
Comments 23 pages
令牌效率指数:用于AI令牌效率的同行基准复合指标
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 该研究提出TEI,一种同行基准复合指标,通过纳入组织AI使用数据计算三类指标并聚合,生成0-100分等结果,以透明方式基准AI令牌效率并识别支出优化机会。
Comments 11 pages, 6 figures
专题命中 复杂问题求解 :reasoning(abstract)
EgoAfford:基于自我中心指称分割的面向任务的可供性定位
专题命中 复杂问题求解 :planning(abstract)
AI总结 针对部件级可供性定位难以适配复杂多步桌面任务的问题,提出基准EgoAfford及参考模型EgoLens,验证了下一步推理与动作角色条件部件定位的互补挑战,为感知与规划联合研究提供基础。
ToolArtist:用于智能体图像生成的工具使用统一多模态模型
机构 * RUC(中国人民大学) ; HKUST(GZ)(香港科技大学(广州)) ; NUS(新加坡国立大学) ; UCD(加州大学戴维斯分校)
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 本文提出ToolArtist,一种全智能体图像生成模型,通过后训练UMM实现,采用RAD-GRPO方法优化,将完整开放世界图像生成过程置于智能体控制下,性能优于部分控制方案。
借助AI智能体构建建设性冲突以提升新手交互设计师的重新考量能力
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 该研究构建受对抗性设计理论启发的AI智能体,通过45名设计学生的实验发现,该智能体实施的建设性冲突可提升新手交互设计师的重新考量能力,推动设计改进与创意拓展。
Comments 8 pages, 4 figures, conditionally accepted to Human-Agent Interaction 2026
BloomAPR:基于布鲁姆教育目标分类学的框架,用于评估大语言模型驱动的自动程序修复(APR)方案的能力
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 BloomAPR是基于布鲁姆教育目标分类学的动态评估框架,评估了ChatRepair、CigaR等APR方案在不同LLM及布鲁姆分类层级下的漏洞修复能力,发现其存在性能差异并指出基准演进的必要性。
Comments 22 pages, 7 figures, Manuscript submitted to ACM Transactions on Software Engineering and Methodology