Message Order Selects Opposite Collective Opinions on Laplacian-Cospectral Networks
消息顺序在拉普拉斯谱网络上选择对立的集体意见
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 该研究构建类量子状态的智能体网络模型,发现相同消息的传递顺序会使两个16节点拉普拉斯谱相同的网络收敛到对立共识,揭示消息顺序对集体意见选择的关键作用。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
消息顺序在拉普拉斯谱网络上选择对立的集体意见
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 该研究构建类量子状态的智能体网络模型,发现相同消息的传递顺序会使两个16节点拉普拉斯谱相同的网络收敛到对立共识,揭示消息顺序对集体意见选择的关键作用。
评估技能,而非仅评估智能体:智能体驱动的技能持续评估
机构 * NVIDIA(英伟达)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract,abstract_cn);tool use(abstract);workflow(abstract)
AI总结 该研究提出ACES框架,通过配对实际 trials等方式评估技能附加价值,实验表明其能发现扫描式审核无法观测的信号,开源实现已在NVIDIA SkillEvaluator中提供。
Comments 15 pages. Extended preprint incorporating versions accepted at Agent Skills '26 (ACM CAIS 2026) and the KDD 2026 Workshop on Enterprise AI Agents: From Prototypes to Production (oral presentation). Open-source implementation: this https URL (https://github.com/NVIDIA/SkillEvaluator)
智能体集成开发环境(Agentic IDE)生成网页应用:一项实证评估
专题命中 Agent评测 :agentic(title,title_cn);分类 cs.SE
AI总结 本文通过对比Copilot、Cursor、Windsurf三款智能体IDE生成五个全栈网页应用的表现,发现其在生成常见模式时成熟度高,但生成分布式架构错误多,无法替代开发者,仅能辅助开发者构建软件。
你的工具不安全:评测命令行界面智能体的现实威胁
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract,abstract_cn)
AI总结 该研究针对CLI智能体滥用风险,推出与MITRE ATT&CK对齐的AdvCLI基准测试,评估7款CLI智能体后发现其常越过拒绝边界,可完成部分恶意OS级任务,为开发安全机制提供测试平台。
Comments Accepted by EMNLP 2026 (Findings)
BC-Bench:在ERP领域特定语言中评估智能体工程
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI、cs.SE
AI总结 该研究推出BC-Bench基准,评估智能体工程在ERP领域DSL(AL)上的表现,发现通用基准的改进未一致迁移到AL,凸显领域特定评估的必要性。
通过人类对齐设计用于药物发现中智能体AI的鲁棒性大语言模型评估系统
机构 * AstraZeneca(阿斯利康) ; Chalmers University of Technology(查尔姆斯理工大学) ; University of Gothenburg(哥德堡大学) ; Science for Life Laboratory (SciLifeLab)(生命科学实验室)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.LG
AI总结 本研究针对药物发现智能体AI,提出人类对齐的LLM作为评判者评估框架,优化后对齐度达0.86,为科学领域智能体系统评估提供可复用模板。
VortexChat:面向自主多目标集成光子设计的智能体框架
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 VortexChat是结合LLM决策智能体与电磁仿真的自主设计框架,可从自然语言规格端到端设计集成光子器件,在Vortex100基准测试中无需人工介入即可生成达标器件,成功设计制备出高性能太赫兹涡旋光束复用器。
可信检索增强生成:用于检测生成式人工智能系统中错误信息和知识投毒的评估智能体
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 该研究针对RAG系统的安全-可靠性鸿沟,提出结合NLI验证、五信号投毒检测器及可信指数的评估智能体,在TruthfulQA等数据集上实现高检测性能,可阻止RAG系统的不安全指令注入。
Comments 7 pages, 1 figure. Accepted for publication in the Main Research Track of the Twenty-First International Conference on Software Engineering Advances (ICSEA 2026)
AgentMercury:你的智能体可规模化合成面向业务场景的可验证环境
机构 * Meridian Intelligence Global Inc.(子午线智能全球公司) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
专题命中 Agent评测 :agent(title);tool use(abstract);分类 cs.AI、cs.CL
AI总结 本研究提出AgentMercury框架,可规模化合成业务场景的可执行环境,经其训练的智能体策略在企业工作流及多领域基准上表现提升,且环境构建过程可通过微调学习优化。
当故障传播时:智能体检索增强生成中的因果故障归因
机构 * Anote(阿诺特)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL
AI总结 本文提出AgenticRAG-FP基准,针对智能体RAG的因果故障归因开展实验,发现基于覆盖率的诊断在第1轮表现较好,第2、3轮较差,明确将传播深度作为相关评估维度。
面向军事指挥与控制的智能体AI系统的测试与评估
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.SE
AI总结 本文针对军事C2场景中智能体AI系统测试与评估的保障问题,分析既定方法的假设被智能体特性削弱的情况,推导保障主张并评估现有方法,明确部分举证责任转移至部署阶段。
Comments 57 pages, 4 figures
终端智能体:命令行环境下的AI智能体综述
机构 * Shanghai Innovation Institute(上海创新研究院) ; Shanghai Jiao Tong University(上海交通大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Tongji University(同济大学)
专题命中 Agent评测 :AI agent(title);tool use(abstract);分类 cs.AI、cs.SE
AI总结 本文将终端智能体定义为行动-观察循环由终端介导的系统,通过七维轮廓关联架构等模块,揭示其行为影响因素与评估不均衡问题,为相关研究提供统一框架。
Comments 52 pages, 7 figures
用于CT扫描中可靠且可审计的空间关系验证的模块化智能体
机构 * Ulm University(乌尔姆大学) ; Ulm University Hospital(乌尔姆大学医院) ; Technical University of Munich (TUM)(慕尼黑工业大学(TUM)) ; TUM University Hospital(慕尼黑工业大学医院) ; Department of Radiation Oncology, TUM University Hospital(慕尼黑工业大学医院放射肿瘤科)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 针对医学视觉-语言模型空间推理薄弱的问题,提出模块化医学影像智能体,通过分阶段处理实现CT扫描空间关系验证,性能优于端到端基线,可作为未来医学影像智能体的构建块。
$Z^2$-ACT:面向开放6G无线接入网的端到端可验证智能体意图控制
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI
AI总结 针对开放6G RAN多厂商部署的安全可验证需求,提出$Z^2$-ACT架构,集成多类核心组件并经实验验证其执行过滤与攻击恢复能力提升。
Comments 12 pages, 2 figures, 6 tables
同行投票的大语言模型智能体压力测试:发现feed诱导的词汇趋同,但分布式来源无可靠的匹配暴露优势
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本研究通过PV-SST测试床开展实验,发现同行排名feed会诱导LLM智能体群体的词汇趋同,但未证实分布式来源相比单一来源具有可靠的立场改变优势。
Comments 9 pages, 3 figures. Code, frozen protocol, configurations, summary tables, and data are publicly available at this https URL (https://github.com/ranausmanai/synthetic-social-networks) and this https URL (https://huggingface.co/datasets/ranausmans/synthetic-social-networks)
衔接语义与行为:基于智能体的BERTopic主题竞争演化模型
专题命中 Agent评测 :agent(title,abstract)
AI总结 本研究提出结合BERTopic、演化博弈论与智能体模拟的框架,揭示社交媒体主题传播的微观机制,复现真实传播趋势,为在线集体行为研究及相关应用提供支撑。
Comments 21 pages, 6 figures
TH-GNN:用于检测大语言模型智能体刷单攻击的异质性时序图神经网络
机构 * JAIN (Deemed to be University)(JAIN(被认定大学)) ; Zayed University(扎耶德大学)
专题命中 Agent评测 :agent(title);分类 cs.CL、cs.LG
AI总结 本文提出TH-GNN,一种异质性时序图神经网络,联合建模时序、结构与语义信号,在5类攻击族和4个基准数据集上检测LLM智能体刷单攻击,总体平均F1值达0.870,性能优于纯文本基线模型。
ProofJudge:基于工具的大语言模型(LLM)对Mathlib中形式化证明质量的评估工具
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 本研究提出ProofJudge系统,通过智能体式LLM从五个维度评估Mathlib形式化证明质量,在218个声明数据集上验证其与人类偏好对齐度,发布开源制品支持相关研究。
Comments 4 pages, 1 figure, 1 table
提示工程之外:提示词词汇敏感性及其对质量影响的系统性分析
机构 * Shenzhen Technology University(深圳技术大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Zhejiang Lab(之江实验室) ; The Chinese University of Hong Kong(香港中文大学) ; HKUST (Guangzhou)(香港科技大学(广州))
专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL
AI总结 该研究针对大型语言模型的提示词词汇敏感性开展大规模机制分析,揭示提示词性能稳定性缩放定律,提出自动化提示词优化智能体,可降低代码生成任务性能方差40.7%,为鲁棒提示工程提供可解释框架。
基于注意力头干预的大语言模型个性化隐私控制
机构 * IPAI, Seoul National University(首尔国立大学IPAI) ; Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 针对大语言模型隐私控制的用户偏好差异问题,提出个性化隐私概念及P3Bench基准,发现提示策略执行效果差,进而提出Repair方法提升隐私策略依从性
Comments EMNLP 2026
未来动态3D重建:一种具有解耦自运动的3D世界模型
机构 * Technical University of Munich (TUM)(慕尼黑技术大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract)
AI总结 提出FR3D世界模型,通过解耦场景3D演化与智能体轨迹,利用教师-学生蒸馏策略实现从单目观测到未来动态3D重建的几何一致性和零样本泛化。
Comments ICML 2026. Project page: this https URL (https://fr3d-wm.github.io)
大型语言模型在软件工程与软件安全交叉领域:一项以证据为中心的结构化调查与研究议程
机构 * Nanjing Liancheng Intelligent Technology Group(南京连城智能科技集团)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE
AI总结 本研究调查了LLMs在软件工程与软件安全交叉领域的进展,提出保证框架,识别有效性威胁与最低报告协议,制定研究议程,主张以任务适配证据而非单一基准评判模型能力。
在大型企业中应用Anthropic原语:知识工作的 harness 范式
机构 * G.S. s.r.o(G.S.有限责任公司) ; PwC Austria(普华永道奥地利公司)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE
AI总结 本文针对大型企业知识工作的代码维护痛点,提出基于 harness 范式的架构,通过统一核心、优化机制缩小研究发现与企业采用的治理差距。
Comments 21 pages, 3 figures
SEISMO:通过轨迹感知的LLM代理提高分子优化的样本效率
机构 * Technical University of Munich, Germany(慕尼黑技术大学,德国) ; TUM School of Computation, Information(TUM计算、信息学院) ; Technology, Department of Mathematics(技术学院,数学系) ; Helmholtz Munich – German Research Center for Environmental Health (GmbH), Institute of Structural Biology, Molecular Targets(海德堡慕尼黑德国环境健康研究所以及结构生物学研究所,分子靶点) ; Therapeutics Center, 85764 Neuherberg, Germany(治疗中心,德国新赫尔伯格85764) ; Machine Learning Research(机器学习研究)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 SEISMO通过轨迹感知的LLM代理实现高效的分子优化,利用结构化反馈提升样本效率。
Comments Fabian P. Krüger and Andrea Hunklinger contributed equally to this work
通过虚拟代理实现鱼群闭环引导的深度强化学习框架
专题命中 Agent评测 :agent(abstract,comments);分类 cs.LG
AI总结 本文提出基于深度强化学习的鱼群闭环引导框架,利用虚拟代理进行实时交互,通过复合奖励函数平衡方向引导与社会凝聚力,并发现物理实验中白底和较大刺激尺寸能提升引导效果,但群体规模增大时引导能力显著下降。
Comments 29 pages, 10 figures. Revised version with additional statistical and agent-behavior analyses. Corrections and improvements throughout
生产市场中外部性与可持续性的AI驱动定价
专题命中 Agent评测 :agent(abstract);分类 cs.AI;autonomous agent(comments)
AI总结 该研究针对传统竞争市场未考虑负外部性的问题,提出深度强化学习策略智能体方法调整生产市场价格,在稀缺资源环境中维持资源可持续性的效果优于市场均衡结果。
Comments Accepted to the 22nd International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2023)
超越故障定位:面向微服务根本原因分析的大语言模型智能体的轨迹级研究
专题命中 Agent评测 :agent(abstract);分类 cs.SE
AI总结 本研究针对微服务根本原因分析,提出轨迹级评估框架,发现智能体答案正确性与诊断质量脱节,构建DiagGuard架构提升了RCA的Acc@1指标,为自动化RCA改进提供指导。
Comments 13 pages, 7 figures, 5 tables
AudioWorldSim:用于世界模型的真实双耳音频数据集
机构 * VISGRAF ; IMPA(巴西纯数学与应用数学国家研究所)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本研究提出开源平台AudioWorldSim,作为SoundSpaces 2.0的自定义扩展,用于生成真实双耳音频数据集,助力基于音频的机器学习尤其是世界模型研究,相关资源已公开以提升可重复性。
Comments 7 pages, 3 figures
WA-JEPA:重新思考面向自动驾驶中世界-动作建模的视频JEPA范式
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 该研究针对V-JEPA不适用于自动驾驶规划的问题,提出WA-JEPA模型,采用混合未来掩码预训练与条件流匹配,在NAVSIM和HUGSIM基准上取得优于基线的规划性能。
基于步骤级结果推理与聚合的移动智能体自动轨迹评估
机构 * Jiutian Research(九天研究院) ; China Mobile(中国移动)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本研究提出CRATE(含安全评估扩展版CRATE-S)这一VLM-as-judge框架,通过步骤级推理解决移动智能体轨迹评估的上下文过载与安全缺失问题,在AndroidWorld、MobileRisk数据集上取得优于现有方法的性能。