Structural Representations for Cross-Attack Generalization in AI Agent Threat Detection
结构表示用于AI代理威胁检测中的跨攻击泛化
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)
AI总结 本文提出结构标记化方法,通过编码执行流程模式提升AI代理威胁检测的跨攻击泛化能力,显著提高对未知攻击的识别性能。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
结构表示用于AI代理威胁检测中的跨攻击泛化
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)
AI总结 本文提出结构标记化方法,通过编码执行流程模式提升AI代理威胁检测的跨攻击泛化能力,显著提高对未知攻击的识别性能。
SmartFlow 强化学习与代理AI用于自行车共享优化
机构 * Department of Data Science, Machine Learning \& Artificial Intelligence, PES University, Bengaluru, Karnataka - 560100, India ; 1 Sunrise Setting Ltd, 12a Fore Street, St. Marychurch, Torquay, Devon, TQ1 4NE, UK 2 European Alliance for Innovation (EAI), Gent, Belgium
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 SmartFlow 通过整合强化学习与代理AI,实现城市自行车共享系统的高效再平衡,显著减少网络不平衡并提升运营效率。
KGCE:基于多模态语言模型的跨平台教育代理基准评估知识增强双图评估器
机构 * Faculty of the School of Computer Science, Central China Normal University(中央财经大学计算机学院)
专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI
AI总结 KGCE提出一种基于多模态语言模型的跨平台教育代理基准评估框架,通过知识库增强和双图评估方法提升对特定学校软件任务的执行效率和评估精度。
可解释的代理AI框架:用于不确定性和可 abstention 的急性缺血性中风影像决策
机构 * Department of Computer Science and Engineering(计算机科学与工程系) ; Daffodil International University(达福尔国际大学)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文提出了一种可解释的代理AI框架,用于在急性缺血性中风影像学中实现不确定性意识和选择性退避,以提高临床决策的安全性和透明性。
Comments Preprint. Conceptual and exploratory framework focusing on uncertainty-aware and abstention-enabled decision support for acute ischemic stroke imaging
揭示隐藏接口:LLM引导的类型推断用于macOS私有框架逆向工程
专题命中 Agent评测 :agent(abstract);tool-use(abstract);agentic(abstract);分类 cs.AI
AI总结 MOTIF通过LLM引导的类型推断技术,显著提升了对macOS私有框架的逆向工程能力,实现了更高的签名恢复率和更稳定的推断结果。
Comments IEEE S&P'26 under review
幻觉与事实:大型语言模型中事实核查与事实性评估的综述
机构 * Department of Computer Science and Engineering, United International University, Dhaka 1212, Bangladesh(乌姆特国际大学计算机科学与工程系) ; Department of Computer Science and Engineering, Daffodil International University, Dhaka-1341, Bangladesh(达芙尼国际大学计算机科学与工程系) ; Faculty of Science and Technology, Charles Darwin University, Casuarina, NT 0909, Australia(查尔斯·达尔文大学科学与技术学院)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文综述了大型语言模型中事实核查与事实性评估的关键挑战及方法,强调了提升事实准确性的重要性。
Journal ref Artif. Intell. Rev. (2026)
基于多语言模型的临床知识图谱构建与评估:通过检索增强生成
机构 * University of Missouri–Kansas City(密苏里大学-堪萨斯城分校) ; California State University, Fullerton(加州州立大学弗雷斯诺分校)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 本文提出基于多语言模型的临床知识图谱构建与评估框架,通过检索增强生成策略实现从自由文本到可解释、临床相关知识图谱的端到端构建与持续优化。
Comments 13 pages, 5 tables, 4 figures
Project Ariadne: 一种用于审计大语言模型代理忠实性的结构因果框架
机构 * Sourena Khanzadeh(独立研究者)
专题命中 Agent评测 :agentic(abstract);分类 cs.AI
AI总结 Project Ariadne提出一种结构因果框架,通过因果干预评估大语言模型代理推理的忠实性,揭示代理推理与决策之间的因果脱节问题。
SpatialBench: 聊聊智能体能否分析真实世界的空间生物学数据?
机构 * LatchBio
专题命中 Agent评测 :AI agent(abstract);分类 cs.AI
AI总结 SpatialBench通过146个可验证问题评估智能体分析真实世界空间生物学数据的能力,揭示了模型性能受设计和平台影响显著,需进一步优化工具与流程。
Comments 10 pages, 9 figures, 4 tables; NeurIPS 2024 format
EmoHarbor:通过模拟用户的内心世界评估个性化情感支持
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 EmoHarbor通过模拟用户内心世界,评估个性化情感支持的定制能力,揭示大语言模型在情感支持中的不足,推动用户感知情感支持系统的发展。
AlignUSER: 通过世界模型对齐LLM代理以评估推荐系统
机构 * Woven by Toyota(丰田织物)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 AlignUSER通过世界模型驱动的代理学习,利用人类交互数据提升推荐系统评估的准确性与真实用户行为的对齐程度。
使用目标条件化和元强化学习进行通用动态目标识别
机构 * Department of Computer Science, Bar Ilan University(巴伊兰大学计算机科学系) ; Department of Computer Science, Tufts University(塔夫茨大学计算机科学系)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出两种方法,通过目标条件化和元强化学习实现动态环境下的目标识别,提升系统在变化和噪声中的适应能力与识别精度。
Comments Accepted for publication at AAMAS 2026
重复拍卖中的预算节奏:无需收敛的遗憾与效率
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究了重复拍卖中预算节奏算法的福利和效率保障,证明了无需动态收敛即可获得至少一半最优液体福利,并展示了动态遗憾界限及对核心拍卖的鲁棒性。
Comments Preliminary version in ITCS 2023. MAJOR UPDATES since then: our aggregate and individual guarantees are extended to several other gradient-based pacing algorithms (Section 5, since Dec'25), the regret analysis is extended to the utility-maximization objective (since Dec'25), and numerical experiments are added (Section 6, since Aug'24, with additional baselines added in Dec'25)
风险下保留判断的协议
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出在风险下保留判断的帕累托原则,通过加权求和构建社会效用函数,确保自然属性的聚合规则。
Comments 13 pages
再保险合同最优设计与风险评估的连续体
专题命中 Agent评测 :agent(abstract)
AI总结 本文通过委托-代理模型,分析在存在信息不对称的垄断再保险市场中,针对连续体保险公司类型进行最优合同设计,证明再保险人会将代理人分为高风险和低风险两组,并解决了三种常见再保险结构的最优问题。
Comments 36 pages, 2 figures
分类与随机化:一种允许性的随机选择模型
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出了一种允许性随机选择模型,通过分类和随机选择机制解释消费者行为,并扩展了卢斯模型和嵌套日志it模型。
针对心脏超声的深度分割架构的统一回顾与基准测试:CAMUS
机构 * Department of Computer Science ; Artificial Intelligence, Dongguk University, Seoul 04620, Republic of Korea ; Department of Semiconductor System Engineering, Sejong University, Seoul, 05006, Republic of Korea ; Department of Operations Research ; Statistics, Faculty of Organizational Sciences, University of Belgrade, Belgrade, Serbia ; Department of Industrial Engineering \& Management, Yuan Ze University, Taoyuan City 320315, Taiwan ; Department of Applied Mathematical Science, College of Science ; Technology, Korea University, Sejong 30019, Republic of Korea
专题命中 Agent评测 :workflow(abstract)
AI总结 本文通过统一基准测试评估了三种心脏超声分割架构的性能,提出标准化预处理方法,并展望了自监督和多模态标注技术的应用。