Structural Approach to Guiding a Present-Biased Agent
结构化方法用于引导现时偏好代理
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文提出了一种结构化方法,用于引导现时偏好代理,通过参数化算法分析任务图的计算复杂性,并给出了固定参数可 tractable 算法。
Comments Accepted at AAAI 2026
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
结构化方法用于引导现时偏好代理
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文提出了一种结构化方法,用于引导现时偏好代理,通过参数化算法分析任务图的计算复杂性,并给出了固定参数可 tractable 算法。
Comments Accepted at AAAI 2026
基于可预训练的自动后验变换的代理基于金融市场模拟器校准
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文提出ANTR方法,通过可预训练的神经密度估计器和自适应信任区域策略,提升代理基于金融市场模拟器的校准精度和效率。
Comments 32 pages, 4 figures
法律中的LLM代理:分类、应用与挑战
机构 * Carnegie Mellon University(卡内基梅隆大学) ; National University of Singapore(国立新加坡大学) ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; The University of Chicago(芝加哥大学) ; Rutgers University(罗格斯大学) ; Columbia University(哥伦比亚大学) ; New Jersey Institute of Technology(新泽西理工学院)
专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI
AI总结 本文探讨了法律领域中LLM代理的分类、应用及挑战,分析了技术转变、应用分类、评估方法及未来发展方向。
证明时间:评估科学思想判断的基准
机构 * Harvard University(哈佛大学) ; Mass General Brigham(麻省总医院) ; Boston Children’s Hospital(波士顿儿童医院) ; Brandeis University(布兰迪大学) ; Yale University(耶鲁大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI、cs.CL
AI总结 PoT通过半可验证的基准框架评估科学思想判断,利用时间分区和未来可验证的目标,结合离线沙盒实现可扩展的评估。
Comments under review
LongEmotion: 测量大语言模型在长上下文交互中的情感智能
机构 * Shenzhen MSU-BIT University(深圳MSU-BIT大学) ; The University of Hong Kong(香港大学) ; City University of Hong Kong(香港城市大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) ; Beijing Normal University(北京师范大学) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL
AI总结 LongEmotion是一个评估大语言模型在长上下文交互中情感智能的基准,通过多任务和协作框架提升模型在情绪识别与共情生成中的表现。
Comments Technical Report
CHASE:用于拆解恶意PyPI包的LLM代理
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.SE
AI总结 CHASE通过多代理架构提升恶意PyPI包检测的可靠性,实现高召回率与低误报率。
Comments Accepted for publication and presented at the 2nd IEEE International Conference on AI-powered Software (AIware 2025). 10 pages, 3 figures
R3-RECON:通过可渲染性进行无辐射场主动重建
专题命中 Agent评测 :agent(abstract);planning(abstract)
AI总结 R3-RECON通过无辐射场的可渲染性场实现高效主动重建,提升新视角质量和3DGS重建精度。
Comments 18 pages, 11 figures
OpenRT: 一种用于多模态大语言模型的开源红队框架
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract)
AI总结 OpenRT框架通过模块化设计和高吞吐量运行时,系统性评估多模态大语言模型的安全性,揭示了前沿模型在复杂攻击下的脆弱性。
MedEinst:通过反事实差异诊断基准测试医疗大语言模型中的Einstellung效应
机构 * Stanford University(斯坦福大学) ; Xi’an Jiaotong University(西安交通大学) ; Shenzhen University(深圳大学) ; Renmin University of China(中国人民大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 MedEinst通过反事实差异诊断基准测试,揭示医疗大语言模型中的Einstellung效应,并提出ECR-Agent提升循证医学标准。
Comments 19 pages, 7 figures
MCP-ITP:一种用于MCP中隐式工具中毒的自动化框架
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 MCP-ITP是一种用于MCP中隐式工具中毒的自动化框架,通过黑箱优化策略提升攻击成功率并规避检测。
LongDA:评估基于LLM的代理在长文档数据分析中的基准测试
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 LongDA通过评估基于LLM的代理在长文档数据分析中的性能,揭示了现有模型在处理复杂任务时的不足。
多智能体系统的法律设计图论视角
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文从图论角度研究多智能体系统中法律设计问题,提出两种法律类型并证明其最小化问题的计算复杂性,同时利用超图顶点覆盖的近似算法进行高效近似。
Comments The 40th AAAI Conference on Artificial Intelligence (AAAI-26)
度量设计不等于度量行为:改进无偏评估降维的度量选择
机构 * Seoul National University(首尔国立大学)
专题命中 Agent评测 :workflow(abstract);分类 cs.LG
AI总结 本文提出了一种基于度量相关性聚类的工作流程,以减少降维评估中的偏差,提高评估的稳定性。
Comments IEEE VIS 2025 (short paper)
辅助作者生成透明、数据驱动的文档
机构 * University of Salerno(萨勒诺大学) ; University of Bristol(布里斯托大学) ; Manchester Metropolitan University(曼彻斯特 Metropolitan 大学) ; The Alan Turing Institute(艾伦·图灵研究所) ; University of Kent(肯特大学) ; University of Cambridge(剑桥大学) ; University of Bath(巴斯大学) ; University College London(伦敦大学学院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出了一种基于大语言模型的工具,用于生成透明、数据驱动的文档,通过交互式数据溯源技术增强学术文章的可验证性。
基于大语言模型代理的终身学习:路线图
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出了一种基于大语言模型代理的终身学习框架,通过三个模块整合多模态输入、知识存储与动态环境交互,以实现持续适应和长期性能提升。
Comments Accepted to IEEE TPAMI
稀疏点隐私泄露:机制设计与基本限制
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究了稀疏点隐私泄露机制设计问题,提出了一种基于信息几何的二次近似方法,并通过凸半正定规划松弛解决NP难问题,同时确定了稀疏最优的阈值条件。
Peacock:用于检测和响应的UEFI固件运行时可观察性层
专题命中 Agent评测 :agent(abstract)
AI总结 Peacock通过模块化框架实现UEFI启动过程的完整性保证监控和远程验证,有效检测多种现实中的固件启动套件。
空间多任务学习用于从单相DCE-MRI预测乳腺癌分子亚型
机构 * Tsinghua University(清华大学) ; Southwest Forestry University(西南林业大学) ; GigaAI ; KCL
专题命中 Agent评测 :agent(abstract)
AI总结 本研究提出空间多任务学习框架,利用单相DCE-MRI实现乳腺癌分子亚型的非侵入性预测,通过多任务学习提升ER、PR、HER2及Ki-67的预测性能。
一般自适应动态网络上相互作用粒子系统的均场极限
专题命中 Agent评测 :agent(abstract)
AI总结 研究一般自适应动态网络上相互作用粒子系统的均场极限,通过两种方法建立Vlasov型方程并分析其适定性与稳定性。
数学模型中颅骨神经嵴细胞迁移中领导者和追随者的自发出现
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出了一种基于极性的基于代理的数学模型,用于模拟颅骨神经嵴细胞迁移中领导者和追随者表型的自发出现,无需预先设定表型。
Comments 6 Figures
关于由整数选择函数生成的双侧市场中稳定合同的偏序表示
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究由整数选择函数生成的双侧市场中稳定合同的偏序表示,通过构造加权偏序实现稳定合同集的显式表示。
Comments 38 pages, 1 figure. Compared with the initial version, some minor corrections and improvements have been done
带高阶效应的加权中位数意见动力学收敛性分析
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出了一种基于simplicial复形的高阶交互加权中位数意见动力学模型,分析了其收敛性与稳定性,为高阶环境效应下的意见动力学提供了新的分析框架。
面向数据依赖的目标建模用于机器学习赋能的执法系统
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出利用GORE框架KAOS进行数据驱动的目标建模,以提升ML赋能执法系统在识别在线儿童性虐待嫌疑人中的性能。
Comments 10 + 2 pages
基于大语言模型的评估检索增强生成(RAG)系统用于高等教育
专题命中 Agent评测 :agentic(abstract)
AI总结 本研究提出基于RAG架构的大语言模型驱动评估系统,通过整合评分标准和范文生成高质量反馈,实现大规模、一致的评估反馈,提升学生自主学习能力。
Comments 19 Pages
幻觉存在于方差中
机构 * PhD research(博士研究)
专题命中 其他Agent :agentic(abstract);分类 cs.AI、cs.LG
AI总结 研究提出语义稳定性(SS)作为衡量模型方差驱动不可靠性的诊断工具,通过同义词一致性(PC@k)评估模型在不同稀疏度下的稳定性,发现稀疏度增加可显著提升一致性。
Comments 8 pages, 3 figures
他们分开了幻象——他们分开了否定腌制:在大语言模型中将不一致视为结构忠实
专题命中 其他Agent :agentic(abstract);分类 cs.AI、cs.CL
AI总结 本文提出大语言模型中'不一致'现象源于对不一致语言结构的忠实,而非欺骗性意图,通过分析案例和实证数据,揭示语言结构与意图生成的关系。
构建 AgentOps 需要 CHANGE
专题命中 其他Agent :agentic(abstract);分类 cs.SE
AI总结 本文提出CHANGE框架,用于构建能够适应不确定性和持续演化的AgentOps平台,以管理演进中的代理式人工智能系统。
Comments This paper has been accepted to CAIN 2026