Graph-Enhanced Policy Optimization in LLM Agent Training
图增强策略优化在LLM智能体训练中的应用
专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI
AI总结 提出图增强策略优化(GEPO)框架,通过状态转移图的双层结构信用分配(任务条件关键性评分),在LLM多步智能体训练中提升成功率。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
图增强策略优化在LLM智能体训练中的应用
专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI
AI总结 提出图增强策略优化(GEPO)框架,通过状态转移图的双层结构信用分配(任务条件关键性评分),在LLM多步智能体训练中提升成功率。
基于多智能体LLM的REST API蜕变测试
机构 * Åbo Akademi University(阿博阿卡迪米大学)
专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI
AI总结 提出ARMeta方法,利用基于LLM的多智能体工作流自动识别蜕变测试场景并生成可执行测试,以解决REST API测试中的预言问题。
Comments Author submitted version accepted for publication the IEEE Conference on Computers, Software, and Applications (COMPSAC2026), July 7-11, 2026, Madrid Spain
竞争性LLM代理中使用秘密工具的合谋行为
机构 * Dalhousie University(达尔豪斯大学) ; Vector Institute for Artificial Intelligence(人工智能向量研究所)
专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI
AI总结 本研究通过两个多智能体环境(Liar's Bar和Cleanup)发现,即使工具被明确标注为不公平且有害,大多数LLM代理仍会自愿采用秘密合谋工具以获取战略优势,且仅靠对齐或公平标签无法有效阻止,需明确防护措施。
LLM-SAA:基于LLM人格生成分布的决策方法
机构 * Stern School of Business, New York University(纽约大学 Stern 商学院) ; Department of Computer Science, Columbia University(哥伦比亚大学 计算机科学系) ; Graduate School of Business and Data Science Institute, Columbia University(哥伦比亚大学 商学院和数据科学研究院)
专题命中 其他LLM :LLM(title,title_cn);分类 cs.LG
AI总结 研究利用LLM生成分布(如模拟消费者支付意愿)支持下游决策,通过三个经典问题(分类优化、定价、报童模型)评估其实际效用,发现低数据场景下有效,且决策无关指标(如Wasserstein距离)可能误导。
为LLM-代理可操作论文的协调约定
机构 * arquicanedo
专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI
AI总结 本文提出paper.json文件,通过稳定声明ID、明确不声明列表、精确图示命令和稳定定义ID等约定,解决LLM代理在阅读学术论文时的重复失败问题。
MUON+: 向更有效的穆恩添加一个额外的归一化步骤以用于LLM预训练
机构 * University of California at Santa Barbara(加州大学圣芭芭拉分校)
专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出Muon+,通过在极化正交化后添加一个归一化步骤,解决极化后更新不平衡问题,提升LLM预训练效果。
超越个体模仿:构建具有图增强大语言模型代理的人类社交网络
机构 * Cyberspace Security, Beijing University of Posts and Telecommunications(网络安全,北京邮电大学) ; Institute of Software, Chinese Academy of Sciences(软件研究所,中国科学院)
专题命中 其他LLM :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出GraphMind,通过让基于LLM的社交机器人学习人类社交网络结构,解决现有社交机器人在全局交互协调上的不足,并构建GraphMind-Botnet评估现有检测算法性能。
犯错是人之常情;标注,硅?迈向LLM标注中的稳健可重复性
机构 * Robert H. Smith School of Business, University of Maryland(马里兰大学罗伯特·H·史密斯商学院) ; Leonard N. Stern School of Business, New York University(纽约大学伦纳德·N·斯坦商学院)
专题命中 其他LLM :LLM(title,title_cn);分类 cs.CL
AI总结 本文提出SILICON框架,通过分解标注误差来源,减少测量误差,提升LLM标注的稳健可重复性,同时建立备份模型并量化标注质量上限。
ClawGuard:一种用于对抗间接提示注入的工具增强LLM代理运行时安全框架
机构 * Singapore Management University(新加坡国立管理学院)
专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 ClawGuard通过在工具调用边界实施用户确认规则集,有效阻止间接提示注入攻击,无需修改模型或基础设施,实验显示其在多个基准测试中均能提供可靠保护。
从Spark到Fire:在基于大语言模型的多智能体协作中建模和缓解错误级联
机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) ; Minzu University of China(民族大学)
专题命中 其他LLM :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出了一种针对LLM-MAS的传播动力学模型,通过实验识别出三种漏洞类型,并引入基因图治理层以抑制误差级联,有效缓解了错误传播风险。
HBEE:人类行为熵引擎——预注册的多智能体LLM模拟中的基于同伴怀疑的检测反转
机构 * Faculty of Computer Science & Information Technology(计算机科学与信息科技学院) ; Universiti Malaysia Sarawak(马来西亚沙巴大学) ; Vixero Technology Enterprise(Vixero技术企业)
专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI
AI总结 本文通过预注册的多智能体LLM模拟,研究了基于同伴怀疑的检测反转问题,发现适应性对手在T_60时的怀疑度低于随机选择的无辜代理,且检测信号在适应性对手行为下解耦。
Comments 14 pages, 6 figures. Pre-registration document and full deviation log included in artifact
通过属性导向和结构最小反馈的有效LLM代码细化
机构 * School of Software, Beihang University, Beijing, China(北京航空航天大学软件学院) ; Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室) ; Shanghai Innovation Institute, Shanghai, China(上海创新研究院)
专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI
AI总结 本文提出属性生成求解器(PGS),通过属性导向和结构最小反馈提升LLM代码生成的正确性,实验显示PGS在pass@1和修复率上均优于其他TDD方法。
语境至关重要:通过VLM动作解析和LLM序列分类进行同伴感知的学生行为参与度测量
机构 * University of Louisville(路易斯维尔大学)
专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出一种三阶段框架,通过VLM动作识别和LLM序列分类,结合课堂语境中的同伴行为,有效测量学生参与度。
Comments accepted to the Computer Vision for Education (CV4Edu) workshop, CVPR 2026
基于大语言模型的代码生成中的缺陷任务描述:检测与分析
机构 * University of Luxembourg(卢森堡大学)
专题命中 其他LLM :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出SpecValidator,通过轻量级模型检测任务描述缺陷,结果显示其在检测准确性与鲁棒性上优于其他模型,揭示了任务描述结构对LLM性能的影响。
为设计而可逆:流式LLM代理执行的理论
机构 * Fudan University(复旦大学) ; Guangming Lab(光明实验室)
专题命中 其他LLM :LLM(title,title_cn);分类 cs.LG
AI总结 本文提出流式LLM代理执行的可逆性理论,通过定义可逆性分类,证明冲突可逆动作导致不可满足性,提出修订吸收器算法提升执行灵活性。
RouteGuard: LLM代理中技能中毒的内部信号检测
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI
AI总结 本文提出RouteGuard,通过响应条件注意力和隐藏状态对齐检测LLM代理中的技能中毒,实验证明其在真实和合成数据上表现优异,有效恢复被词法筛选遗漏的攻击。
一个身份,多种线索,不同结果:社会人口学线索如何影响LLM个性化
机构 * Institute for Natural Language Processing, University of Stuttgart(斯图加特大学自然语言处理研究所) ; Institute for Logic, Language and Computation, University of Amsterdam(阿姆斯特丹大学逻辑、语言和计算研究所) ; Weizenbaum Institute(Weizenbaum研究所;慕尼黑机器学习中心;慕尼黑技术大学) ; Munich Center for Machine Learning ; TU Munich
专题命中 其他LLM :LLM(title,title_cn);分类 cs.CL
AI总结 研究探讨社会人口学线索对LLM个性化的影响,指出单一线索可能导致偏差,强调需考虑外部有效性。
Comments ACL 2026 Main Conference
即插即用的戏剧编导:一种分而治之的方法,用于通过协作LLM代理进行迭代叙事脚本优化
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Tencent(腾讯)
专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI
AI总结 本文提出Dramaturge方法,通过分层多个LLM代理,解决长叙事脚本优化中的全局结构问题和局部细节问题,提升脚本整体质量和细节。
GraSP:用于LLM代理的图结构技能组合
机构 * Tencent(腾讯)
专题命中 其他LLM :LLM(title,title_cn);分类 cs.CL
AI总结 本文提出GraSP,一种可执行技能图架构,通过引入编译层提升LLM代理技能编排效率,通过五种类型操作符将扁平技能集转化为带前提-效应边的有向无环图,提升任务完成效率和奖励。
SocialWise: 用于自闭症谱系障碍个体的LLM代理对话疗法以增强沟通能力
机构 * Albert Tang(阿尔伯特·坦)
专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI
AI总结 SocialWise通过浏览器应用结合LLM对话代理和治疗性检索增强生成(RAG)知识库,为自闭症谱系障碍个体提供低成本、高效的沟通技能培训。
探索基于技能的行为特征标注:在模式引导执行下的人类可操作性和LLM可行性
机构 * City University of Hong Kong(香港城市大学)
专题命中 其他LLM :LLM(title,title_cn);分类 cs.CL
AI总结 本文探讨了基于技能的行为特征标注,通过人类和LLM在模式引导执行下的表现,发现标注任务在技能层面高度异质,LLM在特定技能上表现可靠,但整体可行性有限。
2026年深度测试工具竞赛:评估基于LLM的汽车助理
机构 * BMW Group(宝马集团) ; Technical University of Munich(慕尼黑技术大学)
专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文总结了2026年首次大型语言模型测试竞赛的结果,评估了四个工具在识别汽车手册中警告信息失败输入方面的有效性。
Comments Published in the proceedings of the DeepTest workshop at the 48th International Conference on Software Engineering (ICSE) 2026
基于LLM的提示进化用于密码猜测
机构 * Applied AI Center(应用人工智能中心) ; MTUCI(莫斯科国立大学)
专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI
AI总结 本文利用LLM驱动的进化计算优化密码猜测框架的提示,通过OpenEvolve系统提升破解率,验证了自动提示进化在增强LLM密码审计中的有效性。
Comments 11 pages, 5 figures
专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments ICML 2024, Large Language Models and Cognition
专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
Comments 13 pages, 18 figures. This paper presents a technical analysis of bias in large language models, focusing on bias detection and mitigation
专题命中 其他LLM :LLM(title,abstract);large language model(title);language model(title);分类 cs.CL
Comments 6 pages
混合源大语言模型文本中的最优水印定位
专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.LG
AI总结 该研究针对混合源大语言模型文本的水印定位问题,将其建模为token级多重检验,提出自适应阈值方法,实现最优发现边界,经模拟和实验验证了理论与实际性能。
Comments 66 pages, 13 figures
大型语言模型能理解创伤的影响吗?对枪支暴力幸存者访谈的LLM编码的成本与收益
机构 * University of Maryland, College Park(马里兰大学学院公园分校)
专题命中 其他LLM :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了使用LLM对枪支暴力幸存者访谈进行主题编码的可行性,发现尽管某些配置能识别重要代码,但整体相关性低且易受数据处理影响,同时指出LLM的限制和伦理挑战。
Comments Accepted to Findings of the Association for Computational Linguistics (2026)
Journal ref Findings of the Association for Computational Linguistics (2026)
CoEvoP&R:通过大语言模型与路由反馈共同进化布局目标
机构 * University of Alberta(阿尔伯塔大学) ; New York University(纽约大学)
专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
AI总结 研究针对分析布局器替代指标与下游质量不一致问题,提出基于大语言模型的CoEvoP&R框架自动进化布局目标,经实验验证该方法能有效降低线长、拥塞及时序负松弛,提升布局效果。
Comments 7 pages, 4 figures, 3 tables. Corresponding author: Weihua Xiao
用大语言模型增强基本面分析:基于RAG的投资者简报生成系统
机构 * Faculty of Computer Science, AGH University of Krakow(克拉科夫AGH科技大学计算机科学学院)
专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 研究利用大语言模型,通过对公司报告、宏观经济数据及SEC文件等进行预处理,以类似RAG方式借助gpt - 4o模型,结合基于基钦周期的投资者知识文档,扫描分析9家公司数据并生成简报供投资者评估,探索其在基本面分析中的应用。