PatchIsland: Orchestration of LLM Agents for Continuous Vulnerability Repair
PatchIsland:用于持续漏洞修复的大语言模型代理编排
专题命中 评测与基准 :LLM(title,abstract)
AI总结 研究针对持续模糊测试中漏洞修复多为人工且现有AVR技术不适用于此的问题,提出PatchIsland系统,通过集成多种大语言模型代理及两阶段去重方法,实现高效漏洞修复,在内部评估和竞赛中都取得了较好的修复成果。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
PatchIsland:用于持续漏洞修复的大语言模型代理编排
专题命中 评测与基准 :LLM(title,abstract)
AI总结 研究针对持续模糊测试中漏洞修复多为人工且现有AVR技术不适用于此的问题,提出PatchIsland系统,通过集成多种大语言模型代理及两阶段去重方法,实现高效漏洞修复,在内部评估和竞赛中都取得了较好的修复成果。
Symbal:检测模型生成字幕中的系统性对齐错误
专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI
AI总结 研究多模态大语言模型生成图像字幕时的系统性对齐错误检测问题,提出利用现成基础模型的结构化双阶段设置的Symbal方法,引入SymbalBench基准,Symbal在基准上表现出色,可辅助审核MLLM生成的字幕。
Comments ICML 2026
MM-IssueLoc:用于评估多模态仓库级问题定位中视觉证据的可控基准
机构 * Tsinghua University(清华大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 研究针对仓库级问题定位多为文本任务,视觉证据作用不明的情况,引入MM-IssueLoc基准和评估协议,含多语言实例与标注等。评估LLM和检索系统,发现现有系统距可靠多模态定位有差距,该基准让视觉证据成评估变量,助于后续研究。
大语言模型能否根据论文构建最大可满足性求解器?CoreForge 经验
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究利用大语言模型从论文构建无权重 MaxSAT 求解器,采用结合论文讨论、代码实现及审核修订的迭代流程,评估特定配置,发现虽未现错误答案,但性能低于手工设计求解器,总结了相关经验教训。
Traccia:一个基于OpenTelemetry的人工智能系统治理平台
机构 * National Institute of Technology Rourkela(鲁尔基国立技术学院)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对大语言模型和人工智能驱动智能体发展带来的软件治理问题,提出基于OpenTelemetry构建多层次人工智能治理堆栈Traccia,通过添加遥测数据等解决对齐问题,自动创建合规证据包,为企业管理自主人工智能系统创建机器可读基础。
Comments 26 pages, 2 figures, 3 tables, Declaration of generative AI and AI-assisted technologies in the writing process, Declaration of competing interest
MSQA:一个原生来源的多语言多文化SimpleQA基准
机构 * M-A-P ; ByteDance Seed(字节跳动Seed) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Nanjing University(南京大学)
专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL
AI总结 提出MSQA基准,包含1064个原生问题覆盖11种语言和5个文化维度,评估18个LLM发现文化能力随预训练暴露程度下降,且推理时补救措施无效。
Comments Due to the company's data approval issue, we need to withdraw the article
如何实现递归式自我提升智能体与个人奇点:一种目标、范围、工具和基准驱动的多智能体架构
机构 * NextGen PlatformAI C Corp.(下一代平台人工智能C公司)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 研究大型语言模型智能体进步引发的问题,提出受治理多智能体架构实现递归式自我提升,以个人奇点为目标,详细介绍智能体各要素及架构组成,形式化多种机制并提供设计与路线图。
Comments 28 pages, 5 figures, 7 tables, and 5 algorithms. Position and systems-design paper
大语言模型生成的GPU内核能否用于生产?基于追踪的基准测试与优化代理
机构 * Alibaba Group(阿里巴巴集团)
专题命中 评测与基准 :LLM(title);分类 cs.AI
AI总结 研究大语言模型生成GPU内核用于生产的可行性,提出Atrex-Bench基准测试,发现现有模型表现不佳。为此发布Atrex-Kernel-Agent优化代理,结合多种技术,经案例研究能将回退转换为匹配或超越生产基线的内核。
Comments Both artifacts are released as open source: Atrex-Bench (https://github.com/alibaba/atrex-bench) and Atrex-Kernel-Agent (https://github.com/alibaba/atrex-kernel-agent)
PERL:用于中文语音识别N-best纠错的拼音增强改写语言模型
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德大学人工智能学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 评测与基准 :language model(title);分类 cs.CL
AI总结 针对中文语音识别纠错难题,提出PERL受限改写管道,通过预测目标长度、掩码预算及融合语义与拼音表示来纠错,在Aishell-1和DoAD实验中持续降低字符错误率且保持低延迟,还分析了相关交互。
OmniaBench:跨多样场景对通用人工智能智能体进行基准测试
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究针对大语言模型向通用智能体演变,现有基准测试有局限的问题,引入OmniaBench。通过多渠道获取场景知识形成分类法,构建可执行环境并合成任务,还引入能力分类法等。其数据集含多任务,对前沿模型构成挑战,能表征通用智能体能力边界。
利用多智能体人工智能和MCP服务器编排电网研究
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 探讨智能体人工智能和MCP在TSO环境下对电网研究的支持,结合大语言模型等要素,介绍pypowsybl - mcp接口搭建试验台,研究智能体交互方式,讨论人工参与原则与评估策略,推动电网研究环境更具交互性、可审计性和扩展性。
Comments Accepted to IJCAI AISE 2026 workshop
用于运营决策支持的贝叶斯网络的人工AI构建——一种虚拟调查方法
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究如何构建贝叶斯网络用于运营决策支持,提出利用大语言模型的新方法,通过人工智能代理估计概率并去噪,开发六步框架,以客户咨询医生意图建模为例,揭示因素影响,得出有效策略。
LBA:低查询预算下的文本硬标签对抗攻击
机构 * Zhejiang Normal University(浙江师范大学) ; Zhejiang University(浙江大学) ; China Electric Power Research Institute(中国电力科学研究院)
专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究在低查询预算硬标签场景下生成高质量对抗文本的难题,提出基于采样的LBA方法,整合先验与后验知识构建近似分布用于采样,实验证明该方法在多语言模型上显著优于基线,生成的对抗文本语义保留性和可理解性更佳。
MedRealMM:用于中国在线医疗咨询的真实世界多模态基准测试
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究针对现有在线医疗咨询基准与实际临床实践契合度差的问题,构建MedRealMM基准测试,用多模态临床挑战点提取框架转化任务并设评分标准,评估多个大语言模型,指出图像信息重要,前沿模型有不足,为多模态医学推理评估提供现实可重复基准。
试验中的评分标准:通过合成成对证据从单个查询中演化评分标准
机构 * School of Computing, National University of Singapore(新加坡国立大学计算学院) ; Xiaohongshu Inc.(小红书公司) ; School of Cyber Science and Technology, Zhejiang University(浙江大学网络空间安全学院) ; School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) ; School of Statistics and Data Science, Shanghai University of Finance and Economics(上海财经大学统计与数据科学学院) ; Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究针对构建可靠特定查询评分标准难的问题,提出“试验中的评分标准”框架,仅从查询演化评分标准集,靠合成响应对获取监督并验证,实验证明该框架有效,平均准确率最佳且在多数评估集领先。
ChronoQG:迈向用于时态知识图谱问题生成的具有时态表现力和跳数限制的基准
机构 * Nankai University(南开大学) ; Peking University(北京大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Shanghai University of Finance and Economics(上海财经大学)
专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.LG
AI总结 研究时态知识图谱问题生成,提出ChronoQG框架,通过整合多种方法构建有时态表现力和跳数限制的基准数据集,评估多种设置下的相关方法,揭示静态KGQG与TKGQG差距,为时态忠实问题生成提供测试平台。
Comments Preprint
通过反事实估计加速A/B测试:通过策略重叠降低方差
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究在线控制实验中A/B测试方差大成本高问题,提出利用策略重叠加速实验的新协议,将随机处理分配机制视为元策略,用Δ-离策略估计方法获无偏估计,理论和实证证明该方法可提升效率,有望用于多种系统评估。
人工智能生成的反馈效果如何?对20000多篇外语作文草稿的内在和外在评估
机构 * Tohoku University(东北大学) ; RIKEN(理化学研究所) ; ALTA Institute, Computer Laboratory, University of Cambridge(剑桥大学ALTA研究所,计算机实验室) ; CNRS, LIS, Aix-Marseille University(法国国家科学研究中心,艾克斯-马赛大学语言信息处理实验室) ; MBZUAI(Mohamed bin Zayed大学人工智能学院)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究外语写作中人工智能生成的书面纠正性反馈效果,通过大学外语班级近2000名学生的超20000篇草稿,从教师内在评估和学生外在反馈两角度评估,发现传统专家评估与学生反馈一致性低,强调以学习者为中心评估框架的重要性。
Comments Pre-review version of DOI https://doi.org/10.1007/978-3-032-29788-4_35, presented at AIED 2026 Late Breaking Results. Readers are encouraged to refer to the published version
Journal ref AIED CCIS 3031 (2026) 247-253
Chat2Scenic:一种基于迭代检索增强生成的自动驾驶场景生成框架
机构 * Technical University of Munich(慕尼黑工业大学) ; Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑机器人与机器智能研究所) ; University College London(伦敦大学学院)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究自动驾驶场景生成难题,提出Chat2Scenic这一基于迭代检索增强生成的框架,通过聊天机器人界面及RAG技术生成DSL场景脚本,构建开放基准,评估结果显示其性能优于现有方法。
Comments Accepted at 2026 IEEE International Conference on Intelligent Robots and Systems (IROS)
在无穷小非组合草图中学习
机构 * Adobe Research(Adobe研究院) ; University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究如何通过LINCS框架修复机器学习中非组合性问题,将问题指定为草图,利用切提升和INC自函子,把机器学习表述为寻找余代数不动点,证明特定条件下最终INC余代数存在,正进行多场景实验评估。
将古典诗歌翻译成现代散文
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文介绍Padyam2Gadyam数据集,用于13-17世纪泰卢固语古典诗歌到当代泰卢固语和英语散文的翻译任务,并评估了5种大语言模型的表现,发现仍有较大改进空间。
Comments Preprint
FlowGuard:从信号到MCP安全检测的证据
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 研究针对现有MCP安全扫描器不足,提出FlowGuard系统,结合语义风险分类等方法,通过运行时证据验证执行风险、检测语义风险,在基准测试和实际评估中取得良好效果,能有效评估MCP交互中的多种风险。
VIABench:一个从视障人士收集的用于视障辅助的综合视频基准测试
机构 * Nanjing University(南京大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 针对视障人士视觉信息获取难及多模态大语言模型在视障辅助中实用价值待探索的问题,引入VIABench视频基准测试,定义三个核心任务,提出严格测试流程,实验表明当前模型对视障人士支持不足,有望推动定制模型开发以改善其体验。
BioTIER:用于针对性生物风险缓解的拒绝基准
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 针对大语言模型生物滥用问题,引入BioTIER基准,将生物内容分三个风险集,含542个专家策划提示及元数据,可隔离控制灾难性风险信息,确保生物科学知识获取,助力针对性生物风险缓解。
Comments 52 pages, 9 main figures, 9 supplementary figures, 1 main table, 9 supplementary tables
LEO:通过跨厂商反向切片追溯GPU停滞的根本原因
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本文提出LEO,一种跨NVIDIA、AMD和Intel GPU的根因分析工具,通过反向切片追踪停滞指令,揭示性能瓶颈,实验表明其优化可提升1.73至1.82倍,展示不同GPU架构需不同优化策略。
Comments Manuscript accepted at SC'26
语言模型诚实度评估中的工具效应:一个可审计的单系统演示
机构 * Corabo Inc.(科拉博公司)
专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI
AI总结 研究语言模型诚实度评估中的工具效应,通过构建文本冒险世界测试评估工具,发现工具选择影响行为,如扩展语法、披露标准等会改变结果,重复运行不稳定且预注册梯度被证伪,进而提出四检查完整性协议。
Comments 21 pages. Code: https://github.com/Aargau/latent-underground (tag v1.0-arxiv). Data: https://doi.org/10.5281/zenodo.21384627
MAG:用于多模态动作与引导生成的网络智能体基准测试与工具包
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Monash University(莫纳什大学) ; Pusan National University(釜山国立大学) ; Shenzhen University of Advanced Technology(深圳先进技术大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI
AI总结 介绍MAG这一网络智能体基准测试,统一任务执行与引导写作,有基于截图的定位方案和完整工具包。用其评估模型并详细分析,还设计GRPO训练方法,提升智能体成功率与引导质量,指出当前模型任务完成率低,为后续研究提供方向。
Comments 8 pages main text, 21 pages total including appendices; 11 figures, 7 tables, 2 algorithms. Benchmark, harness, and model checkpoints to be released
万花筒计划:面向现实世界人工智能应用的情境化、符合人类需求的评估
机构 * GovTech(新加坡政府科技局) ; National University of Singapore(新加坡国立大学) ; University of British Columbia(英属哥伦比亚大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI
AI总结 该项目旨在解决现实世界AI应用评估瓶颈,提出万花筒计划,通过集成基于角色的测试生成、情境化评分标准和人工审查,实现可靠性门控自动评分,经试点和实验验证了其在端到端可靠自动评分方面的有用特征。
SafeRelBench:用于VLM驱动的具身智能体过程级安全的空间关系感知基准测试
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 研究VLM驱动具身智能体的过程级安全问题,引入SAFERELBENCH基准测试,含507个样本。评估七个智能体发现任务成功与安全合规有差距,该基准明确测试行动前安全条件,凸显空间关系在安全评估中的核心地位。
Comments Preprint. 10 pages, 6 figures, 4 tables
CityLLM:一种用于语义 3D 城市模型自然语言查询的框架
机构 * GRID Lab, School of Built Environment, UNSW Sydney(新南威尔士大学悉尼分校建筑环境学院GRID实验室) ; School of Civil and Environmental Engineering, UNSW Sydney(新南威尔士大学悉尼分校土木与环境工程学院)
专题命中 评测与基准 :LLM(abstract);分类 cs.CL
AI总结 研究针对语义 3D 城市模型访问查询难的问题,提出 CityLLM 框架,结合空间与图形数据库,在基于语言模型工作流中支持迭代查询等。通过多种模型在鹿特丹数据集上评估,多个场景 54 个查询显示其性能强大,为语义 3D 城市数据对话访问提供轻量级可扩展方法。
Comments Accepted to the 21st International 3D GeoInfo Conference. To appear in the ISPRS Annals of the Photogrammetry, Remote Sensing and Spatial Information Sciences