Transferable Self-Evolving Playbooks for Agentic Security Auditing
可迁移的自演化剧本用于智能体安全审计
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 提出EvoHunt框架,通过审计、评估和修订三个智能体循环演化空剧本,自动生成安全审计程序知识,开源演化可超越商业产品,且演化后的剧本可迁移至弱智能体提升其能力。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
可迁移的自演化剧本用于智能体安全审计
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 提出EvoHunt框架,通过审计、评估和修订三个智能体循环演化空剧本,自动生成安全审计程序知识,开源演化可超越商业产品,且演化后的剧本可迁移至弱智能体提升其能力。
UniDDT: 使用解耦扩散变换器统一多模态理解与生成
机构 * Nanjing University(南京大学) ; ByteDance Seed(字节跳动Seed) ; University of Hong Kong(香港大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 提出UniDDT模型,通过噪声ViT编码器统一视觉语义表示,并采用解耦扩散解码器分离扩散与文本解码,平衡多模态理解与生成任务,在多个基准上取得优异性能。
Comments This work was completed in \textbf{November 2025}
GRACE: 基于接地动作中心证据增强视频多模态大语言模型用于观众情感预测
机构 * Shanghai Jiao Tong University(上海交通大学) ; Hangzhou Dianzi University(杭州电子科技大学) ; The 52nd Research Institute of China Electronics Technology Group Corporation(中国电子科技集团公司第五十二研究所) ; Hangzhou Bywin Technology Co., Ltd.(杭州百威科技有限公司) ; Zhejiang Dahua Technology Co., Ltd.(浙江大华技术股份有限公司) ; School of Information Science and Engineering, Shandong University(山东大学信息科学与工程学院) ; Haihe Laboratory of Information Technology Application Innovation(海河信息技术应用创新实验室)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 提出GRACE框架,通过提取时间有序的主谓宾三元组和视觉实体裁剪,增强视频MLLM对细粒度情感线索的提取与推理,在Pitts数据集上提升Qwen2.5-VL和Qwen3-VL性能。
Comments 13 pages, 5 figures
长视频中的条件多事件时间定位
机构 * University of Central Florida(中佛罗里达大学) ; Qualcomm AI Research(高通人工智能研究院)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 提出CoMET-Bench基准和CoMET-Agent框架,解决长视频中基于组合时空条件定位所有事件的任务,F1@0.5提升6.1%。
自动驾驶谈判者:一个在隐藏意图下进行社会谈判和心理理论的交互式可验证基准
机构 * Owl Autonomous Imaging, Inc(Owl 自动成像公司)
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 提出一个文本多轮程序化生成环境,用于衡量自动驾驶中基于隐藏意图推断的隐式社会协调能力,通过特权模拟器状态计算奖励和诊断,当前最佳模型平均成功率仅0.68。
GitHub 模板仓库:服务领域、维护与从业者指南
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 通过对五种主流编程语言的 GitHub 模板仓库进行大规模实证研究,分析了模板的服务领域、维护特征及质量问题,并提出了设计和管理模板的实用指南。
Comments 12 pages, 3 figures
GarmentSketch:大规模草图到时尚基准
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 为解决时尚草图到图像合成缺乏大规模配对数据的问题,构建了包含26249对草图-文本描述的GarmentSketch数据集,并基于多模态大模型与人工精炼生成描述,评估了现有生成模型的性能。
Comments ICCCI 2026. Project page: https://khangbdd.github.io/garmentsketch
SupraBench: 超分子化学基准
机构 * University of Notre Dame(圣母大学) ; University of Connecticut(康涅狄格大学)
专题命中 评测与基准 :pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 为评估大语言模型在超分子化学推理中的能力,与领域专家合作发布了首个超分子基准SupraBench,包含四个基本任务和一个辅助视觉任务,并提供了16M令牌的语料库SupraPMC。
RAG投毒的影响因素
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 通过432种配置的全因子实验,研究数据集、检索器类型、检索深度、数据库组成、分块策略和生成模型对RAG系统投毒鲁棒性的影响,发现检索器架构、数据集和检索深度是主要因素,且投毒脆弱性源于多组件交互。
Comments 10 pages, 3 figures, 2 Tables, conference KES-2026 30th International Conference on Knowledge-Based and Intelligent Information & Engineering Systems
Q-Fold: 查询感知的焦点-上下文时空折叠用于长视频理解
机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳高等研究院)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 提出Q-Fold,一种无需训练的长视频输入构建框架,通过查询引导将相关片段保留为高保真焦点帧,不相关片段折叠为上下文布局,在固定预算下提升多模态大模型的长视频理解性能。
Comments 10 pages, 5 figures, 8 tables. Code will be made publicly available
基于经验的自适应虚拟患者用于心理治疗培训:对治疗师微技能做出反应的披露
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 提出自适应虚拟患者(AVP),基于近2000小时真实治疗转录的结构方程模型,动态调整披露水平以响应治疗师共情和探索技能,在80次会话评估中优于纯提示基线。
调控AI导师:青少年使用生成式AI时的意图、求助行为与自我调节学习
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 研究通过98名九年级学生的对话数据,分析青少年使用生成式AI学习时的自我调节学习和求助行为,发现学生主要进行工具性请求而缺乏监控评估,且后测成绩显著下降。
ChronoPhyBench:多模态大语言模型真正理解世界还是仅仅利用语言先验?
机构 * Peking University, Shenzhen Graduate School(北京大学深圳研究生院) ; Peng Cheng Laboratory(鹏城实验室) ; Rabbitpre Intelligence ; Nanyang Technological University(南洋理工大学) ; Tsinghua University(清华大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 提出ChronoPhyBench基准,通过视频上下文和文本描述强制模型进行物理状态推理,揭示当前开源模型物理推理能力仍处初级阶段。
TEVI: 基于稀疏自编码器的文本条件视觉表示编辑以改进视觉-语言对齐
机构 * Max Planck Institute for Informatics, Saarland Informatics Campus, Saarbrücken, Germany(马克斯·普朗克研究所信息学院,萨尔兰信息学院,德国萨尔布吕肯) ; Department of Language Science and Technology, Saarland University, Saarbrücken, Germany(语言科学与技术系,萨尔兰大学,德国萨尔布吕肯)
专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出TEVI框架,利用稀疏自编码器解耦图像嵌入,并通过文本条件掩码模块选择性重构嵌入,以改善CLIP等视觉-语言模型的图像-文本对齐,在多个检索基准上取得提升。
Comments 20 pages, 13 figures, 14 tables
证据市场
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 提出证据市场,通过动态调整流动性的对数市场评分规则,激励提交证据和信念,支持内生解决,证明有界损失、证据按市场不确定性奖励,并实现ε-DSIC策略。
站在巨人的肩膀上:通过GiAnt语料库赋能自动化智能合约审计
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 提出自动化框架GiANT,从真实审计报告中提取漏洞信息构建高质量数据集GiAnt Corpus,包含7711个漏洞发现,验证了其在漏洞检测等任务中的实用性。
看见而不暴露:面向开放世界、上下文饥渴型MLLM的自适应隐私控制
机构 * City University of Hong Kong(香港城市大学) ; Hon Hai Research Institute(鸿海研究学院) ; Lingnan University(岭南大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 针对多模态大语言模型在开放世界中面临不可预测敏感信息泄露的隐私挑战,提出无训练方法APD,将隐私元素漂移至语义等价替代物并锚定上下文线索,结合新基准AdaptShield实现隐私保护与上下文保留的平衡提升。
当恢复至关重要时:MLLM编辑中替代隐私的盲点
机构 * City University of Hong Kong(香港城市大学) ; Hon Hai Research Institute(鸿海研究院) ; Lingnan University(岭南大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 针对多模态大模型编辑中的隐私风险,提出首个面向恢复的替代隐私保护编辑基准SPPE,涵盖36个细粒度隐私类别和65个编辑指令,并设计可编辑性评估与替代到源编辑恢复两个任务及对应方法。
GuideCAD: 基于前缀嵌入的轻量级多模态3D CAD模型生成框架
机构 * Convergence Research Center for Insect Vectors(昆虫传播载体汇聚研究中心) ; Incheon National University(仁川国立大学) ; Center for Brain-Machine Interface(脑机接口中心)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 提出GuideCAD框架,利用少量可训练参数通过映射网络将图像嵌入转为前缀嵌入,结合预训练大语言模型和Transformer解码器生成3D CAD模型,参数减少约4倍且训练效率提升2倍。
AutoPipelineAI: 基于自然语言的上下文感知CI/CD流水线生成
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 提出AutoPipelineAI系统,利用大语言模型从自然语言描述生成CI/CD流水线配置,集成仓库感知分析、自动验证和反馈机制,降低DevOps配置复杂度。
Comments 7 pages, 1 figure, 6 tables, 16 references, IMSA Conference 11-12 July 2026, International Conference on Intelligent Methods, Systems, and Applications 2026 #70415,
分组随机机:将精度而非能力作为AI系统的前沿度量标准
专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出将精度而非能力作为AI系统的前沿度量,指出当前基准测试未测量精度,定义了分组度量方法,其测量结果可指导决策,且该方法需通过实际工作测量验证规范价值。
Comments 6 pages, 3 figures. Companion to "Tuning the Stochastic Machine", submitted concurrently
MAVEN:基于紧凑对齐评估器的多模态内容宏观社会价值评估框架
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 评测与基准 :preference optimization(abstract);分类 cs.CL、cs.LG
AI总结 针对多模态内容宏观社会价值评估难题,提出MAVEN分层框架,构建相关基准与指标,优化评估器,实验表明其2B评估器表现接近前沿闭源VLMs,提供了可扩展评估路径。
Comments 18 pages, 6 figures
并非所有注意力都平等:EEI权衡的定量综述
专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG
AI总结 本综述围绕注意力机制的效率-表达性-可解释性权衡,定量对比21种方法,梳理其多领域发展脉络,分析研究缺口并指明未来方向,支持粗粒度层级对比。
Comments 53 pages, 8 figures, 16 tables. Code and analysis artifacts: https://github.com/Nixon-H/not-all-attention-is-equal
Handoff-H1:一种用于从建筑蓝图中提取材料工程量的协同视觉智能体系统
机构 * Handoff AI Research(汉德夫人工智能研究院)
专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出Handoff-H1视觉智能体系统,结合专用计算机视觉模型、工具智能体与建筑知识库,在建筑蓝图工程量提取基准上,性能优于前沿模型和人类专业估算师。
Comments 15 pages, 7 figures. Evaluation harness available on https://github.com/handoffai/residential-takeoff-benchmark/. Request data via e-mail to research@handoff.ai
法律检索增强生成(RAG)中的时间错位:面向法国税法的版本化语料库基准
专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对法律RAG的时间错位问题,构建法国税法版本化语料库基准FiscalQA Pro,发现现有模型时间推理能力差,端到端多版本检索器性能优异,还发布了相关数据集与代码。
Comments 13 pages, 1 figure, 4 tables. Accepted at the ICML 2026 Workshop on AI for Law (AI4Law), Seoul. Code and data: https://github.com/rosecymbler/fiscal-fr-bench
UNMASK:发现并因果验证文本分类器中的虚假捷径
专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG
AI总结 本文提出UNMASK自动化流程,可发现并因果验证文本分类器的虚假相关性,在MNLI、CivilComments-WILDS等数据集上提升模型性能,还可推广至奖励模型偏好数据。
Comments Accepted at COLM 2026
SABRE:压力场景下视觉语言模型(VLM)的可扩展自动化基准测试
机构 * University of Chicago(芝加哥大学) ; Toyota Technological Institute at Chicago(芝加哥丰田技术学院) ; Stony Brook University(石溪大学)
专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI
AI总结 SABRE是可扩展自动化VLM压力测试框架,可生成多维度测试样本,经实验验证其能有效评估VLMs对视觉证据与世界先验的依赖程度,支持多种压力测试场景。
Comments 22 pages, 10 figures. Code and resources will be available at https://zesearch.github.io/vlm-SABRE/
零差距并非恢复:分层逐题概率评估与基准污染的逐步缓解
机构 * Zhejiang University(浙江大学)
专题命中 评测与基准 :pretraining(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对基准测试数据泄露导致的模型评估偏差问题,提出SA-PPG指标与RailCap方法,揭示现有缓解策略的恢复效果被高估,RailCap可实现更低的污染程度。
PHASE-Tree:建模长回合角色扮演对话中的角色状态演化
机构 * MemTensor (Shanghai) Technology(MemTensor(上海)科技) ; KU Leuven(鲁汶大学) ; Zhejiang University(浙江大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Sinar Mas Paper (China) Investment Co., Ltd(金光纸业(中国)投资有限公司) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI
AI总结 针对长回合角色扮演对话的角色状态演化问题,提出多时间尺度角色状态树模型PHASE-Tree,构建基准LongEvoRoleBench并验证其在角色生成任务上的性能优势。
基于VLM标注数据集训练条件化电子游戏智能体
专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对电子游戏强化学习中奖励获取、加权及稀疏性等问题,提出用VLM标注数据集,结合离线RL训练条件化智能体,并分析实验中的困难与局限。