Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Turn Attacks
有状态协作智能体防御大型语言模型抵御演进式多轮攻击
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 本文提出一种主动防御框架,通过协作多智能体架构结合干扰、误导与自适应策略,在EMRA数据集上使LLMs对抗多轮攻击的ASR平均降低69%,同时提升DR与攻击者token消耗。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
有状态协作智能体防御大型语言模型抵御演进式多轮攻击
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 本文提出一种主动防御框架,通过协作多智能体架构结合干扰、误导与自适应策略,在EMRA数据集上使LLMs对抗多轮攻击的ASR平均降低69%,同时提升DR与攻击者token消耗。
SafeBuild-Bench:一种具有图增强数据挖掘能力的时序鲁棒建筑安全基准
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 研究人员构建了图增强数据挖掘的时序鲁棒建筑安全基准SafeBuild-Bench,开发可扩展验证的GEMS流水线,发现现有多模态大语言模型对建筑安全理解仍不足。
Comments Accepted by KDD 2026. 12 pages, 6 figures
FESOM2-JAX v1.0:适配GPU的海冰-海洋模型FESOM2的可微镜像版本
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 FESOM2-JAX v1.0是FESOM2基于JAX的可微GPU版本,与原Fortran版本结果一致,具备端到端可微性,是首个CMIP级非结构化网格可微全球海冰-海洋模型。
CWEEP:用于CWE早期预防的词法静态分析框架
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 CWEEP是一种用于RTL安全弱点检测的静态分析框架,无需详细安全规范即可在RTL开发早期使用,能定位漏洞并提供修复建议,在3874个有漏洞模块数据集上的正确警告率达60.8%,远优于同类工具。
Comments 12 pages, 9 figures
多模态大语言模型(MLLMs)时代,显著性目标检测的复兴时机已到?
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 该研究针对MLLMs时代SOD的能力不匹配问题,提出无训练框架FOCUS,在13类SOD基准上超越SOTA方法,推动SOD从特定任务监督转向零样本前景组织。
Comments 10 pages, 4 figures, conference
用于小样本遥感场景分类的局部一致直推式信息最大化
机构 * ICTEAM, UCLouvain(天主教鲁汶大学 ICTEAM 研究所)
专题命中 评测与基准 :language model(abstract);foundation model(abstract)
AI总结 针对小样本遥感场景分类问题,提出LC-TIM方法,融合多源遥感基础模型亲和图,建立首个直推式小样本遥感场景分类基准,实验表明其性能优于现有方法。
Comments Accepted at ECCVW2026
使用智能体AI构建流程建模工具:PM4Py-UCM的经验报告
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 本文通过AI辅助构建开源流程建模工具PM4Py-UCM的深入案例,提出相关工具包与分类法,总结了开发经验教训及验证策略。
Comments 17 pages, 9 figures, 4 tables, submitted to a conference
AI 奉承与决策
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 该研究通过1500名参与者的30项决策实验,发现奉承式AI建议平均使选择去极化,虽奉承程度会削弱该效应,且市场力量不会引发更大极化效应,缓解了相关担忧。
安全漏洞报告自动识别技术的对比分析
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本文对比分析了逻辑回归、SetFit等多种安全漏洞报告自动识别技术,发现SetFit整体性能最优,GPT-5.2表现较差,迁移学习对不同数据量项目的性能影响存在差异。
LoMeVQA:纵向医学视觉问答综合基准
机构 * Tongji University(同济大学) ; East China Normal University(华东师范大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 该研究提出纵向医学视觉问答基准LoMeVQA,发现现有多模态大语言模型在该任务上时间推理能力不足,推出MedLong-8B实现最优性能,并开展相关分析。
Comments 23 pages, 17 figures, 7 tables. Code and data: https://github.com/pepperbubble/LoMeVQA
PanDent:面向牙科放射学中全面的牙级结构-语言一致性
机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) ; Imperial College London(帝国理工学院) ; University of Science and Technology of China(中国科学技术大学) ; Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) ; Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本研究推出PanDent牙科OPG基准,经实验发现现有MLLM生成的牙科报告流畅但临床一致性差,在PanDent上微调可提升其结构-语言一致性,该基准可用于评估MLLM的牙级临床推理能力。
基于人工智能的评分系统低估了语言薄弱学生在物理解释中的概念理解能力
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 该研究发现,所有AI评分方法均存在低估语言薄弱学生物理解释中概念理解的语言偏见,类似物理教师的相关偏见,多语言学习者受影响最大。
Comments Shared lead authorship
当知识发生变化时:面向RAG系统的变异体态测试
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 针对现有RAG系统评估方法无法检测语料库演变带来的故障问题,提出含11个变异算子的体态测试框架,实验显示其F1分数远优于RAGAS,可有效评估RAG系统在语料库变化下的一致性。
Comments ASE 2026
跨模型跨语言AI编程智能体性能:并行CLRS算法的准确率与速度
专题命中 评测与基准 :LLM(abstract);prompting(abstract)
AI总结 本文评估Cursor's Composer 2.0等三款AI编程智能体在三种语言三类算法上的并行代码生成性能,发现其并行能力弱于串行,性能提升高度依赖算法与语言,需将运行时效率纳入大语言模型核心指标。
ChatGPT评估已发表期刊文章质量(从PDF、标题或摘要)是否与个人评审员一样可靠?
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 研究比较ChatGPT-5.4与个人评审员对期刊文章质量评分,用专家评分作参照,涉及从标题/摘要及PDF输入的评分。结果显示与专家评分相关性大多为正,ChatGPT-5.4对PDF评估更详但评分预测未改善,其深入评论有误导性。
SONG:用于基准测试社会导航的逼真3D高斯模拟平台
机构 * School of Computer Science & Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 研究针对社会导航模拟平台不足的问题,介绍了基于3D高斯点云渲染的SONG平台,利用其进行场景和化身表示等,还策划了SONG-Bench及评估套件,通过评估发现相关问题,证明微调数据可提高现实环境成功率,为研究提供测试平台。
HiEviDR-Bench:深度研究中分层证据聚合的基准测试
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 针对深度研究中证据聚合评估不足问题,HiEviDR-Bench构建基准测试,涵盖多领域多模态设置,用证据图表示实例,开发评估框架及机制。含2000个问题,实验显示多模型虽报告质量好,但在引用准确性等方面欠佳,瓶颈在证据识别和中间主张构建。
Comments Code and data are available at https://ai9stars.github.io/HiEviDR-Bench.github.io
CHaystack:中文文档检索与视觉问答基准测试
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本文介绍了CHaystack中文文档检索与视觉问答基准测试,涵盖四类文档。提出CDocRAG系统,用VLM相关性过滤器验证文档图像。评估开源模型发现Qwen系列在文本丰富文档表现佳,中文大规模DocumentVQA在文本编码方面有挑战,仍需改进。
CORE:一种用于电子商务搜索的统一级联序数相关性估计框架
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 该研究针对电商搜索中排名相关性问题,提出统一级联二元分类框架,将相关性估计转为顺序决策过程。框架适用于大语言模型和在线BERT模型,经实验验证能显著提升相关性性能,降低在线坏例率,表明分层建模对相关性估计有效。
Comments 11 pages, 5 figures
欺诈性人工智能生成的回复对软件工程调查的影响
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 研究软件工程调查中欺诈性或人工智能辅助回复对结果有效性的影响,通过对四个数据集二次分析,用人工识别、自动检测等方法,发现人工智能辅助参与因分析类型不同影响有别,强调多种验证程序结合的重要性。
ABISS:通过代理交互评估文本到SQL系统
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 研究针对文本到SQL系统在处理现实模糊问题的不足,提出统一分类法、多代理生成管道及动态模拟环境ABISS。通过实验揭示模型在子类别分类和澄清条件下SQL生成的瓶颈,提供真实类别虽有收益,但模糊问题执行率仍低,且发布相关代码。
DispatchRAG:基于交通事故视频中的现实世界协议进行应急调度决策
机构 * Graduate School of Information Science and Technology, University of Tokyo(东京大学信息科学与技术研究生院)
专题命中 评测与基准 :LLM(abstract);language model(abstract)
AI总结 研究旨在通过DispatchRAG框架,利用基于RAG的检索机制和大型语言模型驱动的推理器,根据日本现实交通事故响应协议进行事故评估和调度,引入事故调度数据集验证框架,为自动驾驶车辆事故报告提供支持。
RadSight:迈向感知可靠的多模态放射学图像理解
机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; Hupan Lab(湖畔实验室) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 该研究针对医学多模态大语言模型视觉解释可靠性低的问题,引入Perception-Bench基准分析问题。提出基于双2D/3D编码器架构的RadSight模型,经渐进课程学习训练,在多维度评估中优于现有模型,凸显低级视觉感知对可靠临床理解的关键作用。
MVEI与EmObserver:通过情感陈述判断增强面向MLLM的视觉情商
机构 * Tsinghua University(清华大学) ; Nankai University(南开大学) ; Beijing Institute of Technology(北京理工大学) ; Chinese Academy of Sciences(中国科学院)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 研究针对多模态大语言模型视觉情商评估缺失问题,引入情感陈述判断公式ESJ,开发INSETS及MVEI基准,构建EmObserver模型。通过实验评估,确立了ESJ、MVEI和EmObserver在推进面向MLLM的视觉情商方面的作用。
ViSTR-Bench:多模态大语言模型能否从动态场景中的连续视觉线索进行推理?
机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; Zhongguancun Academy(中关村科学城) ; School of Engineering, Westlake University(西湖大学工学院) ; School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 研究聚焦多模态大语言模型在动态场景中从连续视觉线索推理的能力,提出ViSTR-Bench评估套件,基于相关原则建立四维评估,含15个子任务和1340个问答对,经评估发现当前模型在复杂时空推理上有瓶颈,远不及人类。
Comments 37 pages, 37 figures
智能设计师:用于结构感知室内布局生成的渐进式多智能体协作
机构 * Guangdong University of Technology(广东工业大学) ; South China University of Technology(华南理工大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 针对室内布局生成难题,提出智能设计师这一渐进式多智能体框架,将布局生成视为迭代约束验证决策过程,通过渐进共识机制协调三个智能体,经实验验证其显著优于现有方法,提升了结构遵循和功能设计连贯性。
Comments TPAMI 2026
AppWorld-UL:用于工具使用的多样化智能体-用户交互基准测试
专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对当前智能体-用户交互基准测试不足,引入 AppWorld-UL 基准测试,基于 AppWorld 框架及模拟应用构建多样任务,用大型语言模型模拟用户行为,评估显示其难度大,能推动回路中工具使用智能体研究。
Comments ICML 2026
开放式问答中推理的无参考评估
机构 * Queen Mary University of London(伦敦大学玛丽皇后学院) ; Temple University(天普大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对高风险领域人工智能生成答案难验证问题,提出基于推理的无参考框架审核大语言模型输出,通过分解推理轨迹、标记关系并组织成超图等方法评估,在数学和医学推理设置下比直接以大语言模型为基线更可靠,强调问答评估应考虑推理关系组合。
EmbeddedKittens:对Scratch代码嵌入的评估
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 研究探讨哪种代码嵌入方法适用于Scratch编程教育。实例化四个LLMs和五种嵌入方法,创建任务及数据集进行评估,结果表明在开放Scratch数据集上训练的嵌入模型可捕获代码信息用于学习分析,无需特定任务微调。
Comments Submitted to ACM Transactions on Software Engineering and Methodology (TOSEM)
TimeLens2:使用多模态大语言模型进行通用视频时间定位
机构 * Nanjing University(南京大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; University of Science and Technology of China(中国科学技术大学) ; Fudan University(复旦大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 研究通用视频时间定位问题,TimeLens2将时间证据视为区间集,通过多种策略构建多跨度监督,其时间瓦瑟斯坦奖励等方法提供反馈,在多个基准测试中表现出色,不同变体均有性能提升。
Comments Technical Report