AdaptPrint: Response-Adaptive Fingerprinting of Black-Box LLM Services
AdaptPrint:黑盒大语言模型服务的响应自适应指纹识别
专题命中 评测与基准 :LLM(title,summary_cn)
AI总结 针对黑盒LLM服务的不透明性问题,提出响应自适应指纹识别方法AdaptPrint,整合三种探测策略实现LLM身份识别,在27个候选模型上优于现有方法,准确率达80.6%等且鲁棒性强。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
AdaptPrint:黑盒大语言模型服务的响应自适应指纹识别
专题命中 评测与基准 :LLM(title,summary_cn)
AI总结 针对黑盒LLM服务的不透明性问题,提出响应自适应指纹识别方法AdaptPrint,整合三种探测策略实现LLM身份识别,在27个候选模型上优于现有方法,准确率达80.6%等且鲁棒性强。
结合问题信息的大语言模型增强型提交消息生成:一项探索性研究
专题命中 评测与基准 :LLM(title,summary_cn)
AI总结 该研究提出ISAC框架,将代码差异与问题信息结合作为LLM输入生成提交消息,经实验验证其性能优于现有基线,且纳入问题信息可提升CMG效果。
Comments 28 pages, 7 images, 11 tables, Manuscript submitted to a journal (2026)
基于大语言模型的低成本需求变更影响分析
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出ProReFiCIA方法,利用大语言模型自动识别需求变更影响,实验显示其在未见过的工业数据集上召回率达85.7%,且成本低,仅需审查3%的需求。
Comments 33 pages, 4 figures
用大型语言模型(LLM)增强遗传网表生成
专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.LG
AI总结 该研究提出混合合成框架LLM-SPICEMixer,将遗传网表生成与IGEL结合,在Iris分类任务中,相比无LLM引导的遗传框架,提升了多项性能指标。
Comments Accepted for MLCAD 2026, Extended Version
基于ASAS对领先阿拉伯大型语言模型开展红队测试
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究推出首个人工策划的阿拉伯语红队测试基准ASAS,评估7款领先阿拉伯LLM的安全性,发现多数模型对50%不安全提示防御失效,自动安全评判器表现逊于人工,为阿拉伯LLM安全提供文化适配的测试方案。
Comments 13 pages, 5 figues, 3 tables
CallScreenBench:将端侧模型作为电话秘书的基准测试
专题命中 评测与基准 :language model(title,abstract);small language model(title);分类 cs.AI
AI总结 研究人员提出CallScreenBench基准,针对端侧模型作为电话秘书的场景,从五个维度评分,发现分类性能差异是测量假象,脚本退化代理提供基准线,未设通过/失败阈值。
Comments 24 pages, 8 figures
心理上有效,计算上不可见:LLM 生成引发社会比较的帖子但无法检测
机构 * Department of English Language Education(英语语言教育系) ; Analytics/Assessment Research Centre(分析/评估研究中心)
专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL
AI总结 本研究通过构建小红书社会比较读者诱发基准(XHS-SCoRE),发现 LLM 在生成引发社会比较的帖子时存在生成-检测不匹配,即该信号在领域内可学习但无法通过提示分类稳健访问。
Comments Accepted at the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026). 20 pages, including references and appendices; 1 figure and 6 tables. Project repository: https://github.com/zhao4hua4/XHS-SCoRE
对PDF中数学公式提取的文档解析器进行基准测试
机构 * Institute for Machine Learning and Analytics (IMLA), Offenburg University, Offenburg, Germany(机器学习与分析研究所(IMLA)、奥芬堡大学) ; University of Mannheim, Mannheim, Germany(曼海姆大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出了一种新的PDF数学公式提取基准测试框架,通过合成数据和LLM评估方法,评估了多种解析器的性能差异,揭示了选择合适解析器的关键因素。
Comments Best Scientific Paper Award, ICPR 2026 (Document Analysis and Recognition Track)
Journal ref Pattern Recognition. ICPR 2026. Lecture Notes in Computer Science, vol 16813, pp. 93-107. Springer, Cham, 2026
语言模型中的评估感知:表示、语言化与控制
专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 该研究系统探测了6个语言模型的评估感知,发现其可线性解码、与语言化部分对齐,且在Olmo模型中随微调放大,需评估时考虑模型内部表示与语言化的脱节。
Comments The first two authors contributed equally
ARGUS:基于MCP的Kubernetes事件根本原因分析工具
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)
AI总结 ARGUS是一款基于MCP的Kubernetes事件根本原因分析助手,通过标准化MCP服务器关联LLM与实时可观测数据,在Slack频道提供诊断摘要,经评估其能100%识别根本原因,但修复建议可信度不足。
Comments 11 pages, 5 figures
面向养老机构服务机器人的多模态语言模型驱动的交互与陪伴
机构 * National Cheng Kung University (NCKU)(成功大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)
AI总结 该研究针对养老机构服务机器人缺乏综合陪伴与安全能力的问题,提出整合主动视觉跟人、LLM语音交互及VLM安全监测的智能陪伴机器人系统,实验验证其跟随交互与跌倒检测的有效性。
Comments Accepted to the 2026 IEEE/ASME International Conference on Advanced Intelligent Mechatronics (AIM)
SkillBloat:通过大语言模型编码智能体中的技能注入实现的令牌放大攻击
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL
AI总结 本文提出SkillBloat两阶段框架,通过技能注入对LLM编码智能体实施令牌放大攻击,在真实基准上实现5.4184x-10.1455x平均最佳放大,揭示了技能生态系统的新型资源攻击面。
跨不可链接身份的分解攻击:大语言模型服务的有状态防御的局限性
专题命中 评测与基准 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文研究发现,针对跨不可链接身份的分解攻击,现有有状态防御策略在攻击者可重试学习时无法有效阻止攻击,需引入身份链接等额外分组相关机制。
机构 * George Mason University(乔治·马歇尔大学)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
Comments Accepted to TrustNLP at ACL (Association for Computational Linguistics) 2026
用于调查文本分析的大语言模型(LLMs):人类与GPT-5在归纳内容分析上的性能比较
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本研究对比人类与GPT-5.4在903份欧洲博士生调查开放式回答的归纳内容分析中的性能,发现GPT-5.4编码的ARI为0.61,可近似人类编码表现,或可作为归纳质性分析的可扩展支持工具。
用于乳腺癌多学科团队会议的边缘人工智能医疗设备系统的开发与可行性评估
专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 该研究开发了基于边缘AI的乳腺癌MDT会议系统,利用开源ASR、LLM和RAG实现设备上运行,经评估其ASR与RAG性能优异,证明了该系统的可行性。
测量大语言模型中的激活控制
机构 * UK AI Security Institute(英国人工智能安全研究所)
专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI
AI总结 本研究推出Activation Controllability Benchmark量化大语言模型的激活控制能力,发现多数模型可调控残差流,其控制可规避部分激活监控方法,建议追踪该能力以优化模型监控。
Comments 19 figures, 4 tables. Code: https://github.com/mkobalski/activation-control. Data: https://huggingface.co/datasets/joshycodes/activation-control-battery
基于大语言模型的对抗说服攻击对事实核查系统的攻击
机构 * Department of Computer Science, University of Sheffield, UK(计算机科学系,谢菲尔德大学)
专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出基于大语言模型的说服对抗攻击方法,通过重述声明影响事实核查系统的验证和证据检索效果。
Comments Accepted to EMNLP 2026 Main
SchemaGUI:一种用于可控图形用户界面生成评估的模式驱动基准
机构 * Shanghai University of Engineering Science(上海工程技术大学) ; Fudan University(复旦大学)
专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 针对LLM的GUI生成评估难题,提出SchemaGUI基准,测试Qwen3.5等5种主流模型,发现几何控制、布局复杂度、思维模式对GUI生成效果的影响规律。
Comments 18 pages, 6 figures, and 7 tables. Code is available at https://github.com/xdong2002/SchemaGUI
LitReview Arena:基于对战式同行评审平台的文献综述智能体评估
专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract);分类 cs.AI
AI总结 该研究推出对战式文献综述评估平台LitReview Arena,收集约3000条专家判断发现现有最强LLM综述系统仅23.0%胜率,校准后的评估器LitJudge将一致性提升至0.78。
Comments 20 pages, ICML 2026
波动评判者:在沉默、压力与坚持下的认知稳定性
机构 * Meta Superintelligence Labs(元超级智能实验室) ; FAIR at Meta(元公司FAIR研究院)
专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI
AI总结 本研究提出Wiggle框架测试LLM评判者的认知稳定性,发现9个前沿模型在压力下裁决波动显著,且多数压力会损害真实值,基线陪审团多数强度可预测波动项目。
有何玄机?评估视觉-语言模型的时间一致性
机构 * University of Copenhagen(哥本哈根大学)
专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出TimeCatch基准,发现视觉-语言模型可检测单帧异常但难整合跨帧信息,在时间异常检测上表现接近随机水平。
Comments 17 pages, ACL format
什么能证明你错:对可证伪的研究构思进行基准测试的语言模型
专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出 Lit2Test 基准,通过六领域契约让研究构想可证伪,对四个前沿模型的研究构想进行盲态成对比较,恢复了模型的严格排名并公开相关资源。
Comments Equal contribution by Ziyue Wang, Aomufei Yuan and Yiran Yao. Corresponding authors: Tong Yang and Xu Sun
TELEVAL: 为中国交互场景中的语音语言模型设计的动态基准
机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI)、中国电信)
专题命中 评测与基准 :language model(title,abstract);SLM(abstract);分类 cs.CL、cs.AI
AI总结 TELEVAL是一个为中国语音交互场景设计的动态基准,旨在评估语音语言模型在真实对话中的表现,强调内容准确性和互动适当性,揭示当前模型在自然交互回应上的不足。
用于语言模型稀有事件估计的自适应多级扭曲序贯蒙特卡洛方法
专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.LG
AI总结 针对现有扭曲序贯蒙特卡洛稀有事件估计依赖稀有正样本导致不可靠的问题,提出自适应多级扭曲SMC,通过逐步稀有中间事件学习扭曲,提升语言模型稀有不安全行为概率估计准确性,助力模型安全评估与对齐。
基于证伪的大语言模型生成优化模型验证:可靠的测试组及其检测极限
机构 * School of Information, Central University of Finance and Economics(信息学院,中央财经大学)
专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究大语言模型生成优化模型的验证问题,基于证伪理论开发测试组,通过求解器调用测试候选模型,实验证实该测试组可靠,能检测多种错误,误报率低,再现可检测性模式。
GeoRisk-RAG:一种通过选择性回答提升RAG可靠性的层级感知风险框架
机构 * Virginia Tech(弗吉尼亚理工大学) ; Florida Polytechnic University(佛罗里达理工大学) ; Kuwait University(科威特大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 GeoRisk-RAG是一种层级感知框架,通过选择性回答结合有向无环图距离估计地理适用性,在野火QA数据集上将位置相关问题错误置信率降至0.009,提升RAG可靠性,助力地理空间领域安全决策。
Comments Accepted for CIKM '26 conference
ExecRubrics:用于可验证且高效的长文本评估的可执行工具增强型评分标准
机构 * Emory University(埃默里大学) ; University of Waterloo(滑铁卢大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 ExecRubrics是将评分标准转化为可执行Python程序的框架,可替代黑盒LLM评判者,在三个长文本基准上实现与自然语言评分标准相当或更优的偏好准确率,且评估延迟降低最多320倍,提升了评估的可解释性与效率。
Comments Accepted to EMNLP 2026 Findings
面包屑式搜索智能体
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 该研究针对LLM搜索智能体的安全问题,提出ACH和TGSE策略,通过操纵搜索结果形成连贯证据链,大幅提升攻击成功率。
Comments 39 pages, 7 figures
面向真实世界放射学的专家级视觉-语言基础模型及综合评估
专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract)
AI总结 本研究提出面向放射学的开源VL基础模型RadFound,通过增强视觉编码器与跨模态学习设计,在自主构建的真实世界基准RadVLBench上显著优于其他VL模型,具备专家级放射学多模态处理能力。