From Forgeries to Foundation Models: A Systematic Survey of Identity Document Attack and Detection
从伪造到基础模型:身份证件攻击与检测的系统性综述
专题命中 评测与基准 :foundation model(title,abstract)
AI总结 本文系统综述了身份证件伪造攻击(物理呈现、数字注入、生成式合成)及检测方法,揭示了基准与现实间的差距,并发现最强模型在零样本场景下APCER超25%。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
从伪造到基础模型:身份证件攻击与检测的系统性综述
专题命中 评测与基准 :foundation model(title,abstract)
AI总结 本文系统综述了身份证件伪造攻击(物理呈现、数字注入、生成式合成)及检测方法,揭示了基准与现实间的差距,并发现最强模型在零样本场景下APCER超25%。
(MRI)基础模型预测胶质瘤IDH突变状态的基准测试
专题命中 评测与基准 :foundation model(title,abstract)
AI总结 本研究比较了四种图像基础模型和基于影像组学的基线方法在预测胶质瘤IDH突变状态上的性能,发现影像组学基础模型TabPFN表现最佳,而图像基础模型在跨队列迁移中性能下降,但BiomedCLIP在外部队列中AUROC最高。
BRIGHT:用于乳腺病理的协作式通用-专科基础模型
机构 * Department of Breast Pathology and Laboratory, Tianjin Medical University Cancer Institute & Hospital, National Clinical Research Center for Cancer, Key Laboratory of Breast Cancer Prevention and Therapy, Tianjin Medical University, Ministry of Education, Tianjin’s Clinical Research Center for Cancer, West Huanhu Road, Tianjin, China(天津医科大学肿瘤医院乳腺病理科及实验室,国家癌症临床研究中心,天津医科大学乳腺癌预防与治疗重点实验室,天津医科大学,教育部,天津癌症临床研究中心,西湖南路,天津,中国) ; Guangdong Provincial Key Laboratory of Artificial Intelligence in Medical Image Analysis and Application, Guangdong Provincial People’s Hospital (Guangdong Academy of Medical Sciences), Southern Medical University, Guangzhou, China(广东省人工智能在医学影像分析与应用重点实验室,广东省人民医院(广东省医学科学院),南方医科大学,广州,中国)
专题命中 评测与基准 :foundation model(title,abstract)
AI总结 提出BRIGHT,首个针对乳腺病理的基础模型,采用通用-专科协作框架,在5.1万张全切片图像上训练,在25项内部验证任务中均达最优性能,优于5个通用模型。
SCLARO:面向场景级场景理解的数据集及用于基准测试的ScenarioCLIP
机构 * Machine Intelligence Group, Department of CS&IS, Birla Institute of Technology and Science, Pilani – Hyderabad Campus(人工智能组,计算机科学与信息系,比拉理工学院和科学学院,比拉-海得拉巴校区)
专题命中 评测与基准 :language model(title,abstract)
AI总结 提出SCLARO数据集(615,805张图像,含动作、对象和关系标注)及ScenarioCLIP模型,通过解耦编码器和知识蒸馏联合编码场景上下文、对象和关系,在零样本检索等任务上优于先前方法。
非曼哈顿环境下的文本驱动3D室内场景合成
专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对非曼哈顿环境中现有方法难以建模非正交空间关系导致几何违规和物理保真度低的问题,提出SPG-Layout框架,利用物体分布统计先验和层次化布局策略,实现语义真实感与物理合理性的平衡优化。
评估学术文本中检索增强生成的文本分块策略
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究在检索增强生成系统中,基于聚类的语义分块是否优于固定大小和递归分块,通过RAGAs框架在长结构化学术论文上评估检索和答案质量,发现聚类分块未超越简单策略。
ContraFix:通过差分运行时证据和技能重用进行代理漏洞修复
机构 * Beihang University(北京航空航天大学) ; The University of Hong Kong(香港大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出ContraFix框架,通过差分运行时证据和可重用的修复技能,解决大型语言模型代理在自动漏洞修复中的语义误解问题,实现了在SEC-Bench和PatchEval上的高准确率。
Comments Code: https://figshare.com/s/f173c78e44bca88ebaea
MedRepBench:医学报告解读的综合基准
机构 * Baidu Inc.(百度公司)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出MedRepBench基准,包含1925张去标识中文医学报告图像,评估端到端视觉语言模型在报告字段结构化提取和患者友好解释上的性能,并提供GRPO对齐基线提升字段召回率6%。
Comments ECCV 2026 (main conference)
A$^{2}$utoLPBench:通过逆KKT构造自动生成的、智能体友好的线性规划基准
机构 * The Chinese University of Hong Kong(香港中文大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出A$^{2}$utoLPBench,一种通过逆KKT条件自动生成线性规划文本问题的基准,提供无限新问题、难度可控、答案正确且防数据泄露。
Comments 25 pages and 4 figures
PairCoder++:结对编程作为验证代码驱动的多模态与结构化工件生成的通用范式
机构 * THU(清华大学) ; PKU(北京大学) ; PolyU, Hong Kong(香港理工大学) ; USTC(中国科学技术大学) ; UESTC(电子科技大学) ; Tongji University(同济大学) ; Tianjin University(天津大学) ; Independent Researcher(独立研究者) ; Guangming Lab(光明实验室) ; BAAI(北京智源人工智能研究院)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出PairCoder框架,通过驱动者和导航者两个智能体结对编程,利用工具链反馈验证代码生成,在17个基准测试中显著提升可验证工件的生成质量。
Comments Accepted by ACL 2026. Project Page: https://yisuanwang.github.io/PairCoder/
编程示例中的固定集鲁棒性:示例损坏与语义分区恢复
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG
AI总结 研究编程示例系统中对抗性示例损坏的鲁棒性,提出版本空间分区聚合(VPA)防御方法,实验表明低裕度任务易受攻击,VPA仅在语义分区投票裕度存在时有效。
印度皮肤科医生如何将人工智能用于临床实践和工作流程管理:一项以特应性皮炎为重点的全国性调查
机构 * Charnock Hospital, Kolkata, India(科钦医院,加尔各答,印度) ; Department of Dermatology, Jagannath Gupta Institute of Medical Sciences and Hospital, Kolkata, India(皮肤科部,贾亚纳塔·古普塔医学科学与医院,加尔各答,印度) ; Department of Pediatric Dermatology, Institute of Child Health, Kolkata-700017, India(儿科皮肤科部,儿童健康研究所,加尔各答-700017,印度) ; Department of Dermatology, Venereology, and Leprology, Postgraduate Institute of Medical Education and Research, Chandigarh-160012, India(皮肤科、性病学和麻风病学部,医学教育与研究研究生院,昌迪加尔-160012,印度) ; Department of Dermatology and STD, University College of Medical Sciences & GTBH, University of Delhi, Delhi-110095, India(皮肤科和性传播疾病部,医学科学大学及GTBH,德里大学,德里-110095,印度) ; Department of DVL, Sree Balaji Medical College and Hospital, Chennai, India(DVL部,Sree Balaji医学院和医院,钦奈,印度)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 通过全国性调查,发现印度皮肤科医生主要使用通用大语言模型处理认知和行政任务,而临床需求集中于慢性病管理和特应性皮炎工作流支持,提示临床监督下的工作流工具可能比独立诊断应用更有用。
Comments 28 pages, 5 tables
基准审计中的可靠性差距:分布偏移和规模作为污染检测的失败模式
机构 * NASK National Research Institute(国家研究 institute) ; Warsaw University of Technology(华沙技术大学) ; Gdańsk University of Technology(格但喀大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 研究基准污染检测方法在分布偏移和规模约束下的可靠性,发现三种主流方法在335次评估中仅199次正确,揭示了受控验证与实际审计之间的系统性可靠性差距。
Comments accepted to ECML PKDD 2026
AgenticRAGTracer:用于诊断Agentic RAG中多步检索推理的跳数感知基准
机构 * University of Science and Technology Beijing(北京科技大学) ; Peking University(北京大学) ; Zhongguancun Academy(中关村学院) ; Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京市数据智能与安全重点实验室(北京大学))
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出首个由大语言模型自动构建的Agentic RAG基准AgenticRAGTracer,包含1305个跨领域数据点,支持逐跳验证,揭示模型在多步推理中推理链扭曲的问题。
Comments Accepted at ACL 2026 Findings
这是一个陷阱!面向网络代理的任务重定向说服基准
机构 * University of Cambridge(剑桥大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出TRAP基准,评估大型语言模型驱动的网络代理在动态网页中易受提示注入攻击的程度,发现平均25%的任务中代理被重定向,揭示了心理驱动的系统漏洞。
Comments ICML 2026
SEPS:面向细粒度跨模态对齐的语义增强补丁精简框架
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出SEPS框架,通过两阶段机制整合稠密与稀疏文本语义,识别显著视觉补丁,并利用相关性感知选择与均值计算突出关键补丁-词对应,提升跨模态相似度评估,在Flickr30K和MS-COCO上rSum提升23%-86%。
编码代理在猜测:测量欠指定DevOps指令中的动作边界违规
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 提出UnderSpecBench基准,通过69个任务族和2208个提示变体,评估编码代理在欠指定DevOps指令下的动作边界违规,发现55.8-67.8%的运行至少违反一个边界,表明完成度评估高估了安全自主性。
DeepGaze3.5-VL: 通过自回归标记预测建模扫描路径
机构 * IMPRS-IS
专题命中 评测与基准 :language model(abstract);prompting(abstract)
AI总结 将扫描路径预测建模为离散序列任务,利用视觉语言模型的预训练表示,通过简单提示实现个性化偏置和任务特定目标,在MIT1003上信息增益达2.18比特,比DeepGaze III提升46%。
增强视听视频字幕的时间与跨模态对齐
机构 * Nanjing University, State Key Laboratory for Novel Software Technology(南京大学,计算机软件新技术国家重点实验室) ; Meituan(美团)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 提出TCA-Captioner框架,通过观察-检查-纠正迭代策略和密集交互数据集,解决视听字幕中的模态分离与时间不一致问题,实现精准的视听绑定与因果动态建模。
Comments ECCV 2026
单个补丁不够:修复候选的确定性融合
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 针对代码修复中候选补丁池的“pass@k到pass@1”差距,提出PatchFusion方法,通过确定性原子证据融合选择并构造最终补丁,无需测试结果,在三个基准上优于现有选择器。
Social-Annotate: 用于标注和收集社交媒体数据的自愈浏览器扩展
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 提出Social-Annotate浏览器扩展,通过注入可定制表单实现在线平台直接数据收集,并集成大语言模型驱动的自愈代理以应对界面变化,支持12个平台,降低数据收集和维护成本。
Comments 13 pages, 3 figures, 1 SI-table, 2 SI-figures
与人工智能谈论政治
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 基于430万条人机对话数据,发现政治内容占3.9%,用户主要寻求信息而非表达观点;2024年美国大选结果公布后,美国用户的情感表达和意识形态极端性增加,表明AI对话是政治中介而非公共广场。
Comments 58 pages, 15 figures, 21 tables; includes appendices
所有关系通向罗马:自动化知识图谱构建与问题生成
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 提出ARLtR框架,联合构建知识图谱、嵌入和基于事实的问答对,实现符号图与稠密检索的统一表示,并以罗马帝国历史数据集验证。
Comments 10 pages, 5 figures, version one
TimeChat-Captioner: 用时间感知和结构化的音视频字幕脚本化多场景视频
机构 * South China University of Technology(华南理工大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队)
专题命中 评测与基准 :SFT(abstract,abstract_cn)
AI总结 提出Omni密集描述任务,通过六维结构模式生成带时间戳的类脚本描述,构建OmniDCBench基准和SodaM评估指标,训练TimeChat-Captioner-7B模型,在音视频推理和时间定位任务上超越Gemini-2.5-Pro。
基于渐进调优的缺陷感知混合提示优化用于零样本多类型异常检测与分割
机构 * Corporate Research, Robert Bosch GmbH(罗伯特·博世集团企业研究部) ; Otto-von-Guericke-University(奥托·冯·格里克大学) ; Institute for Artificial Intelligence, University of Stuttgart(斯图加特大学人工智能研究所) ; Faculty of Computer Science, UniVie Doctoral School Computer Science, University of Vienna(维也纳大学计算机科学系) ; University of Southampton(南安普顿大学)
专题命中 评测与基准 :language model(abstract);prompting(abstract)
AI总结 提出DAPO框架,通过混合提示机制结合可读缺陷描述与可学习嵌入,对齐异常视觉特征与文本语义,在零样本多类型异常检测与分割任务中平均提升AUROC 3.6%和5.2%。
Journal ref European Conference on Computer Vision (ECCV 2026)
TestEvo-Bench:一个可执行且动态的测试与代码协同演化基准
专题命中 评测与基准 :foundation model(abstract);分类 cs.CL、cs.AI
AI总结 提出TestEvo-Bench基准,包含测试生成和更新两类任务,基于真实提交历史并支持执行指标,评估自动化代理在代码变更后同步调整测试的能力。
Comments TestEvo-Bench leaderboard and data explorer are hosted at https://www.testevo-bench.com
评估视觉语言模型在图像退化与偏差下进行医学图像质量评估的可靠性
机构 * University of Tuebingen(图宾根大学) ; Institute for Bioinformatics and Medical Informatics (IBMI), University of Tuebingen(图宾根大学生物信息学与医学信息学研究所)
专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG
AI总结 研究视觉语言模型在医学图像质量评估中,面对图像退化(如像素化)和文本属性偏差时的可靠性,发现像素化显著降低性能,而文本属性(如机构声望)引入偏差。
COMFYCLAW:面向图像生成工作流的自进化技能工具包
机构 * University of Maryland(马里兰大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Nvidia(英伟达) ; Lehigh University(里海大学)
专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG
AI总结 提出COMFYCLAW框架,通过类型化图编辑、区域级VLM验证器和渐进式技能库进化,提升ComfyUI工作流构建的代理可靠性和性能,在多个基准上取得最佳平均评分。
Transformer嵌入空间中认知状态的几何组织
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG
AI总结 研究通过线性与浅层非线性探针评估句子嵌入是否能解码人类可解释的认知属性,发现嵌入空间存在显著的几何结构。
MMBench-Live:一个持续演进的多模态模型基准
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; PRIS-CV
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 提出MMBench-Live,一个通过多智能体自动化流水线构建的持续演进多模态基准,解决静态基准的时效性、数据污染和维护成本问题,采用分布一致性更新策略,每次更新成本约30美元。