arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-18 至 2026-08-18 共收录 633 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 157 篇

2608.16246 2026-08-18 cs.CR cs.AI 新提交 74%

CompoSkill: Compositional Skill Chain Attacks from Individually Scanner-Passing LLM Agent Skills

CompoSkill:通过可单独通过扫描器的大语言模型智能体技能实现的组合技能链攻击

Mingxiao Liu, Zhoumian Jiang, Jianan Ma, Jian Zhang, Jialuo Chen, Xinhao Deng, Zhen Wang

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 CompoSkill框架揭示现有单技能认证的自主AI智能体存在系统性缺口,其通过双攻击者系统构造组合技能链攻击,在白、黑盒设置下分别实现83.3%、80.6%的风险链形成率,现有扫描器拦截效果有限。

Comments 9 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15092 2026-08-18 cs.CR cs.AI cs.SE 新提交 74%

WeSCE: A Benchmark for Measuring Security Drift in LLM-Driven Code Editing

WeSCE:用于测量大语言模型驱动的代码编辑中安全漂移的基准

Zhiyu Zhang, Tingyue Wen, Senke Sun, Dengxiang Liang, Enhao Huang

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 该研究推出WeSCE基准,针对仅指定功能目标的弱安全约束下的代码编辑,提出连续风险表示与漂移度量,以量化代码编辑中的安全漂移,为安全评估提供多尺度视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15046 2026-08-18 cs.LG 新提交 74%

Certifying Compressed Language Models: An Audit and a Statistical Toolkit

压缩语言模型的验证:审计与统计工具包

Amogh Singh

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :language model(title);分类 cs.LG

AI总结 本文针对压缩语言模型等价声明的证据不足问题,开展17项等价声明的预注册审计,提出配对等价测试的报告标准,发布相关输出与代码。

Comments 109 pages, 3 figures, 20 tables. Artifacts and per-item outputs: doi.org/10.5281/zenodo.21939143

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14855 2026-08-18 cs.CL 新提交 74%

What to Forget in Unlearning? Forget Set Curation for Language Models

模型遗忘中该遗忘什么?面向语言模型的遗忘集筛选

Animesh Jha, Arpandeep Khatua, Youssef Allouah, Sanmi Koyejo

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :language model(title);分类 cs.CL

AI总结 针对语言模型遗忘中遗忘集筛选缺失的问题,提出CleanSlate基准,发现不同遗忘集筛选器存在抑制效果弱或附带损伤的缺陷,表明遗忘集选择会影响遗忘效果与附带损伤。

Comments Presented at MemFM @ ICML 2026 and FoGen @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14763 2026-08-18 eess.IV cs.AI cs.CV cs.LG 新提交 73%

Cross-Modal Ultrasound-MRI Learning for Fetal Brain Ventricular Volumetry and Abnormality Screening

用于胎儿脑室体积测量与异常筛查的跨模态超声-MRI学习

Yuhao Huang, Yuanji Zhang, Yuhuan Lu, Dong Ni, P. Ellen Grant, Davood Karimi

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出跨模态学习框架VIFBA,基于超声视频实现胎儿脑室体积预测、VM严重程度分类及非VM异常筛查,性能优于基线与现有模型,为产前脑筛查提供实用方案。

Comments 17 pages, 11 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15286 2026-08-18 cs.LG cs.AI 新提交 73%

No Task Fails Every Time: Why One-Shot Audits Are Structurally Blind to Agent Damage

没有任务每次都失败:为什么单次审计在智能体损伤问题上存在结构性盲区

Shiven Khurdi

机构 * Northeastern University(东北大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究提出AgentRelBench工具,发现单次智能体审计易遗漏损伤对,模型能力提升会减少损伤任务,部分模型存在宣称弃权却执行不可逆操作的情况,且所有发现均按预注册标准执行。

Comments 25 pages, 4 figures, 16 tables, 6 appendices. Code, task suite, released per-run verdicts, and a one-command reproduction of every reported number: https://github.com/shivenkk/agentrelbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14999 2026-08-18 cs.CL cs.AI 新提交 73%

RamseyGadgets: A Graph Construction Dataset for LLMs

RamseyGadgets:面向大语言模型(LLMs)的图构造数据集

Zohair Raza Hassan, Deepak Pandita

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究提出新型图构造数据集RamseyGadgets,评估5个开源LLMs在其70个拉姆齐良图问题上的表现,发现LLMs在困难问题上准确率仅37.70%,Gemma-4-31B性能最优,还可用于确定提升LLMs表现的提示类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26329 2026-08-18 eess.AS cs.CL cs.LG cs.SD 73%

TAU: A Benchmark for Cultural Sound Understanding Beyond Semantics

Yi-Cheng Lin, Yu-Hua Chen, Jia-Kai Dong, Yueh-Hsuan Huang, Szu-Chi Chen, Yu-Chen Chen, Chih-Yao Chen, Yu-Jung Lin, Yu-Ling Chen, Zih-Yu Chen, I-Ning Tsai, Hsiu-Hsuan Wang, Ho-Lam Chung, Ke-Han Lu, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 5 pages; submitted to ICASSP 2026

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2026, pp. 15542-15546

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16039 2026-08-18 eess.IV cs.AI cs.CV 新提交 70%

Decoupling Parcellation from Classification: Systematic Benchmark of Fast Brain Segmentation Methods for Alzheimer's Disease Detection

将脑部分区与分类解耦:阿尔茨海默病检测的快速脑分割方法的系统基准测试

Jiadao Zou, Hongyu Guo, Wei Xi

专题命中 评测与基准 :foundation model(abstract);prompting(abstract);分类 cs.AI

AI总结 该研究将脑部分区与分类解耦,在OASIS-1数据集上对SynthSeg+等快速深度学习分区方法开展系统基准测试,评估多种体积策略与分类范式,以量化其对AD检测的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16577 2026-08-18 cs.CL 新提交 70%

BabelSteering: Multilingual Safety Alignment via English Steering Vectors

BabelSteering:通过英文引导向量实现多语言安全对齐

Emma V. Stein, Dominik Meier, Terry Ruas, Jan Philip Wahle, Bela Gipp

机构 * University of Göttingen(哥廷根大学) German State Police NRW(北莱茵-威斯特伐利亚州德国警察)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出BabelSteering激活引导方法,利用英语安全监督的拒绝方向实现多语言安全对齐,可提升多语言有害请求拒绝率且任务效用损失极小,还引入多语言翻译评估流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16513 2026-08-18 cs.CV cs.AI 新提交 70%

MLLM-Guided Semantic Correction for Text-to-Video Generation

基于多模态大语言模型(MLLM)的文本到视频生成语义修正

Junhao Chen, Zheqi Lv, Keting Yin, Shengyu Zhang, Zhou Zhao, Feiyang Chen, Xinyu Duan, Baoxing Huai, Fei Wu

机构 * Zhejiang University(浙江大学) Huawei Cloud Computing Technology Co., Ltd.(华为云计算技术有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出一种无需训练的MLLM引导文本到视频生成语义修正框架,通过两个关键模块在生成中修正语义偏差,提升了生成内容的语义对齐度等性能,经多基准实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16402 2026-08-18 cs.AI 新提交 70%

A Policy Algebra for Trust-Preserving Agentic AI Execution

用于信任保留的智能体AI执行的策略代数

Bhaskar Tripathi, Anurag Kumar, Ramendra Kumar, Bhavesh Gadhe

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种策略代数,用于定义智能体AI执行的可靠范围,可干预94.8%的策略违规事件,保留86.9%的任务完成率,为构建可靠智能体提供支持。

Comments 7 figures, 10 tables, and 5 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16394 2026-08-18 cs.AI cs.IR 新提交 70%

Think Inside the Chunk: RegulaRAG for Regulation-Compliant Scenario Generation using LLMs: A Case Study of UN Regulation No. 152

在块内思考:使用大语言模型生成符合法规的场景的RegulaRAG——以联合国第152号法规为例

Vahid Zolfaghari, Nenad Petrovic, AndrÉ Schamschurko, Alois Knoll

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLMs难以结合冗长分层标准的问题,提出RegulaRAG流水线,经实验其在UN R152数据集上元分数最高且鲁棒性强,优于基线系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16276 2026-08-18 cs.HC cs.CL 新提交 70%

PolyDebate: A Game-Orchestrated Multimodal System for Debate Skills Practice and Evaluation

PolyDebate:一种用于辩论技能练习与评估的游戏编排多模态系统

Jianing Yin, Weng Pan Kuan, Xiaoyun Liu, Zhiyuan Wen, Yuxuan Li, Milos Stojmenovic, Jiannong Cao

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 PolyDebate是一款游戏化多模态辩论练习评估系统,含Unity 3D游戏与网页版本,经四项研究验证,可结合AI对手、多模态评估与结构化反馈助力学习者提升辩论技能。

Comments 10 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16249 2026-08-18 cs.LG 新提交 70%

SAUL: Sharpness-Aware Augmented-Lagrangian Unlearning

SAUL:感知锐度的增广拉格朗日模型遗忘算法

Jaewan Choi, Junyoung Yang, Sangdon Park

机构 * POSTECH(浦项科技大学) Computer Science and Engineering, POSTECH(浦项科技大学计算机科学与工程学院) Graduate School of Artificial Intelligence, POSTECH(浦项科技大学人工智能研究生院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出SAUL算法,将模型遗忘建模为显式约束的受约束最小化问题,通过增广拉格朗日控制器等实现更优遗忘-效用权衡,即插即用修改器可提升基线模型遗忘后效用。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16187 2026-08-18 cs.CR cs.AI cs.SE 新提交 70%

Securing AI-Generated Code: A Just-in-Time Vulnerability Detection and Remediation Pipeline

保护AI生成代码:一种即时漏洞检测与修复流水线

Mikhail Surikov

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一种自动化安全评估流水线,可检测、修复AI生成代码的漏洞,在Claude的4种模型上评估发现,P2配置表现优于P1,Sonnet 4.6的修复效果最佳,且流水线有效性与初稿安全性不同。

Comments 7 pages, 8 tables, 2 figures. Georgia Institute of Technology Master's final practicum project. Code: https://github.com/Droidsurikov/securing-ai-generated-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16050 2026-08-18 cs.IR cs.DB cs.LG 新提交 70%

Structured Prediction for Scalable Spreadsheet Table Understanding: From Cell Types to Table Ranges (Extended Version)

面向可扩展电子表格表格理解的结构化预测:从单元格类型到表格范围(扩展版)

Antoine Gauquier, Ioana Manolescu, Pierre Senellart

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 该研究针对电子表格理解的单元格类型分类与表格检测任务,提出结合CRF-LightGBM的两阶段流水线,在公开基准StatSheets上实现了与先进模型相当的性能,且计算资源需求更低。

Comments Extended version of a paper published at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16011 2026-08-18 cs.CL cs.CV 新提交 70%

ReRef-3D: A Benchmark for Spatial Referring Expression-Guided 3D Scene Rearrangement

ReRef-3D:空间指代表达引导的3D场景重排基准

Mary Lynn Martin, Yifei Zhang, Martha Palmer, Maria Leonor Pacheco

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究提出ReRef-3D基准,针对3D场景语言引导放置任务,经微调的LLaVA-3D等模型在该基准上验证了关系满足度优于物理有效性等结论。

Comments 18 pages, 4 figures. Submitted to ACL Rolling Review (ARR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15888 2026-08-18 cs.AI cs.CR 新提交 70%

Bounded Agents: Delegation Security for Multi-Agent AI Systems

有界智能体:多智能体AI系统的委托安全

Xabier Muruaga

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对多智能体AI系统的委托安全问题,提出智能体委托链(APC)架构,经实验可有效阻止提示注入攻击,降低数据窃取、破坏及操纵风险,授权延迟低且效用损失可控。

Comments 14 pages, 4 figures, 18 tables. Code and data: https://github.com/xmuruaga/bounded-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15851 2026-08-18 cs.IR cs.CL 新提交 70%

Dense Expands, Sparse Anchors: Channel-Asymmetric Query Expansion for Hybrid Retrieval

密集扩展,稀疏锚点:用于混合检索的通道非对称查询扩展

Chunran Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究提出DESA通道非对称查询扩展方法,在7个BEIR数据集上提升检索指标,同时降低访问深度,为生成段落的通道特定整合及检索效果与访问深度的联合评估提供支撑。

Comments 13 pages, 4 figures. Code and artifacts: https://github.com/ln-one/dense-expands-sparse-anchors

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15579 2026-08-18 cs.SE cs.AI cs.ET cs.PL 新提交 70%

Kozuchi Agent: A Language-Agnostic Open-Weight Agent for Software Repair

Kozuchi智能体:一款与语言无关的开源权重软件修复智能体

Mehdi Bahrami, Kosaku Kimura, Satoshi Munakata, Satoshi Nakashima, Yu Ishikawa, Kosuke Maeda, Nao Soma, Kenichi Kobayashi, Keisuke Miyazaki, Keizo Kato, Shigeki Fukuta, Tatsuo Kumano, Nobutaka Imamura, Kevin Musgrave, Shahbaz Abdul Khader, Kwun Ho Ngan, Joe Townsend, Fayas Asharindavida, Matthieu Parizy, Akira Sakai, Yuma Ichikawa, Yang Zhao, Michiaki Takizawa, Taku Fukui, Hiroki Ohtsuji, Wei-Peng Chen, Hiromichi Kobashi

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Kozuchi智能体,一款与语言无关的开源权重软件修复智能体,结合CI评估流水线,在SWE-bench等基准上取得优异性能,降低操作接触点,为软件修复提供新方案。

Comments 13 pages, 4 figures. Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), Industry Showcase track, Munich, Germany, October 12-16, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15255 2026-08-18 cs.AI 新提交 70%

Towards Standardized Evaluation in Automated Domain Modeling: Introducing a Benchmark

面向自动化领域建模的标准化评估:引入一个基准

Vasiliy Seibert

机构 * Institute for Software and Systems Engineering, TU Clausthal(克劳斯塔尔工业大学软件与系统工程研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文针对自动化领域建模缺乏标准化基准的问题,引入整合两类数据集的基准,评估多种建模方法,为该领域研究提供可复用的研究成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14841 2026-08-18 cs.AI 新提交 70%

What the Reranker Sees: Multi-Aspect Page Annotation for Long-Document Multimodal Question Answering

重排序器所见:面向长文档多模态问答的多方面页面标注

Guanchen Wu, Jiayuan Ding, Subhabrata Mukherjee, Carl Yang

机构 * Emory University(埃默里大学) Hippocratic AI(希波克拉底人工智能公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文针对长文档多模态问答的重排序瓶颈,提出含Trident-R与Trident-S组件的Trident模型,通过多方面页面标注提升检索与生成性能,在多数据集上取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14718 2026-08-18 cs.CV cs.CL 新提交 70%

VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding

VideoGAIA:面向通用人工智能助手的智能体视频理解基准

Fan Zhang, Guangming Yao, Jinyang Wu, Hao Wu, Zheng Lian, Xinyu Geng, Jingdong Chen, Yi Yuan, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Tongji University(同济大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 VideoGAIA是面向通用AI助手的智能体视频理解基准,构建多轮工具增强交互任务,现有MLLMs在其上准确率不足60%,可评估下一代模型并推动相关转型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14655 2026-08-18 cs.LG cs.CV 新提交 70%

Diagnosing and Mitigating Perception-Decision Misalignment in Omni-LLMs via Modality Subspace Activation

通过模态子空间激活诊断并缓解全模态大语言模型(Omni-LLMs)中的感知-决策失配问题

Hongbo Jiang, Jie Li, Yunhang Shen, Tianyu Xie, Pingyang Dai

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对Omni-LLMs存在的感知-决策失配问题,本文提出因果模态敏感性及对应诊断方法,构建CausalMSBench数据集,提出无需训练的MSA框架以恢复模型的因果模态敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08601 2026-08-18 cs.AI cs.MA 版本更新 70%

Unaccountable Delegation, Fading Skills: Mapping the Risks of Workplace AI Agents

不可问责的授权与技能衰退:绘制职场AI智能体的风险图谱

Gabriele La Malfa, Lakmal Meegahapola, Edyta Bogucka, Jie M. Zhang, Michael Luck, Elizabeth Black, Daniele Quercia

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究开发了AI智能体多层框架,基于2078项工作任务生成风险场景并验证,扩展出15类职场AI风险分类法,揭示了不同部署模式的风险差异,为职场AI风险管控提供了分类工具与依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21862 2026-08-18 cs.RO cs.AI 版本更新 70%

EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control

EvoScene-VLA: 在动作解码器中进化场景信念用于分块机器人控制

Chushan Zhang, Ruihan Lu, Jinguang Tong, Xuesong Li, Yikai Wang, Hongdong Li

机构 * Australian National University(澳大利亚国立大学) The University of Queensland(昆士兰大学) Beijing Normal University(北京师范大学)

专题命中 评测与基准 :language model(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出EvoScene-VLA,通过在动作解码器中维护更新的场景状态,改进分块机器人控制中的多步控制预测,提升了场景信念的持续性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13964 2026-08-18 cs.CL 版本更新 70%

HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam

HLE-Verified: 人类最后考试的系统验证与结构化修订

Weiqi Zhai, Zhihai Wang, Jinghang Wang, Boyu Yang, Xiaogang Li, Xander Xu, Bohan Wang, Peng Wang, Xingzhe Wu, Anfeng Li, Qiyuan Feng, Yuhao Zhou, Taolin Han, Wenjie Luo, Yiyuan Li, Xiang Zheng, Yaxuan Wang, Ruixiang Luo, Guojie Lin, Peiyao Xiao, Chengliang Xu, Ben Wang, Zeyu Wang, Zichao Chen, Jianan Ye, Yijie Hu, Jialong Chen, Zongwen Shen, Yuliang Xu, An Yang, Bowen Yu, Dayiheng Liu, Junyang Lin, Hu Wei, Que Shen, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 HLE-Verified通过系统验证和结构化修订,减少噪声并提高模型评估的准确性。

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14757 2026-08-18 eess.IV cs.CV q-bio.QM 新提交 67%

KHiM-Mamba: Injecting Pathology Knowledge into Mamba via Hidden-State Modulation for Whole Slide Image Analysis

KHiM-Mamba:通过隐藏状态调制将病理知识注入Mamba以用于 whole slide image(WSI)分析

Qixiang Zhang, Yi Li, Tianqi Xiang, Haonan Wang, Mengjiao Wei, Bo Xu, Xiaomeng Li

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究提出KHiM-Mamba架构,通过将病理知识注入Mamba的选择性状态空间机制,解决纯视觉驱动的WSI分析问题,在4类任务的11个公共基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16690 2026-08-18 cs.CV 新提交 67%

AnchorScore: A CLIP-Based Diagnostic of MLLM Annotation Difficulty

AnchorScore:一种基于CLIP的多模态大语言模型(MLLM)标注难度诊断方法

Yan Ma, Lizhuo Zhang

机构 * School of Foreign Studies, Changsha University of Science and Technology(长沙理工大学外国语学院) School of Education, Hunan Agricultural University(湖南农业大学教育学院) School of Information and Intelligence, Hunan Agricultural University(湖南农业大学信息与智能科学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出基于CLIP的AnchorScore,可低成本预先对类别按MLLM标注难度排名,在课堂行为、动作识别等数据上与MLLM准确率相关性高,可用于混合路由、提示消歧等场景。

Comments 37 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏