arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 3048 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 3048 篇

2608.25490 2026-08-27 cs.CR cs.AI cs.MM 新提交 70%

MMJailBench: A Factorized Benchmark for Disentangling Multimodal Jailbreak Vulnerabilities

MMJailBench:用于解耦多模态越狱漏洞的因子化基准

Tianshi Wang, Jingsong Wang, Yafei Huang, Fengling Li, Xin Li, Lei Zhu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究人员推出MMJailBench因子化基准,对16个MLLMs评估后揭示其越狱漏洞特征异质且依赖模型,明确提示框架等关键影响因素,开发出模块化多模态越狱评估套件用于高效审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25466 2026-08-27 cs.NE cs.AI 新提交 70%

Homo-RAG: Homology-Guided Retrieval-Augmented Generation for Cross-Species Gene Function Prediction

Homo-RAG:基于同源性引导检索增强生成的跨物种基因功能预测

Azrin Sultana

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出Homo-RAG框架,整合同源性引导多跳检索与证据感知排序,实现跨物种基因功能预测,在150个查询及7200份文档的评估中表现优异,为未充分研究生物的基因功能注释提供了实用方案。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25398 2026-08-27 cs.CL 新提交 70%

OmniPhys: A Unified Multimodal Benchmark for Physics Understanding and Generation from Chinese Educational Corpora

OmniPhys:面向中文教育语料库的物理理解与生成统一多模态基准

Hao Chen, Yumin Lin, Nadila Yushanjiang, Xin Lin, Min Zhang

机构 * East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究人员推出OmniPhys这一覆盖中文教育语料库中中学至大学物理问题的大规模多模态基准,含15246个问题与19850张图像,可评估MLLMs的物理理解、推理及结构化图表生成能力,发现当前模型存在复杂推理与视觉生成差距,将推进物理领域多模态智能发展。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24903 2026-08-27 cs.HC cs.LG 新提交 70%

Evidence-Grounded Mapping of Multimodal Human Sensing Psychological Transdiagnostic Dimensions

基于证据的多模态人体感知心理跨诊断维度映射

Xiyun Hu, Xiangyuan Xue, Yuting Lyu, Hanya Shao, Jingping Nie

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出临床医生参与的基准,评估LLMs能否从多模态证据生成B-HiTOP条目画像,发现两阶段预测可提升部分证据的兼容性,但语义抽象会成为间接行为传感的信息瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25097 2026-08-27 cs.AI cs.MM math-ph math.MP 新提交 70%

PhysElite: How Far Are LLMs from Solving Olympiad-Level Physics Problems?

PhysElite:大型语言模型在解决奥林匹克级物理问题上的表现差距有多大?

Ruoran Xu, Wending Gao, Liyunfeng Chen, Aixin Shi, Haoyu Cheng, Zixiang Fang, Yiqiang Zou, Qiufeng Wang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PhysElite基准,含11586道奥林匹克级物理题及配套资源,测试18款MLLM发现最强者准确率仅33.7%,还开展分步流程评估诊断推理失败环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23906 2026-08-26 cs.AI 新提交 70%

Quantifying System-Level Harms from AI Adoption in Complex Sociotechnical Systems

量化复杂社会技术系统中采用AI带来的系统层面危害

Paul Vautravers, Oliver Chalkley, Gabriel Downer, Kate S, Damian Ruck

机构 * Advai Ltd(Advai有限公司) UK National Cyber Security Centre(英国国家网络安全中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出结合STPA等的框架,以RTGS为案例量化复杂社会技术系统中AI的系统层面危害,发现AI采用会降低金融系统韧性、增加银行倒闭风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23763 2026-08-26 cs.CR cs.AI 新提交 70%

TrustShiftProbe: Characterizing, Benchmarking, and Defending Staged Trust Attacks on MCP Servers

TrustShiftProbe:对MCP服务器上的阶段性信任攻击进行表征、基准测试与防御

Mehrdad Rostamzadeh, Sidhant Narula, Mohammad Ghasemigol, Daniel Takabi

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对MCP服务器的阶段性信任攻击提出TrustShiftProbe框架,建立威胁模型、攻击引擎与防御机制SHIELD,使攻击成功率从69.5%降至42.7%

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23740 2026-08-26 cs.AI cs.SE 新提交 70%

AgentRoom: Concurrent Multi-Agent Coding in a CRDT-Backed Shared Workspace

AgentRoom:基于CRDT支持的共享工作空间的并发多智能体编码

Seonglae Cho, Donghyun Lee

机构 * Holistic AI(整体人工智能公司) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 AgentRoom是基于CRDT的并发多智能体编码协议,通过协调机制减少任务放弃率,在计算量匹配下优于单独运行和并行合并,为多智能体编码提供更优方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23627 2026-08-26 cs.CL 新提交 70%

From Triage to Discharge: A Survey of NLP Tasks, Methods, and Open Challenges in the Emergency Department

从分诊到出院:急诊部门NLP任务、方法与开放挑战综述

Dipankar Srirag, Aditya Joshi, Salil Kanhere, Padmanesan Narasimhan

机构 * University of New South Wales(新南威尔士大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本综述分析46篇论文,梳理急诊部门分诊、诊断、处置阶段的NLP任务与方法,指出模型从特定架构向预训练语言模型转变等趋势,明确泛化能力有限等开放挑战,为相关研究提供方向。

Comments Accepted to the EMNLP 2026 Main Conference; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23619 2026-08-26 cs.SE cs.AI 新提交 70%

Identifying Latent Declarative Representations of Code for Assisting Repository Migration

识别代码的隐式声明式表示以辅助代码仓库迁移

Shraddha Surana, Ashwin Srinivasan, Michael Bain

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对遗留代码仓库迁移难题,提出 ADFD-Migrate 方法,通过显式化代码的隐式声明式表示提升移植效果,在新基准 f2x50 上取得优于对比方法的移植正确性与完整性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22808 2026-08-25 cs.LG cs.MA cs.PF 新提交 70%

CatchBench: When Can an Agent Failure Be Caught?

CatchBench:智能体故障何时能被检测?

Yue Zhao

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 CatchBench是首个在同一任务-方法接口下对智能体运行前、运行中、完成后三种信息状态进行评分的基准,涵盖多类模型与配置,揭示基准分数需结合标签过程才可解释。

Comments 39 pages, 6 figures, 21 tables. Work in progress. Code and data: https://github.com/yzhao062/catchbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22618 2026-08-25 cs.LG 新提交 70%

KMGen: A Skill-based Approach for Synthetic Individual Patient Data Generation

KMGen:一种基于技能的合成个体患者数据生成方法

Jalen Jiang, Chufan Gao, Ethan Rasmussen, Stephen Z. Xie, Jimeng Sun

机构 * Mayo Clinic Alix School of Medicine(梅奥诊所阿利克斯医学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 KMGen是首个端到端框架,可全自动提取KM曲线并生成合成患者不良事件轨迹,在多肿瘤试验中精度达标,相关流水线已开源。

Journal ref Proceedings of Machine Learning Research 340 (2026) 1-60

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22527 2026-08-25 cs.LG 新提交 70%

Stress Testing Unlearning Algorithms

对遗忘算法进行压力测试

Noam Diamant, Ethan Fetaya, Neta Glazer

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对现有大型语言模型遗忘基准的缺陷,提出扩展WMDP的WMDP++基准,以针对性提取遗忘信息和评估边界问题性能,实现对遗忘算法更严格的压力测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22438 2026-08-25 cs.AI cs.CY 新提交 70%

When Persona Simulations Are Informative: Graph-Structured Signals for Pluralistic Opinion Sensing

当角色模拟具有信息性时:用于多元意见感知的图结构化信号

Taehyeon An, Jaehyeong Park, Donghyuk Shin

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出角色条件化信息性(PCI)指标,通过将角色建模为相似度图并利用Local Moran's I量化一致性,筛选合成受访者,在PVQ-RR数据集上验证其能提升潜在价值观结构的恢复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22425 2026-08-25 cs.HC cs.CL cs.CY 新提交 70%

All four leading LLMs talk more than they listen to personality-verified synthetic help-seekers

四大领先的大语言模型在与经人格验证的合成求助者交流时,说得多听得少

Pablo A. Fonseca, Raquel Rodríguez-Carvajal, Rafael A. Calvo

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究构建人格感知评估,发现四大领先大语言模型在为合成求助者提供危机建议时,存在说多听少、未充分探索情况就解决问题的共性,且评估覆盖了大五人格外的心理倾向。

Comments 30 pages, 6 figures, 24 tables. Data and code: https://doi.org/10.82186/9aajj-vq030

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22081 2026-08-25 cs.SE cs.CL cs.IR 新提交 70%

W-RAG: Source-Aware Retrieval for Enterprise Document Generation from Heterogeneous Knowledge Bases

W-RAG:面向异构知识库的企业文档生成的源感知检索方法

Hridya Dhulipala, Rajesh Ombase, Michael Wang, Tien N. Nguyen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对异构知识库下企业文档生成中全局排序导致的上下文失衡问题,提出源感知检索框架W-RAG,引入相关数据集并验证其可提升文档覆盖率与生成质量。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21853 2026-08-25 cs.CL 新提交 70%

PUMA: A Polish Benchmark for Culturally Grounded Multimodal Understanding

PUMA:面向文化扎根多模态理解的波兰基准测试

Sławomir Dadas, Michał Perełkiewicz, Rafał Poświata, Małgorzata Grębowiec, Bartłomiej Jaworski, Izabela Woźniakowska

机构 * National Information Processing Institute(国家信息处理研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对英语外文化多模态评估不足的问题,提出波兰多模态基准PUMA,通过900项任务评估各类模型在波兰语境下的多模态能力,发现商用模型在视觉问答表现好但音频/文档理解弱,并开源评估框架推进本地化多模态AI研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21606 2026-08-25 cs.CL 新提交 70%

Can LLMs Truly Forget? Revealing Unlearning Gaps Through Adversarial Evaluation

大语言模型(LLMs)真的能遗忘吗?通过对抗性评估揭示遗忘差距

Ayush Gupta, Hima Varshini Surisetty, Sreevidya Bollineni, Varad Ingale, Tuhina Tripathi, Abhishek Lalwani, Somya Chatterjee, Sadid Hasan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Microsoft Corporation(微软公司)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL

AI总结 本研究针对TOFU数据集和Llama-3.2-3B-Instruct模型,引入ASR指标评估遗忘方法,发现标准指标表现优异的遗忘方法仍存在高对抗恢复风险,提出需补充对抗性压力测试作为遗忘评估的必要部分。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21543 2026-08-25 cs.CV cs.AI 新提交 70%

presto: Efficient, Training-free, and Open-world Object Placement via Imaginary Search

presto:基于想象搜索的高效无训练开放世界物体放置方法

Weixuan Ding, Shang Liu, Hanyu Pei, Zeyan Liu

机构 * Wuhan University(武汉大学) University of Louisville(路易斯维尔大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出零样本无训练框架presto,将开放世界物体放置转化为MLLM引导的启发式搜索任务,经多基准实验及人类研究验证,其在开放世界场景中性能最优,且MLLM作为评判者的变体更具感知一致性。

Comments Accepted to ICONIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21503 2026-08-25 cs.SE cs.CR cs.LG 新提交 70%

BeTaL-GBI: Admission-Aware Benchmark Tuning and Full-Stack Verification of Geometric Belief Interfaces

BeTaL-GBI:几何置信接口的准入感知基准调优与全栈验证

Alvin Spivey, Yu Huang

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本研究提出 BeTaL-GBI 等改进方案,验证几何置信接口的架构断言,优化基准调优与见证机制,提升验证底层的可信度与审计能力。

Comments 30 pages, Geometric Belief Interface, Decentralized Cryptographic Sheaf-Enclave, GBI, DCSE, GBI-DCSE, BoundaryBench v0.1, BeTaL-GBI v0.2, GBI v2, GBI-DCSE v3

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21379 2026-08-25 cs.AI cs.HC 新提交 70%

RIACT: A Responsible AI System for Personalized Study Habit Tracking and Early Burnout Signal Detection in University Students

RIACT:面向大学生的负责任AI系统,用于个性化学习习惯追踪与早期倦怠信号检测

Ria Sidhu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出负责任AI系统RIACT,结合结构化学习记录与混合AI架构,为大学生检测早期倦怠信号并生成个性化学习建议,嵌入可审计规则等负责任AI原则,还提出了倦怠信号评估框架。

Comments 11 pages. Also available on EdArXiv: https://doi.org/10.35542/osf.io/94hr5_v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21249 2026-08-24 cs.CL 新提交 70%

Benchmarking Patent Drafting from Inventor-Style Disclosures

从发明人风格的披露文件进行专利撰写的基准测试

Lekang Jiang, Wenjun Sun, Stephan Goetz

机构 * University of Cambridge(剑桥大学) Chinese Academy of Sciences(中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究针对从发明人风格披露文件生成专利申请的现实需求,构建了Dis2Pat数据集,并提出可本地部署的多智能体框架Patent-MAF,实验表明该框架在专利撰写任务上表现优于多数开源模型且可与闭源模型竞争。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21140 2026-08-24 cs.CV cs.AI 新提交 70%

A Modular Agent for Reliable and Auditable Spatial Relation Verification in CT Scans

用于CT扫描中可靠且可审计的空间关系验证的模块化智能体

Simon Vincent Abel, Heiko Hillenhagen, Michael Götz, Timo Ropinski, Ayhan Can Erdur, Daniel Santak Wolf

机构 * Ulm University(乌尔姆大学) Ulm University Hospital(乌尔姆大学医院) Technical University of Munich (TUM)(慕尼黑工业大学(TUM)) TUM University Hospital(慕尼黑工业大学医院) Department of Radiation Oncology, TUM University Hospital(慕尼黑工业大学医院放射肿瘤科)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 针对医学视觉-语言模型空间推理薄弱的问题,提出模块化医学影像智能体,通过分阶段处理实现CT扫描空间关系验证,性能优于端到端基线,可作为未来医学影像智能体的构建块。

Journal ref Published at the MICCAI 2026 Agentic AI for Medicine Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21087 2026-08-24 cs.CL 新提交 70%

Jokes Aside: Measuring the Semantic Distance of Double Meanings

玩笑之外:测量双重含义的语义距离

Fabio De Ponte

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究基于词嵌入重新审视现有幽默指标并引入对称性指标,在三个数据集上验证后发现,基于这些指标训练的模型预测幽默评分表现不佳,但对称性指标与高分笑话相关。

Comments The paper was submitted to ISHS (International Society for Humor Studies) conference held in Kraków, Poland on 7-11 July 2025. It was awarded the GSA AWARD and was presented during a special plenary session (see the section Graduate Student Awards, 2006-2025 of the webpage https://www.humorstudies.org/ConferCenter.htm)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20984 2026-08-24 cs.CV cs.CL cs.CY 新提交 70%

MigrationNarrate: A Dataset for Detection of Migration Narratives in YouTube Videos

MigrationNarrate:用于检测YouTube视频中移民叙事的数据集

Fatima Haouari, Carolina Scarton, Kalina Bontcheva

机构 * University of Sheffield(谢菲尔德大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究推出首个用于检测英国移民叙事的多模态数据集MigrationNarrate,包含1115个YouTube视频字幕,结合预训练编码器与大语言模型开展基准测试,为移民叙事检测研究提供关键资源。

Comments This work was accepted to the main conference of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20786 2026-08-24 cs.AI cs.IR 新提交 70%

Structure for Reading, Prose for Writing: Asymmetric Structural Conditioning in Multi-Agent Document Authoring

阅读用结构,写作用散文:多智能体文档创作中的非对称结构条件作用

Cheng Yu, Nikhil Mathew, Zhengjie Wang

机构 * ML Research Labs(ML研究实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对多智能体文档创作系统,发现结构条件作用存在不对称性,结构利于阅读但不利于写作,还揭示了信息可用性对系统性能的关键影响。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20614 2026-08-24 cs.AI 新提交 70%

Evaluating Skills, Not Just Agents: Agentic Continuous Evaluation of Skills

评估技能,而非仅评估智能体:智能体驱动的技能持续评估

Christopher Kevin, Narendran Raghavan, Jean-Francois Puget, Roshni Malani, Meghana Puvvadi, Moshe Abramovitch, Mohit Gupta, Rama Akkiraju, Subodh Prabhu, Yogesh Dangi, Wei Luo, Seong Hee Lee

机构 * NVIDIA(英伟达)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出ACES框架,通过配对实际 trials等方式评估技能附加价值,实验表明其能发现扫描式审核无法观测的信号,开源实现已在NVIDIA SkillEvaluator中提供。

Comments 15 pages. Extended preprint incorporating versions accepted at Agent Skills '26 (ACM CAIS 2026) and the KDD 2026 Workshop on Enterprise AI Agents: From Prototypes to Production (oral presentation). Open-source implementation: https://github.com/NVIDIA/SkillEvaluator

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20485 2026-08-24 cs.AI cs.SE 新提交 70%

Terminal Agents: A Survey of AI Agents in Command-Line Environments

终端智能体:命令行环境下的AI智能体综述

Yi Bin, Xiaoyang Yuan, Haoxi Zeng, Wencheng Ye, Wenqi Shao, Chen Qian, Wei Ye, Yujuan Ding, Zheng Wang, Pengpeng Zeng, Jingkuan Song, Heng Tao Shen

机构 * Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学) Tongji University(同济大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文将终端智能体定义为行动-观察循环由终端介导的系统,通过七维轮廓关联架构等模块,揭示其行为影响因素与评估不均衡问题,为相关研究提供统一框架。

Comments 52 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20024 2026-08-21 cs.LG 新提交 70%

Systematic Evaluation of TabPFN-TS for Zero-Shot Probabilistic Heat Load Forecasting in District Heating Networks

系统评估TabPFN-TS在区域供热网络零样本概率热负荷预测中的应用

Ben Spoek, Karim K. Ben Hicham, Kai Derzsi, Philipp Althaus, Alexander Mitsos, Dirk Müller

机构 * RWTH Aachen University(亚琛工业大学) Process Systems Engineering(过程系统工程) Chair of Energy Efficient Buildings Indoor Climate(节能建筑室内气候主席席位)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本研究系统评估TabPFN-TS用于区域供热网络零样本概率热负荷预测,确定了最优配置,其性能接近Chronos-2且校准更好,相关发现推动了多分辨率残差校正预测器的开发。

Comments 33 pages, 10 figures; supplementary information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19901 2026-08-21 cs.CR cs.AI 新提交 70%

MaliciousSkillBench: A Comprehensive Benchmark for Malicious Agent Skill Detection

MaliciousSkillBench:用于恶意智能体技能检测的综合基准

Yue Wang, Yi Liu, Gelei Deng, Ying Zhang, Yuekang Li, Zhenyu Chen, Leo Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出MaliciousSkillBench这一综合基准,整合多源恶意技能数据构建含9740个技能的数据集,评估三类检测器后发现现有方法不足,需更广泛跨源覆盖及联合评估攻击检测与良性误报的方案。

Comments Project page: https://protectskills.github.io/MaliciousSkillBench/

详情

展开后加载摘要…

URL PDF HTML 收藏