arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-25 至 2025-12-25 共收录 19 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 19 篇

2507.01020 2025-12-25 cs.CR cs.LG 92%

AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models

AutoAdv:多轮对抗性提示生成用于大型语言模型的多轮 Jailbreaking 攻击

Aashray Reddy, Andrew Zagula, Nicholas Saban

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title);LLM(abstract)

AI总结 AutoAdv 提出了一种自动化多轮对抗性提示生成方法,通过策略性重写和优化配置,实现对大型语言模型的安全机制的高效攻击,揭示了其在有害内容生成上的高成功率。

Comments We encountered issues with the paper being hosted under my personal account, so we republished it under a different account associated with a university email, which makes updates and management easier. As a result, this version is a duplicate of arXiv:2511.02376

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21010 2025-12-25 cs.LG cs.AI cs.PF 86%

LLM Swiss Round: Aggregating Multi-Benchmark Performance via Competitive Swiss-System Dynamics

LLM瑞士轮:通过竞争瑞士系统动态聚合多基准性能

Jiashuo Liu, Jiayun Wu, Chunjie Wu, Jingkai Liu, Zaiyuan Wang, Huan Zhou, Wenhao Huang, Hongseok Namkoong

机构 * Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CSD框架,通过竞争瑞士系统动态聚合多基准性能,提升LLM评估的准确性和风险意识。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21236 2025-12-25 cs.CR cs.AI cs.SE 85%

Casting a SPELL: Sentence Pairing Exploration for LLM Limitation-breaking

为LLM突破限制而探索句子配对:恶意代码生成的测试框架

Yifan Huang, Xiaojun Jia, Wenbo Guo, Yuqiang Sun, Yihao Huang, Chong Wang, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SPELL框架通过智能句子配对探索LLM在恶意代码生成中的安全漏洞,有效提升对抗测试效果。

Comments Accepted to FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21127 2025-12-25 cs.AI 85%

A Real-World Evaluation of LLM Medication Safety Reviews in NHS Primary Care

对NHS初级医疗中基于LLM的药物安全审查系统的真实世界评估

Oliver Normand, Esther Borsi, Mitch Fruin, Lauren E Walker, Jamie Heagerty, Chris C. Holmes, Anthony J Avery, Iain E Buchan, Harry Coppock

机构 * i.AI, Department for Science, Innovation, and Technology(i.AI,科学、创新与技术部门) Centre for Experimental Therapeutics, University of Liverpool(实验治疗中心,利物浦大学) Civic Health Innovation Labs, University of Liverpool(公民健康创新实验室,利物浦大学) Downing Street(唐宁街10号) Department of Statistics, University of Oxford(统计系,牛津大学) Ellison Institute of Technology(埃利森技术研究所) Centre for Academic Primary Care, University of Nottingham(学术初级护理中心,诺丁汉大学) The UK AI Security Institute(英国人工智能安全研究所) Department of Computing, Imperial College London(计算系,伦敦帝国学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估了基于LLM的药物安全审查系统在真实临床数据中的表现,揭示了其在不同复杂性下的失败模式,强调了上下文推理的重要性及改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11822 2025-12-25 cs.AI 85%

Beyond Consensus: Mitigating the Agreeableness Bias in LLM Judge Evaluations

超越共识:在LLM评估中缓解顺从偏差

Suryaansh Jain, Umair Z. Ahmed, Shubham Sahai, Ben Leong

机构 * University of Massachusetts at Amherst(马萨诸塞大学阿默斯特分校) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于回归的框架,通过少量人工标注数据建模验证者偏差,有效缓解LLM评估中的顺从偏差问题,并在代码反馈任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20630 2025-12-25 cs.AI 83%

MicroProbe: Efficient Reliability Assessment for Foundation Models with Minimal Data

MicroProbe: 用极少数据高效评估基础模型的可靠性

Aayam Bansal, Ishaan Gangwani

机构 * Aayam Bansal(未知) Ishaan Gangwani(未知)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract);分类 cs.AI

AI总结 MicroProbe通过仅使用100个精心选择的示例,高效评估基础模型可靠性,比随机采样方法提升23.5%的综合分数,显著降低评估成本并保持高覆盖率。

Comments ICML NewInML

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21126 2025-12-25 cs.CV cs.DB 82%

MarineEval: Assessing the Marine Intelligence of Vision-Language Models

MarineEval: 评估视觉-语言模型的海洋智能

YuK-Kwan Wong, Tuan-An To, Jipeng Zhang, Ziqiang Zheng, Sai-Kit Yeung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract)

AI总结 MarineEval首次构建大规模海洋VLM数据集和基准,评估现有VLM在回答海洋领域问题上的能力与局限性。

Comments Accepted by The IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20948 2025-12-25 cs.CL cs.SD 79%

Foundation Model-based Evaluation of Neuropsychiatric Disorders: A Lifespan-Inclusive, Multi-Modal, and Multi-Lingual Study

基于基础模型的神经精神障碍评估:一项涵盖全生命周期、多模态和多语言的研究

Zhongren Dong, Haotian Guo, Weixiang Xu, Huan Zhao, Zixing Zhang

机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) Shenzhen Research Institute, Hunan University(湖南大学深圳研究院) Ministry of Education Key Laboratory of Fusion Computing of Supercomputing and Artificial Intelligence, Hunan University(湖南大学教育部长春计算机与人工智能融合计算重点实验室)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL

AI总结 FEND提出一种多模态框架,利用多语言数据集评估神经精神障碍,揭示多模态融合在不同障碍检测中的性能差异及影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21337 2025-12-25 cs.CV 78%

Beyond Memorization: A Multi-Modal Ordinal Regression Benchmark to Expose Popularity Bias in Vision-Language Models

超越记忆:一个多模态序回归基准以揭示视觉-语言模型中的流行偏差

Li-Zhong Szu-Tu, Ting-Lin Wu, Chia-Jui Chang, He Syu, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University

专题命中 评测与基准 :language model(title,abstract)

AI总结 本研究提出一个多模态序回归基准,揭示视觉-语言模型在流行度上的偏差,通过YearGuessr数据集验证模型在记忆化与未识别对象上的表现差异。

Comments Project page: https://sytwu.github.io/BeyondMemo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20735 2025-12-25 cs.CV 78%

VL4Gaze: Unleashing Vision-Language Models for Gaze Following

VL4Gaze:释放视觉-语言模型用于追随目光

Shijing Wang, Chaoqun Cui, Yaping Huang, Hyung Jin Chang, Yihua Cheng

机构 * Beijing Jiaotong University(北京交通大学) MAIS, Institute of Automation, Chinese Academy of Sciences(MAIS,自动化研究所,中国科学院) University of Birmingham(伯明翰大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 VL4Gaze通过四个互补任务统一目光理解为VQA问题,系统评估VLMs在目光解读上的表现,揭示了针对性多任务监督对提升VLMs目光理解能力的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19027 2025-12-25 cs.SE 75%

SESR-Eval: Dataset for Evaluating LLMs in the Title-Abstract Screening of Systematic Reviews

SESR-Eval:用于评估LLM在系统综述标题-摘要筛选中的基准数据集

Aleksi Huotala, Miikka Kuutila, Mika Mäntylä

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SESR-Eval数据集用于评估LLM在系统综述标题-摘要筛选中的性能,结果显示LLM在不同二次研究间表现差异大,目前不推荐自动化筛选。

Comments An updated post-print on the paper published in the Proceedings of the 19th ACM/IEEE International Symposium on Empirical Software Engineering and Measurement (ESEM '25). 12 pages (10 + 2 pages for references)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18748 2025-12-25 cs.SE cs.AI cs.CL 73%

Code2Doc: A Quality-First Curated Dataset for Code Documentation

Code2Doc: 一种以质量为导向的代码文档定制数据集

Recep Kaan Karaman, Meftun Akarsu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Code2Doc是一个高质量的代码文档生成数据集,通过四阶段定制流程筛选出13,358对高质量函数-文档对,显著提升了代码文档生成模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20938 2025-12-25 cs.HC 67%

Pioneering Multimodal Emotion Recognition in the Era of Large Models: From Closed Sets to Open Vocabularies

开创性多模态情感识别在大模型时代的探索:从封闭集到开放词汇

Jing Han, Zhiqiang Gao, Shihao Gao, Jialing Liu, Hongyu Chen, Zixing Zhang, Björn W. Schuller

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文首次系统评估了多模态大语言模型在开放词汇情感识别中的表现,发现两阶段三模态融合方法效果最佳,视频模态最为关键,同时揭示开放与封闭源LLM性能差距较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20781 2025-12-25 cs.IR 67%

Soft Filtering: Guiding Zero-shot Composed Image Retrieval with Prescriptive and Proscriptive Constraints

软过滤:通过规劝性与禁止性约束指导零样本复合图像检索

Youjin Jung, Seongwoo Cho, Hyun-seok Min, Sungchul Choi

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出SoFT方法,通过规劝性和禁止性约束提升零样本复合图像检索的准确性与鲁棒性。

Comments Accepted to AAAI 2026 Workshop on New Frontiers in Information Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19883 2025-12-25 cs.SE 67%

Larger Is Not Always Better: Leveraging Structured Code Diffs for Comment Inconsistency Detection

更大并不总是更好:利用结构化代码差异进行注释不一致检测

Phong Nguyen, Anh M. T. Bui, Phuong T. Nguyen

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出基于CodeT5+的即时CCI检测方法,通过分解代码修改活动序列以更准确捕捉代码与过时注释之间的相关性,提升检测性能。

Comments This paper has been reviewed and accepted to the Short Papers and Posters Track of SANER 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21221 2025-12-25 cs.CV cs.AI 57%

Leveraging Lightweight Entity Extraction for Scalable Event-Based Image Retrieval

利用轻量级实体提取实现可扩展的基于事件的图像检索

Dao Sy Duy Minh, Huynh Trung Kiet, Nguyen Lam Phu Quy, Phu-Hoa Pham, Tran Chi Nguyen

机构 * University of Science - VNUHCM(越南胡志明市科学大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出一种轻量级两阶段检索流程,利用事件中心实体提取结合BM25和BEiT-3模型,实现高效准确的图像检索。

Comments System description paper for EVENTA Grand Challenge Track 2 at ACM Multimedia 2025 (MM '25). Ranked 4th place. 6 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20823 2025-12-25 cs.AR cs.AI 57%

NotSoTiny: A Large, Living Benchmark for RTL Code Generation

NotSoTiny: 一个大规模、活体的RTL代码生成基准

Razine Moundir Ghorab, Emanuele Parisi, Cristian Gutierrez, Miquel Alberti-Binimelis, Miquel Moreto, Dario Garcia-Gasulla, Gokcen Kestor

机构 * Barcelona Supercomputing Center(巴塞罗那超级计算中心) Universitat Politecnica de Catalunya(加泰罗尼亚理工大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 NotSoTiny是一个大规模、活体的RTL代码生成基准,通过评估LLM生成结构丰富且具有上下文意识的RTL代码的能力,以克服当前LLM在硬件设计中的限制并推动技术发展。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12830 2025-12-25 cs.CY cs.AI 57%

Gobernanza y trazabilidad "a prueba de AI Act" para casos de uso legales: un marco técnico-jurídico, métricas forenses y evidencias auditables

AI Act合规的法律用例治理与可追溯性:技术-法律框架、司法计量学与可审计证据

Alex Dantart

机构 * Humanizing Internet

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出一个开源框架rag-forense,用于确保AI系统在法律领域符合欧盟AI法案的可验证合规性。

Comments in Spanish and English languages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01907 2025-12-25 cs.CV cs.CL 57%

RSCC: A Large-Scale Remote Sensing Change Caption Dataset for Disaster Events

RSCC:一种大规模遥感变化描述数据集用于灾害事件

Zhenyuan Chen, Chenxi Wang, Ningyu Zhang, Feng Zhang

机构 * School of Earth Sciences, Zhejiang University(浙江大学地球科学学院) School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang Provincial Key Laboratory of Geographic Information Science(浙江省地理信息科学重点实验室) Key Laboratory of Spatio-temporal Information and Intelligent Services (LSIIS), Ministry of Natural Resources of the People’s Republic of China(国家自然资源部空间时空信息与智能服务重点实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 RSCC数据集通过提供大规模遥感图像对和详细变化描述,提升视觉-语言模型在灾害事件双时间理解中的性能和应用能力。

Comments Accepted by NeurIPS 2025 Dataset and Benchmark Track

详情

展开后加载摘要…

URL PDF HTML 收藏