arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-18 至 2025-12-18 共收录 28 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 28 篇

2512.15033 2025-12-18 cs.AI 88%

Beyond Accuracy: A Geometric Stability Analysis of Large Language Models in Chess Evaluation

超越准确性:大型语言模型在国际象棋评估中的几何稳定性分析

Xidan Song, Weiqi Wang, Ruifeng Cao, Qingya Hu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出几何稳定性框架,用于评估大型语言模型在国际象棋评估中的几何推理能力,揭示了模型在几何变换下的稳定性差异及性能悖论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13857 2025-12-18 cs.AI cs.CL cs.LG cs.MA cs.NE 87%

EvoLattice: Persistent Internal-Population Evolution through Multi-Alternative Quality-Diversity Graph Representations for LLM-Guided Program Discovery

EvoLattice: 通过多替代质量-多样性图表示实现持久内部种群进化以指导LLM引导的程序发现

Kamer Ali Yuksel

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 EvoLattice通过多替代质量-多样性图表示实现持久内部种群进化,提升LLM引导程序发现的稳定性、表达力和改进轨迹

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15617 2025-12-18 cs.CL cs.AI 86%

Evaluating Metrics for Safety with LLM-as-Judges

用LLM作为裁判评估安全度的指标

Kester Clegg, Richard Hawkins, Ibrahim Habli, Tom Lawton

机构 * Centre for Assuring Autonomy, University of York(自主性保障中心、约克大学) Bradford Royal Infirmary(布拉德福德皇家医院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过加权指标和置信度阈值来提升LLM作为裁判在关键信息流中的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14720 2025-12-18 cs.SI cs.AI cs.CL 86%

SoMe: A Realistic Benchmark for LLM-based Social Media Agents

SoMe:一种用于基于大语言模型的社会媒体代理的现实基准

Dizhan Xue, Jing Cui, Shengsheng Qian, Chuanrui Hu, Changsheng Xu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SoMe是一个用于评估基于大语言模型的社会媒体代理能力的现实基准,通过多样化任务和大量数据揭示了现有LLM在处理社交媒体任务中的局限性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14285 2025-12-18 cs.CR cs.LG 85%

A Multi-Agent LLM Defense Pipeline Against Prompt Injection Attacks

针对提示注入攻击的多智能体LLM防御管道

S M Asif Hossain, Ruksat Khan Shayoni, Mohd Ruhul Ameen, Akif Islam, M. F. Mridha, Jungpil Shin

机构 * School of Computing, Wichita State University, Kansas, USA(威斯康星州立大学计算机学院) College of Engineering and Computer Sciences, Marshall University, Huntington, WV, USA(马歇尔大学工程与计算机科学学院) Department of Computer Science and Engineering, University of Rajshahi, Bangladesh(拉贾沙希大学计算机科学与工程系) Department of Computer Science and Engineering, American International University-Bangladesh, Dhaka, Bangladesh(美国国际大学-孟加拉国计算机科学与工程系) School of Computer Science and Engineering, The University of Aizu, Aizuwakamatsu, Japan(立命馆大学计算机科学与工程学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种多智能体防御框架,通过协调的LLM代理实时检测并中和提示注入攻击,显著提升了安全性和系统功能。

Comments Accepted at the 11th IEEE WIECON-ECE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20764 2025-12-18 cs.CL 85%

Feel the Difference? A Comparative Analysis of Emotional Arcs in Real and LLM-Generated CBT Sessions

感知差异?真实与LLM生成CBT对话中情感弧的比较分析

Xiaoyi Wang, Jiwei Zhang, Guangtao Zhang, Honglei Guo

机构 * Department of Computer Science, Shantou University(汕头大学计算机科学系) Department of Automation, Tsinghua University(清华大学自动化系) BNRIST, Tsinghua University(清华大学脑科学与类脑智能研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过比较真实与LLM生成的CBT对话,揭示了合成对话在情感动态上的不足,强调了情感真实性的关键作用。

Comments Accepted at 2025 EMNLP findings,19 page,2 figures

Journal ref In Findings of the Association for Computational Linguistics: EMNLP 2025, pages 19999-20017

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14846 2025-12-18 cs.CR cs.AI 85%

MALCDF: A Distributed Multi-Agent LLM Framework for Real-Time Cyber

MALCDF: 一种用于实时网络防御的分布式多智能体大语言模型框架

Arth Bhardwaj, Sia Godika, Yuvam Loonker

机构 * Saint Francis High School(圣弗朗西斯高中) Massachusetts Institute of Technology(麻省理工学院) JBCN International School(JBCN国际学校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MALCDF通过协调多个LLM智能体实现高准确率的实时网络防御,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15363 2025-12-18 cs.DB 83%

Revisiting Task-Oriented Dataset Search in the Era of Large Language Models: Challenges, Benchmark, and Solution

重新审视大语言模型时代任务导向型数据集搜索:挑战、基准测试与解决方案

Zixin Wei, Yucan Guo, Jinyang Li, Xiaolin Han, Xiaolong Jin, Chenhao Ma

专题命中 评测与基准 :large language model(title);language model(title)

AI总结 KATS通过构建任务-数据集知识图和混合查询引擎,解决任务导向型数据集搜索中的挑战,并通过CS-TDS基准测试展示其优越性。

Comments Accepted to Proc. VLDB Endow. (PVLDB), Vol. 19. 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14706 2025-12-18 cs.LG cs.AI cs.CL cs.CV 82%

LLM as a Neural Architect: Controlled Generation of Image Captioning Models Under Strict API Contracts

将LLM作为神经架构:在严格API合同下控制生成图像描述模型

Krunal Jesani, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany(计算机视觉实验室、CAIDAS与IFI、乌尔姆大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于LLM的神经架构搜索方法,通过生成可运行的图像描述模型,展示了LLM在架构设计和超参数优化中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01899 2025-12-18 cs.LG cs.AI cs.HC 81%

Multimodal Foundation Models for Early Disease Detection

多模态基础模型用于早期疾病检测

Md Talha Mohsin, Ismail Abdulrashid

机构 * The University of Tulsa(塔尔萨大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种多模态基础模型,通过整合电子病历、医学影像、基因组学和可穿戴传感器数据,提升早期疾病检测的准确性和鲁棒性。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15031 2025-12-18 cs.SE cs.CY cs.HC 80%

Toxicity Ahead: Forecasting Conversational Derailment on GitHub

前方有毒:预测GitHub上的对话偏离

Mia Mohammad Imran, Robert Zita, Rahat Rizvi Rahman, Preetha Chatterjee, Kostadin Damevski

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出基于LLM的框架,通过两步提示方法预测GitHub上的有毒对话偏离,实现早期检测与可解释的管理。

Journal ref ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15254 2025-12-18 cs.CV cs.LG 79%

Assessing the Visual Enumeration Abilities of Specialized Counting Architectures and Vision-Language Models

评估专用计数架构和视觉-语言模型的视觉计数能力

Kuinan Hou, Jing Mi, Marco Zorzi, Lamberto Ballan, Alberto Testolin

机构 * University of Padova(帕多瓦大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本文比较了专用计数架构与VLMs在物体计数任务中的性能,发现VLMs在生成中间表示时计数准确率显著提高,但复杂场景计数仍需进一步研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14922 2025-12-18 cs.CV 78%

PANDA-PLUS-Bench: A Clinical Benchmark for Evaluating Robustness of AI Foundation Models in Prostate Cancer Diagnosis

PANDA-PLUS-Bench:用于评估前列腺癌诊断中AI基础模型鲁棒性的临床基准

Joshua L. Ebbert, Dennis Della Corte

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 PANDA-PLUS-Bench通过定制基准数据集评估AI基础模型在前列腺癌Gleason分级中的鲁棒性,揭示模型在生物特征捕获和跨滑片准确率上的差异。

Comments 21 pages, 5 figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05272 2025-12-18 cs.SE cs.AI cs.LO 77%

LLMs and Fuzzing in Tandem: A New Approach to Automatically Generating Weakest Preconditions

大语言模型与模糊测试结合:一种自动生成最弱前条件的新方法

Daragh King, Vasileios Koutavas, Laura Kovacs

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出结合大语言模型与模糊测试生成最弱前条件,通过模糊指导提升生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03197 2025-12-18 cs.CL 77%

Explain with Visual Keypoints Like a Real Mentor! A Benchmark for Multimodal Solution Explanation

像真实导师一样用视觉关键点解释吧!一个多模态解决方案解释基准

Jaewoo Park, Jungyang Park, Dongju Jang, Jiwan Chung, Byungwoo Yoo, Jaewoo Shin, Seonjoon Park, Taehyeong Kim, Youngjae Yu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出多模态解决方案解释任务和ME2数据集,旨在评估模型识别视觉关键点并生成相关解释的能力,揭示当前LLM在数学视觉推理和教育应用中的不足。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13734 2025-12-18 cs.CL 77%

GAPS: A Clinically Grounded, Automated Benchmark for Evaluating AI Clinicians

GAPS: 一种基于临床的自动化评估基准,用于评估AI临床医生

Xiuyuan Chen, Tao Sun, Dexin Su, Ailing Yu, Junwei Liu, Zhe Chen, Gangzeng Jin, Xin Wang, Jingnan Liu, Hansong Xiao, Hualei Zhou, Dongjie Tao, Chunxiao Guo, Minghui Yang, Yuan Xia, Jing Zhao, Qianrui Fan, Yanyun Wang, Shuai Zhen, Kezhong Chen, Jun Wang, Zewen Sun, Heng Zhao, Tian Guan, Shaodong Wang, Geyun Chang, Jiaming Deng, Hongchengcheng Chen, Kexin Feng, Ruzhen Li, Jiayi Geng, Changtai Zhao, Jun Wang, Guihu Lin, Peihao Li, Liqi Liu, Peng Wei, Jian Wang, Jinjie Gu, Ping Wang, Fan Yang

机构 * Department of Thoracic Surgery(胸外科部门) Thoracic Oncology Institute(胸外科肿瘤研究所) Research Unit of Intelligence Diagnosis and Treatment in Early Non-small Cell Lung Cancer(早期非小细胞肺癌智能诊断与治疗研究单元) Institute of Advanced Clinical Medicine(先进临床医学研究所) Beijing Key Laboratory of Innovative Application of Big Data in Lung Cancer(肺癌大数据创新应用北京市重点实验室) Ant Group(蚂蚁集团) School of Software and Microelectronics(软件与微电子学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 GAPS提出了一种基于临床的自动化评估基准,用于评估AI临床医生系统,通过多维评估框架解决现有基准的不足,揭示了AI在临床实践中的关键失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15466 2025-12-18 cs.SE cs.AI 70%

On Assessing the Relevance of Code Reviews Authored by Generative Models

基于生成模型的代码审查相关性的评估

Robert Heumüller, Frank Ortmeier

机构 * Otto von Guericke University Magdeburg, Germany(奥托·冯·格里克大学马格德堡)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出多主观排名方法,评估生成模型在代码审查中的表现,发现其生成评论质量优于人类,但需警惕潜在风险。

Comments Replication Package: https://github.com/robert-heumueller-ovgu/repl-generative-review-relevance

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15149 2025-12-18 cs.NE cs.AI 70%

Offline Multi-Task Multi-Objective Data-Driven Evolutionary Algorithm with Language Surrogate Model and Implicit Q-Learning

离线多任务多目标数据驱动进化算法与语言替代模型和隐式Q学习

Xian-Rong Zhang, Yue-Jiao Gong, Zeyuan Ma, Jun Zhang

机构 * School of Computer Science and Engineering, South China University of Technology, Guangzhou, China.(计算机科学与工程学院,华南理工大学,广州,中国) College of Artificial Intelligence, Nankai University, Tianjin, China.(人工智能学院,南开大学,天津,中国) Hanyang University, 15588 Ansan, South Korea.(翰阳大学,韩国安山15588)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出Q-MetaSur算法,通过语言替代模型和隐式Q学习解决离线多任务多目标优化问题,提升目标近似精度和进化算法的收敛与帕累托最优性。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15082 2025-12-18 cs.LG 70%

The Semantic Architect: How FEAML Bridges Structured Data and LLMs for Multi-Label Tasks

语义架构:FEAML如何将结构化数据与LLMs结合用于多标签任务

Wanfu Gao, Zebin He, Jun Gao

机构 * Wanfu Gao 1,2(高万福(1,2)) Zebin He 1,2(何泽彬(1,2)) Jun Gao 1,2(高俊(1,2))

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 FEAML通过结合LLMs的代码生成能力与反馈机制,实现高效且自我改进的多标签任务特征工程方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15252 2025-12-18 cs.CY 67%

Gaming the Arena: AI Model Evaluation and the Viral Capture of Attention

在竞技场中 Gaming:AI 模型评估与病毒式捕获注意力

Sam Hind

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文探讨了AI模型评估中“竞技场”现象的兴起,分析了病毒式注意力捕获对AI发展的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09603 2025-12-18 cs.CV 67%

Do MLLMs Exhibit Human-like Perceptual Behaviors? HVSBench: A Benchmark for MLLM Alignment with Human Perceptual Behavior

多模态大语言模型是否表现出类人感知行为?HVSBench:一个用于多模态大语言模型对齐人类视觉行为的基准测试

Jiaying Lin, Shuquan Ye, Dan Xu, Wanli Ouyang, Rynson W. H. Lau

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 HVSBench通过测试多模态大语言模型与人类视觉行为的对齐性,揭示了其在感知任务上的显著差距,并强调了开发更符合人类认知的AI的重要性。

Comments Project page: https://jiaying.link/HVSBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14755 2025-12-18 cs.CV 67%

SkyCap: Bitemporal VHR Optical-SAR Quartets for Amplitude Change Detection and Foundation-Model Evaluation

SkyCap:双时间维高分辨率光学-合成孔径雷达四元组用于幅度变化检测和基础模型评估

Paul Weinmann, Ferdinand Schenck, Martin Šiklar

机构 * LiveEO GmbH(LiveEO公司)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract)

AI总结 SkyCap通过光学-雷达数据集和标签转移,首次评估了高分辨率SAR幅度变化检测中的基础模型性能。

Comments 8 pages, 0 figures. Accepted at Advances in Representation Learning for Earth Observation (REO) at EurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10984 2025-12-18 cs.CL cs.AI 62%

DiscoX: Benchmarking Discourse-Level Translation task in Expert Domains

DiscoX:专家领域 discourse 级翻译任务的基准测试

Xiying Zhao, Zhoufutu Wen, Zhixuan Chen, Jingzhe Ding, Jianpeng Jiao, Shuai Li, Xi Li, Danni Liang, Shengda Long, Qianqian Liu, Xianbo Wu, Hongwan Gao, Xiang Gao, Liang Hu, Jiashuo Liu, Mengyun Liu, Weiran Shi, Chenghao Yang, Qianyu Yang, Xuanliang Zhang, Ge Zhang, Wenhao Huang, Yuwen Tang

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 DiscoX 是一个针对专家领域 discourse 级翻译任务的基准测试,通过专业精选文本和 Metric-S 评估系统,揭示了当前 LLM 在该任务上的不足。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15397 2025-12-18 cs.CL 57%

ORACLE: Time-Dependent Recursive Summary Graphs for Foresight on News Data Using LLMs

ORACLE:基于LLMs的新闻数据前瞻性分析的时依赖递归摘要图

Lev Kharlashkin, Eiaki Morooka, Yehor Tereshchenko, Mika Hämäläinen

机构 * Metropolia University of Applied Sciences(梅拉利亚应用科学大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 ORACLE利用LLMs构建时依赖递归摘要图,对新闻数据进行周度决策洞察,通过聚类和变化检测实现PESTEL维度的前瞻性分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09172 2025-12-18 cs.CV cs.AI 57%

Prompt-Based Continual Compositional Zero-Shot Learning

基于提示的持续组成零样本学习

Sauda Maryam, Sara Nadeem, Faisal Qureshi, Mohsen Ali

机构 * Intelligent Machines Lab(智能机器实验室) Information Technology University(信息技术大学) Visual Computing Lab(视觉计算实验室) Ontario Tech University(安大略技术大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 PromptCCZSL通过多教师蒸馏和正交投影损失,实现持续组成零样本学习中的知识保留与泛化提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15235 2025-12-18 cs.CL 57%

FAME: Fictional Actors for Multilingual Erasure

FAME:多语言擦除的虚构演员

Claudio Savelli, Moreno La Quatra, Alkis Koudounas, Flavio Giobergia

专题命中 评测与基准 :pretraining(abstract);分类 cs.CL

AI总结 FAME通过多语言虚构数据评估机器去训练技术,支持实体级和实例级遗忘,提供受控环境以验证去训练方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14860 2025-12-18 cs.CR cs.AI 57%

Penetration Testing of Agentic AI: A Comparative Security Analysis Across Models and Frameworks

代理AI的渗透测试:跨模型和框架的比较安全分析

Viet K. Nguyen, Mohammad I. Husain

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文通过测试五个代理AI模型和两个框架,揭示了代理AI在安全方面的显著差异,发现超过一半的恶意提示成功,提出了新的防御策略和部署建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14770 2025-12-18 cs.CV cs.AI 57%

Improving VQA Reliability: A Dual-Assessment Approach with Self-Reflection and Cross-Model Verification

提升VQA可靠性:基于自我反思与跨模型验证的双评估方法

Xixian Wu, Yang Ou, Pengchao Tian, Zian Yang, Jielei Zhang, Peiyi Li, Longwen Gao

机构 * Bilibili Inc.(哔哩哔哩公司)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出DAVR框架,通过自我反思和跨模型验证提升VQA中VLM响应的可靠性,取得优异实验结果。

详情

展开后加载摘要…

URL PDF HTML 收藏