arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-18 至 2025-12-18 共收录 138 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 28 篇

2512.15031 2025-12-18 cs.SE cs.CY cs.HC 80%

Toxicity Ahead: Forecasting Conversational Derailment on GitHub

前方有毒:预测GitHub上的对话偏离

Mia Mohammad Imran, Robert Zita, Rahat Rizvi Rahman, Preetha Chatterjee, Kostadin Damevski

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出基于LLM的框架,通过两步提示方法预测GitHub上的有毒对话偏离,实现早期检测与可解释的管理。

Journal ref ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15254 2025-12-18 cs.CV cs.LG 79%

Assessing the Visual Enumeration Abilities of Specialized Counting Architectures and Vision-Language Models

评估专用计数架构和视觉-语言模型的视觉计数能力

Kuinan Hou, Jing Mi, Marco Zorzi, Lamberto Ballan, Alberto Testolin

机构 * University of Padova(帕多瓦大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本文比较了专用计数架构与VLMs在物体计数任务中的性能,发现VLMs在生成中间表示时计数准确率显著提高,但复杂场景计数仍需进一步研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14922 2025-12-18 cs.CV 78%

PANDA-PLUS-Bench: A Clinical Benchmark for Evaluating Robustness of AI Foundation Models in Prostate Cancer Diagnosis

PANDA-PLUS-Bench:用于评估前列腺癌诊断中AI基础模型鲁棒性的临床基准

Joshua L. Ebbert, Dennis Della Corte

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 PANDA-PLUS-Bench通过定制基准数据集评估AI基础模型在前列腺癌Gleason分级中的鲁棒性,揭示模型在生物特征捕获和跨滑片准确率上的差异。

Comments 21 pages, 5 figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05272 2025-12-18 cs.SE cs.AI cs.LO 77%

LLMs and Fuzzing in Tandem: A New Approach to Automatically Generating Weakest Preconditions

大语言模型与模糊测试结合:一种自动生成最弱前条件的新方法

Daragh King, Vasileios Koutavas, Laura Kovacs

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出结合大语言模型与模糊测试生成最弱前条件,通过模糊指导提升生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03197 2025-12-18 cs.CL 77%

Explain with Visual Keypoints Like a Real Mentor! A Benchmark for Multimodal Solution Explanation

像真实导师一样用视觉关键点解释吧!一个多模态解决方案解释基准

Jaewoo Park, Jungyang Park, Dongju Jang, Jiwan Chung, Byungwoo Yoo, Jaewoo Shin, Seonjoon Park, Taehyeong Kim, Youngjae Yu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出多模态解决方案解释任务和ME2数据集,旨在评估模型识别视觉关键点并生成相关解释的能力,揭示当前LLM在数学视觉推理和教育应用中的不足。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13734 2025-12-18 cs.CL 77%

GAPS: A Clinically Grounded, Automated Benchmark for Evaluating AI Clinicians

GAPS: 一种基于临床的自动化评估基准,用于评估AI临床医生

Xiuyuan Chen, Tao Sun, Dexin Su, Ailing Yu, Junwei Liu, Zhe Chen, Gangzeng Jin, Xin Wang, Jingnan Liu, Hansong Xiao, Hualei Zhou, Dongjie Tao, Chunxiao Guo, Minghui Yang, Yuan Xia, Jing Zhao, Qianrui Fan, Yanyun Wang, Shuai Zhen, Kezhong Chen, Jun Wang, Zewen Sun, Heng Zhao, Tian Guan, Shaodong Wang, Geyun Chang, Jiaming Deng, Hongchengcheng Chen, Kexin Feng, Ruzhen Li, Jiayi Geng, Changtai Zhao, Jun Wang, Guihu Lin, Peihao Li, Liqi Liu, Peng Wei, Jian Wang, Jinjie Gu, Ping Wang, Fan Yang

机构 * Department of Thoracic Surgery(胸外科部门) Thoracic Oncology Institute(胸外科肿瘤研究所) Research Unit of Intelligence Diagnosis and Treatment in Early Non-small Cell Lung Cancer(早期非小细胞肺癌智能诊断与治疗研究单元) Institute of Advanced Clinical Medicine(先进临床医学研究所) Beijing Key Laboratory of Innovative Application of Big Data in Lung Cancer(肺癌大数据创新应用北京市重点实验室) Ant Group(蚂蚁集团) School of Software and Microelectronics(软件与微电子学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 GAPS提出了一种基于临床的自动化评估基准,用于评估AI临床医生系统,通过多维评估框架解决现有基准的不足,揭示了AI在临床实践中的关键失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15466 2025-12-18 cs.SE cs.AI 70%

On Assessing the Relevance of Code Reviews Authored by Generative Models

基于生成模型的代码审查相关性的评估

Robert Heumüller, Frank Ortmeier

机构 * Otto von Guericke University Magdeburg, Germany(奥托·冯·格里克大学马格德堡)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出多主观排名方法,评估生成模型在代码审查中的表现,发现其生成评论质量优于人类,但需警惕潜在风险。

Comments Replication Package: https://github.com/robert-heumueller-ovgu/repl-generative-review-relevance

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15149 2025-12-18 cs.NE cs.AI 70%

Offline Multi-Task Multi-Objective Data-Driven Evolutionary Algorithm with Language Surrogate Model and Implicit Q-Learning

离线多任务多目标数据驱动进化算法与语言替代模型和隐式Q学习

Xian-Rong Zhang, Yue-Jiao Gong, Zeyuan Ma, Jun Zhang

机构 * School of Computer Science and Engineering, South China University of Technology, Guangzhou, China.(计算机科学与工程学院,华南理工大学,广州,中国) College of Artificial Intelligence, Nankai University, Tianjin, China.(人工智能学院,南开大学,天津,中国) Hanyang University, 15588 Ansan, South Korea.(翰阳大学,韩国安山15588)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出Q-MetaSur算法,通过语言替代模型和隐式Q学习解决离线多任务多目标优化问题,提升目标近似精度和进化算法的收敛与帕累托最优性。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15082 2025-12-18 cs.LG 70%

The Semantic Architect: How FEAML Bridges Structured Data and LLMs for Multi-Label Tasks

语义架构:FEAML如何将结构化数据与LLMs结合用于多标签任务

Wanfu Gao, Zebin He, Jun Gao

机构 * Wanfu Gao 1,2(高万福(1,2)) Zebin He 1,2(何泽彬(1,2)) Jun Gao 1,2(高俊(1,2))

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 FEAML通过结合LLMs的代码生成能力与反馈机制,实现高效且自我改进的多标签任务特征工程方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15252 2025-12-18 cs.CY 67%

Gaming the Arena: AI Model Evaluation and the Viral Capture of Attention

在竞技场中 Gaming:AI 模型评估与病毒式捕获注意力

Sam Hind

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文探讨了AI模型评估中“竞技场”现象的兴起,分析了病毒式注意力捕获对AI发展的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09603 2025-12-18 cs.CV 67%

Do MLLMs Exhibit Human-like Perceptual Behaviors? HVSBench: A Benchmark for MLLM Alignment with Human Perceptual Behavior

多模态大语言模型是否表现出类人感知行为?HVSBench:一个用于多模态大语言模型对齐人类视觉行为的基准测试

Jiaying Lin, Shuquan Ye, Dan Xu, Wanli Ouyang, Rynson W. H. Lau

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 HVSBench通过测试多模态大语言模型与人类视觉行为的对齐性,揭示了其在感知任务上的显著差距,并强调了开发更符合人类认知的AI的重要性。

Comments Project page: https://jiaying.link/HVSBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14755 2025-12-18 cs.CV 67%

SkyCap: Bitemporal VHR Optical-SAR Quartets for Amplitude Change Detection and Foundation-Model Evaluation

SkyCap:双时间维高分辨率光学-合成孔径雷达四元组用于幅度变化检测和基础模型评估

Paul Weinmann, Ferdinand Schenck, Martin Šiklar

机构 * LiveEO GmbH(LiveEO公司)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract)

AI总结 SkyCap通过光学-雷达数据集和标签转移,首次评估了高分辨率SAR幅度变化检测中的基础模型性能。

Comments 8 pages, 0 figures. Accepted at Advances in Representation Learning for Earth Observation (REO) at EurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10984 2025-12-18 cs.CL cs.AI 62%

DiscoX: Benchmarking Discourse-Level Translation task in Expert Domains

DiscoX:专家领域 discourse 级翻译任务的基准测试

Xiying Zhao, Zhoufutu Wen, Zhixuan Chen, Jingzhe Ding, Jianpeng Jiao, Shuai Li, Xi Li, Danni Liang, Shengda Long, Qianqian Liu, Xianbo Wu, Hongwan Gao, Xiang Gao, Liang Hu, Jiashuo Liu, Mengyun Liu, Weiran Shi, Chenghao Yang, Qianyu Yang, Xuanliang Zhang, Ge Zhang, Wenhao Huang, Yuwen Tang

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 DiscoX 是一个针对专家领域 discourse 级翻译任务的基准测试,通过专业精选文本和 Metric-S 评估系统,揭示了当前 LLM 在该任务上的不足。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15397 2025-12-18 cs.CL 57%

ORACLE: Time-Dependent Recursive Summary Graphs for Foresight on News Data Using LLMs

ORACLE:基于LLMs的新闻数据前瞻性分析的时依赖递归摘要图

Lev Kharlashkin, Eiaki Morooka, Yehor Tereshchenko, Mika Hämäläinen

机构 * Metropolia University of Applied Sciences(梅拉利亚应用科学大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 ORACLE利用LLMs构建时依赖递归摘要图,对新闻数据进行周度决策洞察,通过聚类和变化检测实现PESTEL维度的前瞻性分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09172 2025-12-18 cs.CV cs.AI 57%

Prompt-Based Continual Compositional Zero-Shot Learning

基于提示的持续组成零样本学习

Sauda Maryam, Sara Nadeem, Faisal Qureshi, Mohsen Ali

机构 * Intelligent Machines Lab(智能机器实验室) Information Technology University(信息技术大学) Visual Computing Lab(视觉计算实验室) Ontario Tech University(安大略技术大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 PromptCCZSL通过多教师蒸馏和正交投影损失,实现持续组成零样本学习中的知识保留与泛化提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15235 2025-12-18 cs.CL 57%

FAME: Fictional Actors for Multilingual Erasure

FAME:多语言擦除的虚构演员

Claudio Savelli, Moreno La Quatra, Alkis Koudounas, Flavio Giobergia

专题命中 评测与基准 :pretraining(abstract);分类 cs.CL

AI总结 FAME通过多语言虚构数据评估机器去训练技术,支持实体级和实例级遗忘,提供受控环境以验证去训练方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14860 2025-12-18 cs.CR cs.AI 57%

Penetration Testing of Agentic AI: A Comparative Security Analysis Across Models and Frameworks

代理AI的渗透测试:跨模型和框架的比较安全分析

Viet K. Nguyen, Mohammad I. Husain

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文通过测试五个代理AI模型和两个框架,揭示了代理AI在安全方面的显著差异,发现超过一半的恶意提示成功,提出了新的防御策略和部署建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14770 2025-12-18 cs.CV cs.AI 57%

Improving VQA Reliability: A Dual-Assessment Approach with Self-Reflection and Cross-Model Verification

提升VQA可靠性:基于自我反思与跨模型验证的双评估方法

Xixian Wu, Yang Ou, Pengchao Tian, Zian Yang, Jielei Zhang, Peiyi Li, Longwen Gao

机构 * Bilibili Inc.(哔哩哔哩公司)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出DAVR框架,通过自我反思和跨模型验证提升VQA中VLM响应的可靠性,取得优异实验结果。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 29 篇

2512.13194 2025-12-18 cs.CL cs.AI 88%

Efficient Adaptive Rejection Sampling for Accelerating Speculative Decoding in Large Language Models

高效自适应拒绝采样用于加速大语言模型中的推测解码

Chendong Sun, Ali Mao, Lei Xu, mingmin Chen

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出高效自适应拒绝采样方法,通过动态调整接受阈值减少随机拒绝,提升大语言模型推测解码效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14717 2025-12-18 cs.LG 88%

Is GPT-OSS All You Need? Benchmarking Large Language Models for Financial Intelligence and the Surprising Efficiency Paradox

GPT-OSS真的足够吗?对大型语言模型进行金融智能评估及令人惊讶的效率悖论

Ziqian Bi, Danyang Zhang, Junhao Song, Chiung-Yi Tseng

机构 * Purdue University(普渡大学) Independent Researcher(独立研究者) Imperial College London(帝国理工学院伦敦分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文评估了GPT-OSS在金融NLP任务中的表现,发现较小的模型在效率和性能上优于更大的竞争对手。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14946 2025-12-18 cs.OS cs.AI cs.LG 86%

EVICPRESS: Joint KV-Cache Compression and Eviction for Efficient LLM Serving

EVICPRESS: 多存储层级的KV缓存联合压缩与驱逐以提高LLM服务效率

Shaoting Feng, Yuhan Liu, Hanchen Li, Xiaokun Chen, Samuel Shen, Kuntai Du, Zhuohan Gu, Rui Zhang, Yuyang Huang, Yihua Cheng, Jiayi Yao, Qizheng Zhang, Ganesh Ananthanarayanan, Junchen Jiang

机构 * University of Chicago(芝加哥大学) UC Berkeley(伯克利大学) Tensormesh, Inc.(Tensormesh公司) MIT(麻省理工学院) UC Santa Cruz(圣克拉拉大学) Stanford(斯坦福大学) Microsoft(微软公司)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 EVICPRESS通过联合优化KV缓存压缩与驱逐策略,提高LLM服务效率,实现更低延迟和高质量生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15343 2025-12-18 cs.HC cs.AI cs.CY 85%

Exploring User Acceptance and Concerns toward LLM-powered Conversational Agents in Immersive Extended Reality

探索沉浸式扩展现实中基于大语言模型的对话代理用户接受度与担忧

Efe Bozkir, Enkelejda Kasneci

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了沉浸式扩展现实中基于大语言模型的对话代理的用户接受度与担忧,发现熟悉度和性别影响接受度,位置数据敏感性最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15358 2025-12-18 cs.CL 83%

Dual-Density Inference for Efficient Language Model Reasoning

双密度推理用于高效语言模型推理

Zhengyi Zhao, Shubo Zhang, Yuxi Zhang, Huimin Wang, Binyang Li, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) University of International Relations(国际关系大学) Shenzhen University(深圳大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 Denser通过双密度推理框架,优化语言模型在推理和回答阶段的信息密度,减少token消耗达62%,提升复杂推理任务的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15701 2025-12-18 cs.CV 82%

VLIC: Vision-Language Models As Perceptual Judges for Human-Aligned Image Compression

VLIC: 基于视觉-语言模型的人类对齐图像压缩感知判官

Kyle Sargent, Ruiqi Gao, Philipp Henzler, Charles Herrmann, Aleksander Holynski, Li Fei-Fei, Jiajun Wu, Jason Zhang

机构 * Stanford University(斯坦福大学) Google Research(谷歌研究) Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :language model(title,abstract);post-training(abstract)

AI总结 VLIC利用视觉-语言模型进行图像压缩,通过零样本推理实现人类感知对齐,提升压缩性能。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14757 2025-12-18 cs.CV cs.RO 82%

SocialNav-MoE: A Mixture-of-Experts Vision Language Model for Socially Compliant Navigation with Reinforcement Fine-Tuning

SocialNav-MoE: 一种用于社交合规导航的混合专家视觉语言模型,结合强化微调

Tomohito Kawabata, Xinyu Zhang, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(信息科学与技术研究生院,北海道大学)

专题命中 效率与部署 :language model(title,abstract);small language model(abstract)

AI总结 SocialNav-MoE通过混合专家模型和强化微调提升机器人社交合规导航的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14954 2025-12-18 cs.CL cs.LG 81%

Cross-Tokenizer Likelihood Scoring Algorithms for Language Model Distillation

跨分词器似然评分算法用于语言模型蒸馏

Buu Phan, Ashish Khisti, Karen Ullrich

机构 * University of Toronto(多伦多大学) Meta AI

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究提出跨分词器似然评分算法,通过BPE递归结构解决词汇不匹配问题,提升蒸馏效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15335 2025-12-18 cs.LG cs.CR 79%

Bits for Privacy: Evaluating Post-Training Quantization via Membership Inference

比特与隐私:通过成员推断评估训练后量化

Chenxiang Zhang, Tongxi Qu, Zhong Li, Tian Zhang, Jun Pang, Sjouke Mauw

机构 * Department of Computer Science University of Luxembourg(计算机科学系卢森堡大学) Department of Computer Science Nanjing University(计算机科学系南京大学)

专题命中 效率与部署 :post-training(title,abstract);分类 cs.LG

AI总结 研究通过成员推断攻击评估训练后量化在隐私和效用之间的平衡,发现低精度量化可显著降低隐私泄露风险,但会牺牲模型效用。

Comments accepted at TrustCom 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15176 2025-12-18 cs.LG cs.AI 79%

DEER: Draft with Diffusion, Verify with Autoregressive Models

DEER:通过扩散模型草稿,通过自回归模型验证

Zicong Cheng, Guo-Wei Yang, Jia Li, Zhijie Deng, Meng-Hao Guo, Shi-Min Hu

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 DEER通过扩散模型草稿和自回归模型验证,实现高效推测解码,大幅提升解码速度和草稿长度。

Comments Homepage : https://czc726.github.io/DEER/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24832 2025-12-18 cs.CL cs.AI 79%

SemShareKV: Efficient KVCache Sharing for Semantically Similar Prompts via Token-Level LSH Matching

SemShareKV: 通过令牌级LSH匹配实现语义相似提示的高效KV缓存共享

Xinye Zhao, Spyridon Mastorakis

机构 * University of Notre Dame(诺特大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SemShareKV通过语义相似提示的令牌级LSH匹配实现高效KV缓存共享,提升LLM推理速度并降低内存占用。

Comments 11 figures, 14pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10021 2025-12-18 cs.CL cs.AI 79%

LATTE: Learning Aligned Transactions and Textual Embeddings for Bank Clients

LATTE:学习对齐的交易和文本嵌入以用于银行客户

Egor Fadeev, Dzhambulat Mollaev, Aleksei Shestov, Omar Zoloev, Artem Sakhno, Dmitry Korolev, Ivan Kireev, Andrey Savchenko, Maksim Makarenko

机构 * Sber AI Lab(Sber AI实验室) ISP RAS Research Center for Trusted Artificial Intelligence(俄罗斯科学院可信人工智能研究信息中心) NUST MISIS(莫斯科国立信息安全大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LATTE通过对比学习对齐原始事件嵌入与冻结LLM的语义嵌入,有效降低计算成本并提升银行客户序列表示学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏