arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-10 至 2025-11-10 共收录 148 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 29 篇

2502.17086 2025-11-10 cs.CL 85%

Mind the Blind Spots: A Focus-Level Evaluation Framework for LLM Reviews

Hyungyu Shin, Jingyu Tang, Yoonjoo Lee, Nayoung Kim, Hyunseung Lim, Ji Yong Cho, Hwajung Hong, Moontae Lee, Juho Kim

机构 * KAIST(韩国科学技术院) Huazhong University of Science and Technology(华中科技大学) LG AI Research(LG人工智能研究) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05040 2025-11-10 cs.CL cs.AI cs.SE 84%

UA-Code-Bench: A Competitive Programming Benchmark for Evaluating LLM Code Generation in Ukrainian

Mykyta Syromiatnikov, Victoria Ruvinskaya

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 8 pages, 5 figures. XI International conference "Informatics. Culture. Technique." (2025)

Journal ref XI International conference "Informatics. Culture. Technique." (2025) 308-314

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22990 2025-11-10 eess.IV cs.AI cs.CV 83%

USF-MAE: Ultrasound Self-Supervised Foundation Model with Masked Autoencoding

Youssef Megahed, Robin Ducharme, Aylin Erman, Mark Walker, Steven Hawken, Adrian D. C. Chan

机构 * Department of Systems and Computer Engineering, Carleton University(系统与计算机工程系,卡尔顿大学) Department of Clinical Science and Translational Medicine, University of Ottawa(临床科学与转化医学系,渥太华大学) Department of Obstetrics and Gynecology, University of Ottawa(妇产科系,渥太华大学) School of Epidemiology and Public Health, University of Ottawa(流行病学与公共卫生学院,渥太华大学) Department of Methodological and Implementation Research, Ottawa Hospital Research Institute(方法学与实施研究系,渥太华医院研究学院) Department of Acute Care Research, Ottawa Hospital Research Institute(急症护理研究系,渥太华医院研究学院)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

Comments 18 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05320 2025-11-10 cs.CL cs.AI 82%

What Are the Facts? Automated Extraction of Court-Established Facts from Criminal-Court Opinions

Klára Bendová, Tomáš Knap, Jan Černý, Vojtěch Pour, Jaromir Savelka, Ivana Kvapilíková, Jakub Drápal

机构 * Faculty of Law, Charles University, Prague, Czechia(法律学院,查尔斯大学,捷克共和国) Faculty of Mathematics and Physics, Charles University, Prague, Czechia(数学与物理学院,查尔斯大学,捷克共和国) School of Computer Science, Carnegie Mellon University, Pittsburgh PA, USA(计算机科学学院,卡内基梅隆大学,美国)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Paper accepted to the proceedings of ASAIL 2025 Workshop under ICAIL conference for publication. Paper contains 6 pages (references included) and 2 appendices. It contains 8 tables, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00616 2025-11-10 cs.LG cs.AI cs.HC 82%

TimeCopilot

Azul Garza, Renée Rosillo

机构 * San Francisco, CA, USA(美国加州旧金山)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05018 2025-11-10 cs.CL cs.AI cs.LG 80%

Pluralistic Behavior Suite: Stress-Testing Multi-Turn Adherence to Custom Behavioral Policies

Prasoon Varshney, Makesh Narsimhan Sreedhar, Liwei Jiang, Traian Rebedea, Christopher Parisien

机构 * NVIDIA

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at the Multi-Turn Interactions workshop at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05399 2025-11-10 cs.SD cs.AI 79%

Robust Neural Audio Fingerprinting using Music Foundation Models

Shubhr Singh, Kiran Bhat, Xavier Riley, Benjamin Resnick, John Thickstun, Walter De Brouwer

机构 * SoundPatrol Cornell University(康奈尔大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04948 2025-11-10 cs.CV cs.AI 79%

A benchmark multimodal oro-dental dataset for large vision-language models

Haoxin Lv, Ijazul Haq, Jin Du, Jiaxin Ma, Binnian Zhu, Xiaobing Dang, Chaoan Liang, Ruxu Du, Yingjie Zhang, Muhammad Saqib

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05000 2025-11-10 cs.IR cs.AI 77%

Query Generation Pipeline with Enhanced Answerability Assessment for Financial Information Retrieval

Hyunkyu Kim, Yeeun Yoo, Youngjun Kwak

机构 * Kakaobank Seongnam-si Republic of Korea(韩国首尔市韩国 Kakao银行)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted(Oral) by ICAIF 2025. Hyunkyu Kim and Yeeun Yoo contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04995 2025-11-10 cs.HC cs.AI cs.CL 73%

Enhancing Public Speaking Skills in Engineering Students Through AI

Amol Harsh, Brainerd Prince, Siddharth Siddharth, Deepan Raj Prabakar Muthirayan, Kabir S Bhalla, Esraaj Sarkar Gupta, Siddharth Sahu

机构 * Center for Thinking, Language and Communication(思考、语言与交流中心) Plaksha University(普拉克斯大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04720 2025-11-10 cs.CL cs.AI 73%

Learning to reason about rare diseases through retrieval-augmented agents

Ha Young Kim, Jun Li, Ana Beatriz Solana, Carolin M. Pirkl, Benedikt Wiestler, Julia A. Schnabel, Cosmin I. Bercea

机构 * Technical University of Munich(慕尼黑技术大学) GE HealthCare(GE医疗) Munich Center for Machine Learning(慕尼黑机器学习中心) Klinikum Rechts der Isar(莱布尼茨医院) Helmholtz Munich(亥姆霍兹慕尼黑研究中心) King's College London(伦敦国王学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Submitted on behalf of the PREDICTOM consortium

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10335 2025-11-10 cs.CL 70%

MorphTok: Morphologically Grounded Tokenization for Indian Languages

Maharaj Brahma, N J Karthika, Atul Singh, Devaraj Adiga, Smruti Bhate, Ganesh Ramakrishnan, Rohit Saluja, Maunendra Sankar Desarkar

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted at Tokenization Workshop (TokShop), ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05324 2025-11-10 cs.CL 70%

Evaluating Subword Tokenization Techniques for Bengali: A Benchmark Study with BengaliBPE

Firoj Ahmmed Patwary, Abdullah Al Noman

专题命中 评测与基准 :language model(abstract);pretraining(abstract);分类 cs.CL

Comments 10 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16204 2025-11-10 cs.CE cs.HC cs.RO 67%

Toward Engineering AGI: Benchmarking the Engineering Design Capabilities of LLMs

Xingang Guo, Yaxin Li, Xiangyi Kong, Yilan Jiang, Xiayu Zhao, Zhihua Gong, Yufan Zhang, Daixuan Li, Tianle Sang, Beixiao Zhu, Gregory Jun, Yingbing Huang, Yiqi Liu, Yuqi Xue, Rahul Dev Kundu, Qi Jian Lim, Yizhou Zhao, Luke Alexander Granger, Mohamed Badr Younis, Darioush Keivan, Nippun Sabharwal, Shreyanka Sinha, Prakhar Agarwal, Kojo Vandyck, Hanlin Mai, Zichen Wang, Aditya Venkatesh, Ayush Barik, Jiankun Yang, Chongying Yue, Jingjie He, Libin Wang, Licheng Xu, Hao Chen, Jinwen Wang, Liujun Xu, Rushabh Shetty, Ziheng Guo, Dahui Song, Manvi Jha, Weijie Liang, Weiman Yan, Bryan Zhang, Sahil Bhandary Karnoor, Jialiang Zhang, Rutva Pandya, Xinyi Gong, Mithesh Ballae Ganesh, Feize Shi, Ruiling Xu, Yifan Zhang, Yanfeng Ouyang, Lianhui Qin, Elyse Rosenbaum, Corey Snyder, Peter Seiler, Geir Dullerud, Xiaojia Shelly Zhang, Zuofu Cheng, Pavan Kumar Hanumolu, Jian Huang, Mayank Kulkarni, Mahdi Namazifar, Huan Zhang, Bin Hu

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Pennsylvania(宾夕法尼亚大学) University of California San Diego(加州大学圣地亚哥分校) University of Michigan(密歇根大学) Amazon AGI(亚马逊人工通用智能)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments To Appear in NeurIPS 2025 Datasets & Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04998 2025-11-10 cs.LG cs.AI q-bio.QM 62%

BiPETE: A Bi-Positional Embedding Transformer Encoder for Risk Assessment of Alcohol and Substance Use Disorder with Electronic Health Records

Daniel S. Lee, Mayra S. Haedo-Cruz, Chen Jiang, Oshin Miranda, LiRong Wang

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI、cs.LG

Comments 20 pages, 2 figures, 6 tables, 2 supplementary figures, 4 supplementary tables, submitted to Journal of Biomedical Informatics on 6 Nov, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04727 2025-11-10 cs.CV cs.AI cs.LG 62%

IndicVisionBench: Benchmarking Cultural and Multilingual Understanding in VLMs

Ali Faraz, Akash, Shaharukh Khan, Raja Kolla, Akshat Patidar, Suranjan Goswami, Abhinav Ravi, Chandra Khatri, Shubham Agarwal

机构 * Krutrim AI OLA Electric

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05359 2025-11-10 cs.CR cs.CL cs.CY 57%

ConVerse: Benchmarking Contextual Safety in Agent-to-Agent Conversations

Amr Gomaa, Ahmed Salem, Sahar Abdelnabi

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Microsoft(微软) ELLIS Institute Tübingen and MPI for Intelligent Systems(图宾根ELLIS研究所和智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04247 2025-11-10 cs.MM cs.AI cs.IR 57%

On the Brittleness of CLIP Text Encoders

Allie Tran, Luca Rossetto

机构 * Dublin City University(都柏林城市大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

Comments Accepted for publication at MMM'26. Analysis code can be found here: https://github.com/allie-tran/clip-brittleness

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05120 2025-11-10 cs.CL 57%

A Toolbox for Improving Evolutionary Prompt Search

Daniel Grießhaber, Maximilian Kimmich, Johannes Maucher, Ngoc Thang Vu

机构 * Institute for Applied Artificial Intelligence (IAAI), Stuttgart Media University(应用人工智能研究所(IAAI)、斯图加特媒体大学) Institute for Natural Language Processing (IMS), University of Stuttgart(自然语言处理研究所(IMS)、斯图加特大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04754 2025-11-10 cs.CL 57%

Surprisal reveals diversity gaps in image captioning and different scorers change the story

Nikolai Ilinykh, Simon Dobnik

机构 * Centre for Linguistic Theory and Studies in Probability (CLASP), Department of Philosophy, Linguistics and Theory of Science (FLoV), University of Gothenburg(语言理论与概率研究中心(CLASP)、哲学、语言学与科学理论系(FLoV)、哥德堡大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

Comments Accepted and presented at INLG 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17578 2025-11-10 cs.CL 57%

Synthetic Voice Data for Automatic Speech Recognition in African Languages

Brian DeRenzi, Anna Dixon, Mohamed Aymane Farhi, Christian Resch

机构 * Dimagi CLEAR Global

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

Comments 29 pages incl. appendix, 8 tables, 5 figures. Authors are listed in alphabetical order

Journal ref Proceedings of the 1st Workshop on Advancing NLP for Low-Resource Languages associated with RANLP (2025) 152-186

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00383 2025-11-10 cs.CE 50%

STARC-9: A Large-scale Dataset for Multi-Class Tissue Classification for CRC Histopathology

Barathi Subramanian, Rathinaraja Jeyaraj, Mitchell Nevin Peterson, Terry Guo, Nigam Shah, Curtis Langlotz, Andrew Y. Ng, Jeanne Shen

专题命中 评测与基准 :foundation model(abstract)

Comments 37 pages, 18 figures, Accepted in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20217 2025-11-10 cs.CV 50%

EditInfinity: Image Editing with Binary-Quantized Generative Models

Jiahuan Wang, Yuxin Chen, Jun Yu, Guangming Lu, Wenjie Pei

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :prompting(abstract)

Comments 28 pages, 13 figures, accepted by The Thirty-ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 32 篇

2402.03299 2025-11-10 cs.LG cs.CL cs.CV 90%

GUARD: Role-playing to Generate Natural-language Jailbreakings to Test Guideline Adherence of Large Language Models

Haibo Jin, Ruoxi Chen, Peiyan Zhang, Andy Zhou, Haohan Wang

机构 * School of Information Sciences University of Illinois at Urbana-Champaign(信息科学学院伊利诺伊大学厄巴纳-香槟分校) Independent Researcher, Starc Institute(Starc研究所独立研究者) Computer Science and Engineering HKUST(HKUST计算机科学与工程学院) Computer Science Lapis Labs University of Illinois Urbana-Champaign(计算机科学Lapis Labs伊利诺伊大学厄巴纳-香槟分校) School of Information Sciences University of Illinois Urbana-Champaign(信息科学学院伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments 28 papges

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04703 2025-11-10 cs.CL cs.AI 90%

Measuring what Matters: Construct Validity in Large Language Model Benchmarks

Andrew M. Bean, Ryan Othniel Kearns, Angelika Romanou, Franziska Sofia Hafner, Harry Mayne, Jan Batzner, Negar Foroutan, Chris Schmitz, Karolina Korgul, Hunar Batra, Oishi Deb, Emma Beharry, Cornelius Emde, Thomas Foster, Anna Gausen, María Grandury, Simeng Han, Valentin Hofmann, Lujain Ibrahim, Hazel Kim, Hannah Rose Kirk, Fangru Lin, Gabrielle Kaili-May Liu, Lennart Luettgau, Jabez Magomere, Jonathan Rystrøm, Anna Sotnikova, Yushi Yang, Yilun Zhao, Adel Bibi, Antoine Bosselut, Ronald Clark, Arman Cohan, Jakob Foerster, Yarin Gal, Scott A. Hale, Inioluwa Deborah Raji, Christopher Summerfield, Philip H. S. Torr, Cozmin Ududec, Luc Rocher, Adam Mahdi

机构 * University of Oxford(牛津大学) EPFL(苏黎世联邦理工学院) Weizenbaum Institute Berlin(柏林Weizenbaum研究所) Technical University Munich(慕尼黑技术大学) Centre for Digital Governance, Hertie School(赫尔姆霍兹学院数字治理中心) Stanford University(斯坦福大学) UK AI Security Institute(英国人工智能安全研究所) SomosNLP Universdad Politécnica de Madrid(马德里理工大学) Yale University(耶鲁大学) Allen Institute for AI(人工智能研究所) University of Washington(华盛顿大学) Meedan UC Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05085 2025-11-10 cs.CL cs.LG 88%

Iterative Layer-wise Distillation for Efficient Compression of Large Language Models

Grigory Kovalev, Mikhail Tikhomirov

机构 * Lomonosov Moscow State University, Russia(莫斯科罗蒙诺夫国立大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02421 2025-11-10 cs.CL cs.AI 88%

Activation-Informed Merging of Large Language Models

Amin Heyrani Nobari, Kaveh Alim, Ali ArjomandBigdeli, Akash Srivastava, Faez Ahmed, Navid Azizan

机构 * Massachusetts Institute of Technology(麻省理工学院) Stony Brook University(石溪大学) MIT-IBM Watson AI Lab & Red Hat AI Innovation(MIT-IBM Watson AI实验室及Red Hat AI创新)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04952 2025-11-10 cs.CL 88%

LoPT: Lossless Parallel Tokenization Acceleration for Long Context Inference of Large Language Model

Wei Shao, Lingchao Zheng, Pengyu Wang, Peizhen Zheng, Jun Li, Yuwei Fan

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04849 2025-11-10 cs.SE cs.AI 87%

Software Defined Vehicle Code Generation: A Few-Shot Prompting Approach

Quang-Dung Nguyen, Tri-Dung Tran, Thanh-Hieu Chu, Hoang-Loc Tran, Xiangwei Cheng, Dirk Slama

机构 * University of Information Technology VNUHCM(信息技术大学 VNUHCM)

专题命中 效率与部署 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01602 2025-11-10 cs.DB cs.LG 85%

L2T-Tune:LLM-Guided Hybrid Database Tuning with LHS and TD3

Xinyue Yang, Chen Zheng, Yaoyang Hou, Renhao Zhang, Yinyan Zhang, Yanjun Wu, Heng Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Hangzhou Institute for Advanced Study, UCAS(杭州高等研究院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏