arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-06 至 2025-11-06 共收录 34 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 34 篇

2511.02936 2025-11-06 cs.LG cs.AI cs.CL 90%

Zero-shot data citation function classification using transformer-based large language models (LLMs)

Neil Byers, Ali Zaidi, Valerie Skye, Chris Beecroft, Kjiersten Fagnan

机构 * DOE Joint Genome Institute(美国能源部联合基因组研究所) Lawrence Berkeley National Laboratory(伯克利国家实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03641 2025-11-06 cs.CR cs.AI cs.CL cs.CY 90%

Watermarking Large Language Models in Europe: Interpreting the AI Act in Light of Technology

Thomas Souverain

机构 * Department of AI Ethics, CEA Paris-Saclay(人工智能伦理系,CEA巴黎萨克雷)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 17 pages, 2 Tables and 2 Pictures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12593 2025-11-06 cs.PL 89%

Converting IEC 61131-3 LD into SFC Using Large Language Model: Dataset and Testing

Yimin Zhang, Mario de Sousa

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02589 2025-11-06 cs.AI 88%

The ORCA Benchmark: Evaluating Real-World Calculation Accuracy in Large Language Models

Claudia Herambourg, Dawid Siuda, Julia Kopczyńska, Joao R. L. Santos, Wojciech Sas, Joanna Śmietańska-Nowak

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03048 2025-11-06 cs.CL 87%

ROBoto2: An Interactive System and Dataset for LLM-assisted Clinical Trial Risk of Bias Assessment

Anthony Hevia, Sanjana Chintalapati, Veronica Ka Wai Lai, Thanh Tam Nguyen, Wai-Tat Wong, Terry Klassen, Lucy Lu Wang

机构 * University of Washington(华盛顿大学) The Hospital for Sick Children(圣马可医院) University of Bologna(博洛尼亚大学) The Chinese University of Hong Kong(香港中文大学) University of Saskatchewan(萨斯喀彻温大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments EMNLP 2025 System Demonstration

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03023 2025-11-06 cs.AI 85%

PublicAgent: Multi-Agent Design Principles From an LLM-Based Open Data Analysis Framework

Sina Montazeri, Yunhe Feng, Kewei Sha

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03080 2025-11-06 cs.CL cs.LG 84%

PolyNorm: Few-Shot LLM-Based Text Normalization for Text-to-Speech

Michel Wong, Ali Alshehri, Sophia Kao, Haotian He

机构 * Apple(苹果公司)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 9 pages including appendix. EMNLP 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26130 2025-11-06 cs.SE cs.AI cs.LG 84%

Beyond Synthetic Benchmarks: Evaluating LLM Performance on Real-World Class-Level Code Generation

Musfiqur Rahman, SayedHassan Khatoonabadi, Emad Shihab

机构 * Concordia University(康科德大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Pre-print submitted for reviwer to TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03367 2025-11-06 cs.CV cs.AI cs.LG 81%

Decoupling Augmentation Bias in Prompt Learning for Vision-Language Models

Gahyeon Kim, Sohee Kim, Seokju Lee

机构 * Korea Institute of Energy Technology (KENTECH)(韩国能源技术研究所)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

Comments Accepted in Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03152 2025-11-06 cs.CL cs.AI 81%

Who Sees the Risk? Stakeholder Conflicts and Explanatory Policies in LLM-based Risk Assessment

Srishti Yadav, Jasmina Gajcin, Erik Miehling, Elizabeth Daly

机构 * IBM Research, Ireland(IBM研究院(爱尔兰))

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01373 2025-11-06 cs.LG 79%

UniFault: A Fault Diagnosis Foundation Model from Bearing Data

Emadeldeen Eldele, Mohamed Ragab, Xu Qing, Edward, Zhenghua Chen, Min Wu, Xiaoli Li, Jay Lee

机构 * Department of Computer Science, Khalifa University(卡利法大学计算机科学系) Institute for Infocomm Research, A*STAR(信息与通信研究所,A*STAR) Centre for Frontier AI Research, A*STAR(前沿人工智能研究中心,A*STAR) Propulsion and Space Research Center, Technology Innovation Institute(推进与空间研究中心,技术创新研究所) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Center for Industrial Artificial Intelligence, Department of Mechanical Engineering, A. James Clark School of Engineering, University of Maryland(工业人工智能中心,机械工程系,A. James Clark工程学院,马里兰大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10504 2025-11-06 hep-ph cs.LG hep-ex stat.ML 79%

Aspen Open Jets: Unlocking LHC Data for Foundation Models in Particle Physics

Oz Amram, Luca Anzalone, Joschka Birk, Darius A. Faroughy, Anna Hallin, Gregor Kasieczka, Michael Krämer, Ian Pang, Humberto Reyes-Gonzalez, David Shih

机构 * Fermi National Accelerator Laboratory, Batavia, IL 60510, USA Department of Physics Astronomy (DIFA), University of Bologna, 40127 Bologna, Italy Astronomy, Rutgers University, Piscataway, NJ 08854, USA Center for Data Institut f\" u r Theoretische Teilchenphysik und Kosmologie, RWTH Aachen University, 52074 Aachen, Germany

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

Comments 11 pages, 4 figures, the AspenOpenJets dataset can be found at http://doi.org/10.25592/uhhfdm.16505

Journal ref Mach.Learn.Sci.Tech. 6 (2025) 3, 030601

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02888 2025-11-06 q-bio.GN cs.AI 79%

NABench: Large-Scale Benchmarks of Nucleotide Foundation Models for Fitness Prediction

Zhongmin Li, Runze Ma, Jiahao Tan, Chengzi Tan, Shuangjia Zheng

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03051 2025-11-06 cs.AI cs.IR 78%

No-Human in the Loop: Agentic Evaluation at Scale for Recommendation

Tao Zhang, Kehui Yao, Luyi Ma, Jiao Chen, Reza Yousefi Maragheh, Kai Zhao, Jianpeng Xu, Evren Korpeoglu, Sushant Kumar, Kannan Achan

机构 * Walmart Global Tech(沃尔玛全球技术)

专题命中 评测与基准 :LLM(abstract,comments);large language model(abstract);language model(abstract);分类 cs.AI

Comments 4 page, NeurIPS 2025 Workshop: Evaluating the Evolving LLM Lifecycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03014 2025-11-06 cs.CV 78%

A Foundation Model for Brain MRI with Dynamic Modality Integration

Minh Sao Khue Luu, Bair N. Tuchinov

机构 * The Artificial Intelligence Research Center of Novosibirsk State University(新西伯利亚国立大学人工智能研究中心)

专题命中 评测与基准 :foundation model(title,abstract)

Comments Preliminary work; results ongoing

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03363 2025-11-06 cs.LG 77%

A Modular, Data-Free Pipeline for Multi-Label Intention Recognition in Transportation Agentic AI Applications

Xiaocai Zhang, Hur Lim, Ke Wang, Zhe Xiao, Jing Wang, Kelvin Lee, Xiuju Fu, Zheng Qin

机构 * Department of Infrastructure Engineering, Faculty of Engineering and Information Technology, The University of Melbourne, Australia(工程与信息技术学院基础设施工程系,墨尔本大学,澳大利亚) School of Computing, National University of Singapore, Singapore(计算学院,新加坡国立大学,新加坡) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR), Singapore(高性能计算研究所,科学、技术与研究局(A*STAR),新加坡) Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology, Hong Kong SAR(土木与环境工程系,香港科学与技术大学,香港特别行政区)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Present in the Transportation Research Board (TRB) Annual Meeting 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03166 2025-11-06 cs.CL 77%

Measuring Aleatoric and Epistemic Uncertainty in LLMs: Empirical Evaluation on ID and OOD QA Tasks

Kevin Wang, Subre Abdoul Moktar, Jia Li, Kangshuo Li, Feng Chen

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by UDM-KDD'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03047 2025-11-06 cs.LG 77%

Unsupervised Evaluation of Multi-Turn Objective-Driven Interactions

Emi Soroka, Tanmay Chopra, Krish Desai, Sanjay Lall

机构 * Department of Electrical Engineering Stanford University(电气工程系 斯坦福大学) Emissary Technologies

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Under review at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17619 2025-11-06 cs.IR 75%

Human vs. Agent in Task-Oriented Conversations

Zhefan Wang, Ning Geng, Zhiqiang Guo, Weizhi Ma, Min Zhang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments SIGIR-AP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16638 2025-11-06 cs.CL cs.AI 73%

Do Automatic Factuality Metrics Measure Factuality? A Critical Evaluation

Sanjana Ramprasad, Byron C. Wallace

机构 * Northeastern University(东北大学)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03102 2025-11-06 cs.CL cs.AI 73%

CARMA: Comprehensive Automatically-annotated Reddit Mental Health Dataset for Arabic

Saad Mankarious, Ayah Zirikly

机构 * School of Engineering and Applied Science(工程与应用科学学院) George Washington University(乔治·华盛顿大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03034 2025-11-06 cs.CL cs.LG 73%

Data-Efficient Adaptation and a Novel Evaluation Method for Aspect-based Sentiment Analysis

Yan Cathy Hua, Paul Denny, Jörg Wicker, Katerina Taškova

机构 * School of Computer Science, University of Auckland(计算机科学学院,奥克兰大学)

专题命中 评测与基准 :language model(abstract);SLM(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03163 2025-11-06 cs.CV 71%

Subsampled Randomized Fourier GaLore for Adapting Foundation Models in Depth-Driven Liver Landmark Segmentation

Yun-Chen Lin, Jiayuan Huang, Hanyuan Zhang, Sergi Kavtaradze, Matthew J. Clarkson, Mobarak I. Hoque

机构 * University College London(伦敦大学学院) King’s College London(伦敦国王学院) The University of Manchester(曼彻斯特大学)

专题命中 评测与基准 :foundation model(title)

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18140 2025-11-06 cs.CL 70%

MathOPEval: A Fine-grained Evaluation Benchmark for Visual Operations of MLLMs in Mathematical Reasoning

Xiaoyuan Li, Moxin Li, Wenjie Wang, Rui Men, Yichang Zhang, Fuli Feng, Dayiheng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03178 2025-11-06 cs.CV 67%

SurgAnt-ViVQA: Learning to Anticipate Surgical Events through GRU-Driven Temporal Cross-Attention

Shreyas C. Dhake, Jiayuan Huang, Runlong He, Danyal Z. Khan, Evangelos B. Mazomenos, Sophia Bano, Hani J. Marcus, Danail Stoyanov, Matthew J. Clarkson, Mobarak I. Hoque

机构 * UCL Hawkes Institute(UCL哈维斯研究所) University College London(伦敦大学学院) Dept of Medical Physics & Biomedical Engineering(医学物理与生物医学工程系) UCL(伦敦大学学院) Dept of Computer Science(计算机科学系) National Hospital for Neurology and Neurosurgery(神经病学与神经外科国家医院) Division of Informatics, Imaging and Data Science(信息学、成像与数据科学 division)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05724 2025-11-06 cs.CL cs.AI cs.LG cs.SD eess.AS 67%

Omni-Router: Sharing Routing Decisions in Sparse Mixture-of-Experts for Speech Recognition

Zijin Gu, Tatiana Likhomanenko, Navdeep Jaitly

机构 * Apple(苹果公司)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted in 2025 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07661 2025-11-06 cs.CV cs.RO 67%

ROADWork: A Dataset and Benchmark for Learning to Recognize, Observe, Analyze and Drive Through Work Zones

Anurag Ghosh, Shen Zheng, Robert Tamburo, Khiem Vuong, Juan Alvarez-Padilla, Hailiang Zhu, Michael Cardei, Nicholas Dunn, Christoph Mertz, Srinivasa G. Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :language model(abstract);foundation model(abstract)

Comments ICCV 2025 Accepted Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06733 2025-11-06 cs.AI cs.CL cs.IR 62%

Reinforcement Learning Foundations for Deep Research Systems: A Survey

Wenjun Li, Zhi Chen, Jingru Lin, Hannan Cao, Wei Han, Sheng Liang, Zhi Zhang, Kuicai Dong, Dexun Li, Chen Zhang, Yong Liu

专题命中 评测与基准 :SFT(abstract);分类 cs.CL、cs.AI

Comments 39 pages, second version

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19078 2025-11-06 cs.LG cs.AI cs.CR cs.SD eess.AS 62%

Differential privacy enables fair and accurate AI-based analysis of speech disorders while protecting patient data

Soroosh Tayebi Arasteh, Mahshad Lotfinia, Paula Andrea Perez-Toro, Tomas Arias-Vergara, Mahtab Ranji, Juan Rafael Orozco-Arroyave, Maria Schuster, Andreas Maier, Seung Hee Yang

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI、cs.LG

Journal ref npj Artificial Intelligence 1, 37 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03060 2025-11-06 cs.LG cs.CL math.DG 62%

The Curved Spacetime of Transformer Architectures

Riccardo Di Sipio, Jairo Diaz-Rodriguez, Luis Serrano

机构 * Dayforce Supported by the Natural Sciences and Engineering Research Council of Canada (NSERC), through grant DGECR-2022-04531. H.C.M.(Dayforce) Department of Mathematics and Statistics York University(约克大学数学与统计学系) Serrano Academy(塞拉诺学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏