arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-02 至 2025-10-02 共收录 45 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 45 篇

2508.17621 2025-10-02 cs.CL cs.AI 88%

Steering When Necessary: Flexible Steering Large Language Models with Backtracking

Zifeng Cheng, Jinwei Gan, Zhiwei Jiang, Cong Wang, Yafeng Yin, Xiang Luo, Yuchen Fu, Qing Gu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05453 2025-10-02 cs.CL cs.AI cs.CV 88%

MLLM-CL: Continual Learning for Multimodal Large Language Models

Hongbo Zhao, Fei Zhu, Haiyang Guo, Meng Wang, Rundong Wang, Gaofeng Meng, Zhaoxiang Zhang

机构 * UCAS(中国科学院自动化研究所) CASIA(中国科学院自动化研究所) HKISI, CAS(中国科学院香港研究所) HKU(香港大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00567 2025-10-02 cs.CL 88%

Are Large Language Models Chronically Online Surfers? A Dataset for Chinese Internet Meme Explanation

Yubo Xie, Chenkai Wang, Zongyang Ma, Fahui Miao

机构 * Shanghai Maritime University(上海 Maritime 大学) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院) Xi’an Jiaotong Liverpool University(西安交通大学利物浦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 Main Conference. 22 pages, 3 figures, 13 tables. GitHub: github.com/yuboxie/chime

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01164 2025-10-02 cs.CL cs.AI cs.CY cs.HC 86%

Social Welfare Function Leaderboard: When LLM Agents Allocate Social Welfare

Zhengliang Shi, Ruotian Ma, Jen-tse Huang, Xinbei Ma, Xingyu Chen, Mengru Wang, Qu Yang, Yue Wang, Fanghua Ye, Ziyang Chen, Shanyi Wang, Cixing Li, Wenxuan Wang, Zhaopeng Tu, Xiaolong Li, Zhaochun Ren, Linus

机构 * Tencent(腾讯)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20097 2025-10-02 cs.CL cs.AI 86%

Integrated Framework for LLM Evaluation with Answer Generation

Sujeong Lee, Hayoung Lee, Seongsoo Heo, Wonik Choi

机构 * Inha University(成均馆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 16pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07132 2025-10-02 cs.LG cs.CL 86%

LLM-based feature generation from text for interpretable machine learning

Vojtěch Balek, Lukáš Sýkora, Vilém Sklenák, Tomáš Kliegr

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Journal ref Machine Learning (2025) 114:241

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00844 2025-10-02 cs.AI 85%

Learning Compact Representations of LLM Abilities via Item Response Theory

Jianhao Chen, Chenxu Wang, Gengrui Zhang, Peng Ye, Lei Bai, Wei Hu, Yuzhong Qu, Shuyue Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Department of Psychology, University of Southern California(美国南加州大学心理学系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00797 2025-10-02 cs.CV cs.AI 85%

Solar PV Installation Potential Assessment on Building Facades Based on Vision and Language Foundation Models

Ruyu Liu, Dongxu Zhuang, Jianhua Zhang, Arega Getaneh Abate, Per Sieverts Nielsen, Ben Wang, Xiufeng Liu

机构 * Technical University of Denmark(技术大学)

专题命中 评测与基准 :foundation model(title);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00324 2025-10-02 cs.SE cs.IR cs.LG 85%

Which Programming Language and Model Work Best With LLM-as-a-Judge For Code Retrieval?

Lucas Roberts, Denisa Roberts

机构 * Independent Researcher(独立研究者) New York University(纽约大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Accepted as a full paper at SIGIR-AP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19136 2025-10-02 cs.SE cs.AI 85%

On the Soundness and Consistency of LLM Agents for Executing Test Cases Written in Natural Language

Sébastien Salva, Redha Taguelmimt

机构 * LIMOS - UMR CNRS 6158, Clermont Auvergne University, UCA, Aubière, France(克莱蒙特奥弗涅大学) Department of Computing, Main University, MySecondTown, MyCountry(计算机系,主大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18980 2025-10-02 cs.AI cs.HC cs.IR 85%

From latent factors to language: a user study on LLM-generated explanations for an inherently interpretable matrix-based recommender system

Maxime Manderlier, Fabian Lecron, Olivier Vu Thanh, Nicolas Gillis

机构 * Department of Technological Innovation Management, Faculty of Engineering, University of Mons (UMONS), Mons, Belgium(蒙斯大学工程学院技术创新管理系) Department of Mathematics and Operational Research, Faculty of Engineering, University of Mons (UMONS), Mons, Belgium(蒙斯大学工程学院数学与运筹学系) Department of Mathematics(数学系) Operational Research, Faculty of Engineering, University of Mons (UMONS), Mons, Belgium(运筹学系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Journal ref In Proceedings of the 12th Joint Workshop on Interfaces and Human Decision Making for Recommender Systems (IntRS 2025) co-located with 19th ACM Conference on Recommender Systems (RecSys 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25413 2025-10-02 cs.CV 82%

DepthLM: Metric Depth From Vision Language Models

Zhipeng Cai, Ching-Feng Yeh, Hu Xu, Zhuang Liu, Gregory Meyer, Xinjie Lei, Changsheng Zhao, Shang-Wen Li, Vikas Chandra, Yangyang Shi

机构 * Meta Princeton University(普林斯顿大学)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03748 2025-10-02 cs.LG cs.AI cs.CL 82%

TDBench: A Benchmark for Top-Down Image Understanding with Reliability Analysis of Vision-Language Models

Kaiyuan Hou, Minghui Zhao, Lilin Xu, Yuang Fan, Xiaofan Jiang

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01052 2025-10-02 cs.CL cs.AI 81%

Hybrid Dialogue State Tracking for Persian Chatbots: A Language Model-Based Approach

Samin Mahdipour Aghabagher, Saeedeh Momtazi

机构 * Computer Engineering Department, Amirkabir University of Technology(阿米尔卡比尔技术大学计算机工程系)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

Comments 22 pages, 1 figure. Submitted to Natural Language Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01179 2025-10-02 cs.LG cs.AI cs.CL 80%

TOUCAN: Synthesizing 1.5M Tool-Agentic Data from Real-World MCP Environments

Zhangchen Xu, Adriana Meza Soria, Shawn Tan, Anurag Roy, Ashish Sunil Agrawal, Radha Poovendran, Rameswar Panda

机构 * University of Washington(华盛顿大学) MIT-IBM Watson AI Lab(MIT-IBM Watson人工智能实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 35 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11726 2025-10-02 cs.CL 79%

Investigating Gender Bias in Turkish Language Models

Orhun Mersin Caglidil, Malte Ostendorff, Georg Rehm

机构 * German Research Center for Artificial Intelligence (DFKI) Berlin, Germany(德国人工智能研究中心(DFKI)柏林)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments arXiv admin note: text overlap with arXiv:1903.10561 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00311 2025-10-02 cs.CL 79%

CORTEX: Collaborative LLM Agents for High-Stakes Alert Triage

Bowen Wei, Yuan Shen Tay, Howard Liu, Jinhao Pan, Kun Luo, Ziwei Zhu, Chris Jordan

机构 * George Mason University(乔治·马歇尔大学) Fluency Security(流畅安全)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00694 2025-10-02 cs.CL cs.AI cs.IR 79%

ALARB: An Arabic Legal Argument Reasoning Benchmark

Harethah Abu Shairah, Somayah AlHarbi, Abdulaziz AlHussein, Sameer Alsabea, Omar Shaqaqi, Hebah AlShamlan, Omar Knio, George Turkiyyah

机构 * King Abdullah University of Science and Technology(卡塔尔国王阿卜杜勒阿齐兹科学与技术大学) THIQAH

专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

Comments Accepted paper at ArabicNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00561 2025-10-02 cs.CV 78%

Assessing Foundation Models for Mold Colony Detection with Limited Training Data

Henrik Pichler, Janis Keuper, Matthew Copping

机构 * Offenburg University of Applied Sciences(奥芬堡应用科学大学) BioStates GmbH(BioStates公司)

专题命中 评测与基准 :foundation model(title,abstract)

Comments 17 pages, 2 figures, accepted as oral presentation at GCPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00414 2025-10-02 cs.HC 78%

RELATE-Sim: Leveraging Turning Point Theory and LLM Agents to Predict and Understand Long-Term Relationship Dynamics through Interactive Narrative Simulations

Matthew Yue, Zhikun Xu, Vivek Gupta, Thao Ha, Liesal Sharabi, Ben Zhou

专题命中 评测与基准 :LLM(title,abstract)

Comments 10 pages, 3 figures, Submitted to CHI 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09746 2025-10-02 cs.SD eess.AS 78%

Deep Learning for Tuberculosis Screening in a High-burden Setting using Cough Analysis and Speech Foundation Models

Ning Ma, Bahman Mirheidari, Guy J. Brown, Nsala Sanjase, Minyoi M. Maimbolwa, Solomon Chifwamba, Seke Muzazu, Monde Muyoyeta, Mary Kagujje

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) Centre for Infectious Disease Research in Zambia(赞比亚传染病疾病研究中心)

专题命中 评测与基准 :foundation model(title,abstract)

Comments submitted to IEEE Journal of Biomedical and Health Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25868 2025-10-02 cs.CL 77%

ReFACT: A Benchmark for Scientific Confabulation Detection with Positional Error Annotations

Yindong Wang, Martin Preiß, Margarita Bugueño, Jan Vincent Hoffbauer, Abdullatif Ghajar, Tolga Buz, Gerard de Melo

机构 * Hasso Plattner Institute / University of Potsdam, Germany(霍普夫纳研究所 / 潘托姆大学,德国)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00339 2025-10-02 cs.HC cs.AI cs.CL cs.LG 75%

Navigating the Synchrony-Stability Frontier in Adaptive Chatbots

T. James Brandt

机构 * University of Minnesota(明尼苏达大学)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

Comments pages; 9 tables; 7 figures; code & analysis artifact: https://doi.org/10.5281/zenodo.17238269; under review at ACM IUI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13324 2025-10-02 cs.HC 75%

Designing Psychometric Bias Measures for ChatBots: An Application to Racial Bias Measurement

Mouhacine Benosman

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00908 2025-10-02 cs.IR cs.AI cs.CL 73%

Bridging Language Gaps: Advances in Cross-Lingual Information Retrieval with Multilingual LLMs

Roksana Goworek, Olivia Macmillan-Scott, Eda B. Özyiğit

机构 * The Alan Turing Institute(艾伦·图灵研究所) Queen Mary University of London(伦敦女王学院) University College London(伦敦大学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00691 2025-10-02 cs.CL cs.AI 73%

Inclusive Easy-to-Read Generation for Individuals with Cognitive Impairments

François Ledoyen, Gaël Dias, Alexis Lechervy, Jeremie Pantin, Fabrice Maurel, Youssef Chahir, Elisa Gouzonnat, Mélanie Berthelot, Stanislas Moravac, Armony Altinier, Amy Khairalla

机构 * Université Caen Normandie, ENSICAEN, CNRS, Normandie Univ, GREYC UMR 6072, F-14000 Caen, France(法国卡恩-诺曼底大学、ENSICAEN、法国国家科学研究中心、诺曼底大学、GREYC UMR 6072)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00639 2025-10-02 cs.SD 71%

Reference-free automatic speech severity evaluation using acoustic unit language modelling

Bence Mark Halpern, Tomoki Toda

机构 * Nagoya University(名古屋大学)

专题命中 评测与基准 :language model(title)

Comments 5 pages. Proceedings of the 6th ACM International Conference on Multimedia in Asia Workshops

Journal ref In Proceedings of the 6th ACM International Conference on Multimedia in Asia Workshops (pp. 1-5) (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06589 2025-10-02 cs.CL 70%

Precise Information Control in Long-Form Text Generation

Jacqueline He, Howard Yen, Margaret Li, Shuyue Stella Li, Zhiyuan Zeng, Weijia Shi, Yulia Tsvetkov, Danqi Chen, Pang Wei Koh, Luke Zettlemoyer

机构 * Paul G. Allen School of Computing Science & Engineering, University of Washington(保罗·G·艾伦计算科学与工程学院,华盛顿大学) Princeton Language and Intelligence (PLI), Princeton University(普林斯顿语言与智能(PLI),普林斯顿大学) Allen Institute for AI(艾伦人工智能研究所)

专题命中 评测与基准 :language model(abstract);post-training(abstract);分类 cs.CL

Comments NeurIPS 2025. 66 pages, 8 figures. Code is at https://github.com/jacqueline-he/precise-information-control

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00946 2025-10-02 cs.SE 67%

ChatGPT in Introductory Programming: Counterbalanced Evaluation of Code Quality, Conceptual Learning, and Student Perceptions

Shiza Andleeb, Brandon Kantorski, Jeffrey C. Carver

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments Accepted to SIGCITE'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00932 2025-10-02 cs.PF 67%

Opal: A Modular Framework for Optimizing Performance using Analytics and LLMs

Mohammad Zaeed, Tanzima Z. Islam, Vladimir Inđić

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments 12 pages and 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏