arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-07-25 至 2025-07-25 共收录 32 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32 篇

2507.18392 2025-07-25 cs.CL cs.AI cs.LG 87%

CLEAR: Error Analysis via LLM-as-a-Judge Made Easy

Asaf Yehudai, Lilach Eden, Yotam Perlitz, Roy Bar-Haim, Michal Shmueli-Scheuer

机构 * IBM Research(IBM研究院) The Hebrew University of Jerusalem(特拉维夫大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00838 2025-07-25 cs.CL cs.AI cs.LG 87%

Stylometry recognizes human and LLM-generated texts in short samples

Karol Przystalski, Jan K. Argasiński, Iwona Grabska-Gradzińska, Jeremi K. Ochab

机构 * Sano -- Centre for Computational Medicine(Sano计算医学中心) Faculty of Physics, Astronomy and Applied Computer Science(物理学、天文学与应用计算机科学学院) Applied Computer Science, Jagiellonian University(应用计算机科学,雅盖隆大学) Mark Kac Centre for Complex Systems Research(Mark Kac复杂系统研究中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref Expert Systems with Applications 296, 129001 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17787 2025-07-25 cs.LG cs.AI 86%

Hyperbolic Deep Learning for Foundation Models: A Survey

Neil He, Hiren Madhu, Ngoc Bui, Menglin Yang, Rex Ying

机构 * Yale University(耶鲁大学) Hong Kong University of Science(香港科学大学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 11 Pages, SIGKDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17795 2025-07-25 cs.LG 85%

LSDM: LLM-Enhanced Spatio-temporal Diffusion Model for Service-Level Mobile Traffic Prediction

Shiyuan Zhang, Tong Li, Zhu Xiao, Hongyang Du, Kaibin Huang

机构 * College of Computer Science and Electronic Engineering, Hunan University(计算机科学与电子工程学院,湖南大学) Department of Electrical and Electronic Engineering, University of Hong Kong(电气与电子工程系,香港大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13238 2025-07-25 cs.CL cs.AI 82%

Multilingual LLMs Are Not Multilingual Thinkers: Evidence from Hindi Analogy Evaluation

Ashray Gupta, Rohan Joseph, Sunny Rai

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17951 2025-07-25 cs.CL cs.AI 81%

Are LLM Belief Updates Consistent with Bayes' Theorem?

Sohaib Imran, Ihor Kendiukhov, Matthew Broerman, Aditya Thomas, Riccardo Campanella, Rob Lamb, Peter M. Atkinson

机构 * Lancaster Environment Centre, Lancaster University(兰卡斯特大学环境中心) School of Computing and Communications, Lancaster University(兰卡斯特大学计算机与通信学院) Environmental Science, University of Southampton(索姆塞特大学环境科学系) College of Surveying and Geo-Informatics, Tongji University(同济大学测绘与地理信息学院) University of Tuebingen, Department of Computer Science(图宾根大学计算机科学系) Graduate School of Natural Sciences, Faculty of Science, Utrecht University(乌得勒支大学自然科学研究生院)

专题命中 评测与基准 :LLM(title);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at the ICML 2025 Workshop on Assessing World Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17845 2025-07-25 eess.IV cs.AI cs.CV cs.LG q-bio.QM 81%

Towards Robust Foundation Models for Digital Pathology

Jonah Kömen, Edwin D. de Jong, Julius Hense, Hannah Marienwald, Jonas Dippel, Philip Naumann, Eric Marcus, Lukas Ruff, Maximilian Alber, Jonas Teuwen, Frederick Klauschen, Klaus-Robert Müller

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17788 2025-07-25 cs.LG cs.AI 81%

Adaptive Repetition for Mitigating Position Bias in LLM-Based Ranking

Ali Vardasbi, Gustavo Penha, Claudia Hauff, Hugues Bouchard

机构 * Spotify

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14516 2025-07-25 cs.IR 80%

RMIT-ADM+S at the SIGIR 2025 LiveRAG Challenge

Kun Ran, Shuoqi Sun, Khoi Nguyen Dinh Anh, Damiano Spina, Oleg Zendel

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments SIGIR 2025 LiveRAG winning system

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.10678 2025-07-25 cs.CL cs.LG 79%

Causally Testing Gender Bias in LLMs: A Case Study on Occupational Bias

Yuen Chen, Vethavikashini Chithrra Raghuram, Justus Mattern, Rada Mihalcea, Zhijing Jin

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) RWTH Aachen(亚琛工业大学) University of Michigan(密歇根大学) ETH Zürich(苏黎世联邦理工学院) Max Planck Institute(马克斯·普朗克研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18517 2025-07-25 cs.CV 78%

Object segmentation in the wild with foundation models: application to vision assisted neuro-prostheses for upper limbs

Bolutife Atoki, Jenny Benois-Pineau, Renaud Péteri, Fabien Baldacci, Aymar de Rugy

专题命中 评测与基准 :foundation model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18479 2025-07-25 cs.IR 75%

How Well Do LLMs Predict Prerequisite Skills? Zero-Shot Comparison to Expert-Defined Concepts

Ngoc Luyen Le, Marie-Hélène Abel

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08513 2025-07-25 cs.GR cs.CV 75%

Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation

Liu He, Xiao Zeng, Yizhi Song, Albert Y. C. Chen, Lu Xia, Shashwat Verma, Sankalp Dayal, Min Sun, Cheng-Hao Kuo, Daniel Aliaga

机构 * Purdue University(普渡大学) Amazon(亚马逊)

专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18340 2025-07-25 cs.CL 74%

TDR: Task-Decoupled Retrieval with Fine-Grained LLM Feedback for In-Context Learning

Yifu Chen, Bingchen Huang, Zhiling Wang, Yuanchao Du, Junfeng Luo, Lei Shen, Zhineng chen

专题命中 评测与基准 :LLM(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10371 2025-07-25 cs.CL cs.AI 73%

A Survey of Event Causality Identification: Taxonomy, Challenges, Assessment, and Prospects

Qing Cheng, Zefan Zeng, Xingchen Hu, Yuehang Si, Zhong Liu

机构 * Laboratory for Big Data and Decision(大数据与决策实验室) National University of Defense Technology(国防科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01405 2025-07-25 cs.CL cs.AI cs.CY cs.SI 73%

Quantifying the Uniqueness and Divisiveness of Presidential Discourse

Karen Zhou, Alexander A. Meitus, Milo Chase, Grace Wang, Anne Mykland, William Howell, Chenhao Tan

机构 * Department of Computer Science, The University of Chicago(芝加哥大学计算机科学系) Department of Political Science, The University of Chicago(芝加哥大学政治学系) Harris School of Public Policy, The University of Chicago(芝加哥大学哈里斯公共政策学院) Harvard University(哈佛大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Published in PNAS Nexus: https://academic.oup.com/pnasnexus/article/3/10/pgae431/7814873

Journal ref PNAS Nexus, Volume 3, Issue 10, October 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16809 2025-07-25 cs.CL 70%

LingBench++: A Linguistically-Informed Benchmark and Reasoning Framework for Multi-Step and Cross-Cultural Inference with LLMs

Da-Chen Lian, Ri-Sheng Huang, Pin-Er Chen, Chunki Lim, You-Kuan Lin, Guan-Yu Tseng, Zi-Cheng Yang, Zhen-Yu Lin, Pin-Cheng Chen, Shu-Kai Hsieh

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 42p, 17f, 10t. Revisions: Merged paragraphs in Intro to emphasize contributions. Clarified benchmark design (Sec 3.5.1). Added single-agent, OpenAI-guided & 6-round experiments (Sec 5.2). Note: we only ran each experiment once; statistical tests are needed for strong claims. Revised Sec 6. Added acknowledgements, 2 new co-authors, and corrected typos/grammar

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20658 2025-07-25 cs.CL 70%

Enhancing Transformation from Natural Language to Signal Temporal Logic Using LLMs with Diverse External Knowledge

Yue Fang, Zhi Jin, Jie An, Hongshen Chen, Xiaohong Chen, Naijun Zhan

机构 * School of Computer Science, Peking University(北京大学计算机学院) Key Laboratory of High Confidence Software Technologies (PKU), MOE(高可信软件技术重点实验室(PKU)) National Key Laboratory of Space Integrated Information System, Institute of Software, Chinese Academy of Sciences(空间一体化信息系统国家重点实验室,软件研究所,中国科学院) East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 11 pages, 5 figures, published to ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13102 2025-07-25 cs.IR cs.CL 70%

AIR-Bench: Automated Heterogeneous Information Retrieval Benchmark

Jianlyu Chen, Nan Wang, Chaofan Li, Bo Wang, Shitao Xiao, Han Xiao, Hao Liao, Defu Lian, Zheng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Jina AI(极光科技) Beijing University of Posts and Telecommunications(北京邮电大学) Shenzhen University(深圳大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 32 pages, 6 figures; Accepted to ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18515 2025-07-25 cs.SE 67%

A Deep Dive into Retrieval-Augmented Generation for Code Completion: Experience on WeChat

Zezhou Yang, Ting Peng, Cuiyun Gao, Chaozheng Wang, Hailiang Huang, Yuetang Deng

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments Accepted in ICSME 25 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18342 2025-07-25 cs.CV 67%

EgoExoBench: A Benchmark for First- and Third-person View Video Understanding in MLLMs

Yuping He, Yifei Huang, Guo Chen, Baoqi Pei, Jilan Xu, Tong Lu, Jiangmiao Pang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Tokyo(东京大学) Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17761 2025-07-25 cs.HC 67%

Co-constructing Explanations for AI Systems using Provenance

Jan-Christoph Kalo, Fina Polat, Shubha Guha, Paul Groth

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10062 2025-07-25 cs.SE 67%

LLMShot: Reducing snapshot testing maintenance via LLMs

Ergün Batuhan Kaynak, Mayasah Lami, Sahand Moslemi, Anil Koyuncu

专题命中 评测与基准 :language model(abstract);prompting(abstract)

Comments Accepted to ICSME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07854 2025-07-25 cs.CL cs.AI cs.LG 67%

Tucano: Advancing Neural Text Generation for Portuguese

Nicholas Kluge Corrêa, Aniket Sen, Sophia Falk, Shiza Fatimah

机构 * Rhenish Friedrich Wilhelm University of Bonn(波恩大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17754 2025-07-25 cs.HC cs.AI cs.CL cs.CY 62%

A Custom-Built Ambient Scribe Reduces Cognitive Load and Documentation Burden for Telehealth Clinicians

Justin Morse, Kurt Gilbert, Kyle Shin, Rick Cooke, Peyton Rose, Jack Sullivan, Angelo Sisante

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17896 2025-07-25 cs.CL cs.AI cs.DB 62%

VeriMinder: Mitigating Analytical Vulnerabilities in NL2SQL

Shubham Mohole, Sainyam Galhotra

机构 * Cornell University(康奈尔大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18552 2025-07-25 cs.CV cs.AI 57%

VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding

Baoyao Yang, Wanyun Li, Dixin Chen, Junxiang Chen, Wenbin Yao, Haifeng Lin

机构 * Guangdong University of Technology(广东工业大学) Wechat, Tencent(微信、腾讯)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

Comments 7 pages; 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14314 2025-07-25 cs.CL 57%

What Makes You CLIC: Detection of Croatian Clickbait Headlines

Marija Anđelić, Dominik Šipek, Laura Majer, Jan Šnajder

机构 * University of Zagreb, Faculty of Electrical Engineering and Computing(Zagreb 大学电子工程与计算学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

Comments Accepted at Slavic NLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17979 2025-07-25 cs.LG 57%

SIFOTL: A Principled, Statistically-Informed Fidelity-Optimization Method for Tabular Learning

Shubham Mohole, Sainyam Galhotra

机构 * Cornell University(康奈尔大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08510 2025-07-25 cs.CV cs.LG 57%

External Knowledge Injection for CLIP-Based Class-Incremental Learning

Da-Wei Zhou, Kai-Wen Li, Jingyi Ning, Han-Jia Ye, Lijun Zhang, De-Chuan Zhan

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

Comments Accepted to ICCV 2025. Code is available at: https://github.com/LAMDA-CL/ICCV25-ENGINE

详情

展开后加载摘要…

URL PDF HTML 收藏