arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-06 至 2025-10-06 共收录 44 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 44 篇

2507.16076 2025-10-06 cs.CL 92%

The Prompt Makes the Person(a): A Systematic Evaluation of Sociodemographic Persona Prompting for Large Language Models

Marlene Lutz, Indira Sen, Georg Ahnert, Elisa Rogers, Markus Strohmaier

机构 * University of Mannheim(曼海姆大学) GESIS - Leibniz Institute for the Social Sciences(莱布尼茨社会科学研究所) Complexity Science Hub Vienna(维也纳复杂科学中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

Comments Accepted to EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02347 2025-10-06 cs.CL cs.AI 91%

Small Language Models for Curriculum-based Guidance

Konstantinos Katharakis, Sippo Rossi, Raghava Rao Mukkamala

机构 * Copenhagen Business School(哥本哈根商学院) Hanken School of Economics(汉肯经济学院)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);large language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02962 2025-10-06 cs.CL 90%

Leave No TRACE: Black-box Detection of Copyrighted Dataset Usage in Large Language Models via Watermarking

Jingqi Zhang, Ruibo Chen, Yingqing Yang, Peihua Mai, Heng Huang, Yan Pang

机构 * Antiquus S. Hippocampus, Natalia Cerebro & Amelie P. Amygdale Department of Computer Science Cranberry-Lemon University Pittsburgh, PA 15213, USA(计算机科学系,Cranberry-Lemon大学) Ji Q. Ren & Yevgeny LeNet Department of Computational Neuroscience University of the Witwatersrand Joburg, South Africa(计算神经科学系,沃特瓦特斯兰大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01761 2025-10-06 cs.CL 90%

Same evaluation, more tokens: On the effect of input length for machine translation evaluation using Large Language Models

Tobias Domhan, Dawei Zhu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted at EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02830 2025-10-06 cs.CL cs.AI 90%

Evaluating Large Language Models for IUCN Red List Species Information

Shinya Uryu

机构 * Center for Design-Oriented AI Education and Research(设计导向人工智能教育与研究中心) Tokushima University(德岛大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02663 2025-10-06 cs.LG cs.AI 90%

TutorBench: A Benchmark To Assess Tutoring Capabilities Of Large Language Models

Rakshith S Srinivasa, Zora Che, Chen Bo Calvin Zhang, Diego Mares, Ernesto Hernandez, Jayeon Park, Dean Lee, Guillermo Mangialardi, Charmaine Ng, Ed-Yeremai Hernandez Cardona, Anisha Gunjal, Yunzhong He, Bing Liu, Chen Xing

机构 * Scale AI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02403 2025-10-06 q-bio.QM cs.AI cs.CV 89%

Glaucoma Detection and Structured OCT Report Generation via a Fine-tuned Multimodal Large Language Model

Jalil Jalili, Yashraj Gavhane, Evan Walker, Anna Heinke, Christopher Bowd, Akram Belghith, Massimo A. Fazio, Christopher A. Girkin, C. Gustavo De Moraes, Jeffrey M. Liebmann, Sally L. Baxter, Robert N. Weinreb, Linda M. Zangwill, Mark Christopher

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10150 2025-10-06 cs.CL cs.HC 89%

When Large Language Models are Reliable for Judging Empathic Communication

Aakriti Kumar, Nalin Poungpeth, Diyi Yang, Erina Farrell, Bruce Lambert, Matthew Groh

机构 * Kellogg School of Management(凯洛格管理学院) Northwestern University(西北大学) Northwestern Institute for Complex Systems(西北复杂系统研究所) Stanford University(斯坦福大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02665 2025-10-06 cs.CL 88%

Self-Improvement in Multimodal Large Language Models: A Survey

Shijian Deng, Kai Wang, Tianyu Yang, Harsh Singh, Yapeng Tian

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Toronto(多伦多大学) University of Notre Dame(诺特丹大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22860 2025-10-06 cs.CR cs.AI cs.LG 87%

Permissioned LLMs: Enforcing Access Control in Large Language Models

Bargav Jayaraman, Virendra J. Marathe, Hamid Mozaffari, William F. Shen, Krishnaram Kenthapadi

机构 * Oracle Labs(Oracle实验室) University of Cambridge(剑桥大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02343 2025-10-06 cs.CL cs.AI 86%

$\texttt{BluePrint}$: A Social Media User Dataset for LLM Persona Evaluation and Training

Aurélien Bück-Kaeffer, Je Qin Chooi, Dan Zhao, Maximilian Puelma Touzel, Kellin Pelrine, Jean-François Godbout, Reihaneh Rabbany, Zachary Yang

机构 * McGill University(麦吉尔大学) Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所) Harvard College(哈佛学院) NYU(纽约大学) Université de Montréal(蒙特利尔大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 8 pages, 4 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00415 2025-10-06 q-fin.CP cs.AI cs.CL cs.MA q-fin.PM 86%

MarketSenseAI 2.0: Enhancing Stock Analysis through LLM Agents

George Fatouros, Kostas Metaxas, John Soldatos, Manos Karathanassis

机构 * George Fatouros 1,2(乔治·法图罗斯(1,2)) Kostas Metaxas 1,3(科斯塔斯·梅塔克斯(1,3)) John Soldatos 2(约翰·索拉托斯(2)) Manos Karathanassis 3(曼纳斯·卡拉塔西斯(3))

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 25 pages, 7 figures, Under review at Financial Innovation (FIN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03029 2025-10-06 cs.SE cs.AI 85%

Investigating The Smells of LLM Generated Code

Debalina Ghosh Paul, Hong Zhu, Ian Bayley

机构 * School of Engineering, Computing and Mathematics, Oxford Brookes University(工程、计算与数学学院,奥克斯福德布鲁克斯大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02934 2025-10-06 cs.SE 85%

Model-Agnostic Correctness Assessment for LLM-Generated Code via Dynamic Internal Representation Selection

Thanh Trong Vu, Tuan-Dung Bui, Thu-Trang Nguyen, Son Nguyen, Hieu Dinh Vo

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02534 2025-10-06 cs.SE 80%

ZeroFalse: Improving Precision in Static Analysis with LLMs

Mohsen Iranmanesh, Sina Moradi Sabet, Sina Marefat, Ali Javidi Ghasr, Allison Wilson, Iman Sharafaldin, Mohammad A. Tayebi

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02549 2025-10-06 cs.CL cs.AI 79%

Knowledge-Graph Based RAG System Evaluation Framework

Sicheng Dong, Vahid Zolfaghari, Nenad Petrovic, Alois Knoll

机构 * Technical University of Munich, Robotics, Artificial Intelligence and Embedded Systems(慕尼黑技术大学,机器人,人工智能与嵌入式系统)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02335 2025-10-06 cs.CL cs.AI 79%

FormalML: A Benchmark for Evaluating Formal Subgoal Completion in Machine Learning Theory

Xiao-Wen Yang, Zihao Zhang, Jianuo Cao, Zhi Zhou, Zenan Li, Lan-Zhe Guo, Yuan Yao, Taolue Chen, Yu-Feng Li, Xiaoxing Ma

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Department of Computer Science, ETH Zurich, Switzerland(瑞士苏黎世联邦理工学院计算机科学系) School of Computing and Mathematical Sciences, Birkbeck, University of London, UK(伦敦大学伯克贝克学院计算与数学科学学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01227 2025-10-06 cs.CL cs.LG math.HO 79%

EEFSUVA: A New Mathematical Olympiad Benchmark

Nicole N Khatibi, Daniil A. Radamovich, Michael P. Brenner

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 16 Pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00038 2025-10-06 cs.LG cs.AI cs.CY 79%

DM-Bench: Benchmarking LLMs for Personalized Decision Making in Diabetes Management

Maria Ana Cardei, Josephine Lamp, Mark Derdzinski, Karan Bhatia

机构 * University of Virginia(弗吉尼亚大学) Dexcom(德科姆公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14052 2025-10-06 cs.IR cs.AI cs.CL 79%

FinAgentBench: A Benchmark Dataset for Agentic Retrieval in Financial Question Answering

Chanyeol Choi, Jihoon Kwon, Alejandro Lopez-Lira, Chaewoon Kim, Minjae Kim, Juneha Hwang, Jaeseon Ha, Hojun Choi, Suyeol Yun, Yongjin Kim, Yongjae Lee

机构 * University of Florida(佛罗里达大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01903 2025-10-06 cs.CL cs.LG cs.PL 79%

Understanding How CodeLLMs (Mis)Predict Types with Activation Steering

Francesca Lucchetti, Arjun Guha

机构 * Khoury College of Computer Sciences(科里学院计算机科学系) Northeastern University(东北大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

Comments 40 pages, 67 figures. To be published at BlackBoxNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02909 2025-10-06 cs.CV 78%

Training-Free Out-Of-Distribution Segmentation With Foundation Models

Laith Nayal, Hadi Salloum, Ahmad Taha, Yaroslav Kholodov, Alexander Gasnikov

机构 * Laboratory of Multimodal Research In Industry, AI Institute, Innopolis University(工业多模态研究实验室,人工智能研究所,因诺普利斯大学) Phystech School of Applied Mathematics and Computer Science, Moscow Institute of Physics and Technology(物理与技术莫斯科应用数学与计算机科学学院,莫斯科物理技术学院) Research Center for Artificial Intelligence, Innopolis University(人工智能研究中心,因诺普利斯大学) Q Deep, Innopolis(Q深度,因诺普利斯) Machine Learning and Data Representation Lab, Innopolis University(机器学习与数据表示实验室,因诺普利斯大学)

专题命中 评测与基准 :foundation model(title,abstract)

Comments 12 pages, 5 figures, 2 tables, ICOMP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00907 2025-10-06 cs.AI 77%

Grounding Multimodal LLMs to Embodied Agents that Ask for Help with Reinforcement Learning

Ram Ramrakhya, Matthew Chang, Xavier Puig, Ruta Desai, Zsolt Kira, Roozbeh Mottaghi

机构 * Georgia Institute of Technology(佐治亚理工学院) Meta FAIR

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02352 2025-10-06 cs.CL cs.AI 73%

Evaluating Bias in Spoken Dialogue LLMs for Real-World Decisions and Recommendations

Yihao Wu, Tianrui Wang, Yizhou Peng, Yi-Wen Chao, Xuyi Zhuang, Xinsheng Wang, Shunshun Yin, Ziyang Ma

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Soul AI Lab, China(灵魂AI实验室,中国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03154 2025-10-06 cs.CL 70%

EditLens: Quantifying the Extent of AI Editing in Text

Katherine Thai, Bradley Emi, Elyas Masrour, Mohit Iyyer

机构 * Pangram Labs(Pangram实验室) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02742 2025-10-06 cs.CL 70%

IndiCASA: A Dataset and Bias Evaluation Framework in LLMs Using Contrastive Embedding Similarity in the Indian Context

Santhosh G S, Akshay Govind S, Gokul S Krishnan, Balaraman Ravindran, Sriraam Natarajan

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted at 8th AAAI/ACM Conference on AI, Ethics, and Society (AIES) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02374 2025-10-06 cs.CR cs.AI 70%

A Hybrid CAPTCHA Combining Generative AI with Keystroke Dynamics for Enhanced Bot Detection

Ayda Aghaei Nia

机构 * Institute for Artificial Intelligence University of Technology(人工智能研究所 技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23263 2025-10-06 cs.AI 70%

GUI-PRA: Process Reward Agent for GUI Tasks

Tao Xiong, Xavier Hu, Yurun Chen, Yuhang Liu, Changqiao Wu, Pengzhi Gao, Wei Liu, Jian Luan, Shengyu Zhang

机构 * Zhejiang University(浙江大学) MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02790 2025-10-06 cs.CV cs.CL 70%

From Long Videos to Engaging Clips: A Human-Inspired Video Editing Framework with Multimodal Narrative Understanding

Xiangfeng Wang, Xiao Li, Yadong Wei, Xueyu Song, Yang Song, Xiaoqiang Xia, Fangrui Zeng, Zaiyi Chen, Liu Liu, Gu Xu, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学) ByteDance China(字节跳动中国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11400 2025-10-06 cs.CL 70%

On the Diminishing Returns of Complex Robust RAG Training in the Era of Powerful LLMs

Hanxing Ding, Shuchang Tao, Liang Pang, Zihao Wei, Liwei Chen, Kun Xu, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Institute of Computing Technology(计算技术研究所)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.CL

Comments Accepted at SIGIR-AP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏