arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-17 至 2025-10-17 共收录 228 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 53 篇

2508.08180 2025-10-17 eess.IV cs.AI cs.CV 79%

RedDino: A foundation model for red blood cell analysis

Luca Zedda, Andrea Loddo, Cecilia Di Ruberto, Carsten Marr

机构 * Department of Mathematics and Computer Science, University of Cagliari(卡利亚里大学数学与计算机科学系) Institute of AI for Health, Helmholtz Munich(健康人工智能研究所,海德堡大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03550 2025-10-17 cs.CL 79%

Beyond the Surface: Enhancing LLM-as-a-Judge Alignment with Human via Internal Representations

Peng Lai, Jianjie Zheng, Sijie Cheng, Yun Chen, Peng Li, Yang Liu, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Tsinghua University(清华大学) Shanghai University of Finance and Economics(上海金融学院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14944 2025-10-17 cs.CL cs.AI cs.CE 79%

MetaBench: A Multi-task Benchmark for Assessing LLMs in Metabolomics

Yuxing Lu, Xukai Zhao, J. Ben Tamo, Micky C. Nnamdi, Rui Peng, Shuang Zeng, Xingyu Hu, Jinzhuo Wang, May D. Wang

机构 * Wallace H. Coulter Department of Biomedical Engineering, Georgia Institute of Technology and Emory University(沃克生物医学工程部门,佐治亚理工学院和埃默里大学) College of Future of Technology, Peking University(未来技术学院,北京大学) School of Architecture, Tsinghua University(建筑学院,清华大学) School of Electrical and Computer Engineering, Georgia Institute of Technology(电气与计算机工程学院,佐治亚理工学院) School of Computer Science, Georgia Institute of Technology(计算机科学学院,佐治亚理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 22 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14763 2025-10-17 cs.CL cs.AI 79%

COIG-Writer: A High-Quality Dataset for Chinese Creative Writing with Thought Processes

Yunwen Li, Shuangshuang Ying, Xingwei Qu, Xin Li, Sheng Jin, Minghao Liu, Zhoufutu Wen, Tianyu Zheng, Xeron Du, Qiguang Chen, Jiajun Shi, Wangchunshu Zhou, Jiazhan Feng, Wanjun Zhong, Libo Qin, Stephen Huang, Wanxiang Che, Chenghua Lin, Eli Zhang

机构 * M-A-P 2077AI

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14242 2025-10-17 cs.CL cs.LG 79%

Flip-Flop Consistency: Unsupervised Training for Robustness to Prompt Perturbations in LLMs

Parsa Hejabi, Elnaz Rahmati, Alireza S. Ziabari, Morteza Dehghani

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 14 pages, 6 figures, 3 tables, and 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13885 2025-10-17 cs.CL cs.AI 79%

Order from Chaos: Comparative Study of Ten Leading LLMs on Unstructured Data Categorization

Ariel Kamen

机构 * RingCentral(RingCentral公司) UC Davis(加州大学戴维斯分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 4 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09011 2025-10-17 cs.AI cs.CL 79%

TripScore: Benchmarking and rewarding real-world travel planning with fine-grained evaluation

Yincen Qu, Huan Xiao, Feng Li, Gregory Li, Hui Zhou, Xiangying Dai, Xiaoru Dai

机构 * Trip.com Group(Trip.com集团) Chongqing University(重庆大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14532 2025-10-17 cs.CV 78%

Towards Generalist Intelligence in Dentistry: Vision Foundation Models for Oral and Maxillofacial Radiology

Xinrui Huang, Fan Xiao, Dongming He, Anqi Gao, Dandan Li, Xiaofan Zhang, Shaoting Zhang, Xudong Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Ninth People’s Hospital, Shanghai Jiao Tong University School of Medicine, Department of Oral Craniomaxillofacial(上海第九人民医院,上海交通大学医学院,口腔颅面医学部) Shanghai Jiao Tong University, School of Computer Science(上海交通大学,计算机科学学院) University of Electronic Science and Technology of China, School of Mechanical and Electrical Engineering(电子科技大学,机械与电子工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University, College of Stomatology(上海交通大学,口腔医学院) National Center for Stomatology(国家口腔医学中心) National Clinical Medical Research Center for Oral Diseases(国家口腔疾病临床医学研究中心) Shanghai Key Laboratory of Stomatology(上海口腔医学重点实验室) Shanghai Research Institute of Stomatology(上海口腔研究所) Chinese Academy of Medical Science, Research Unit of Oral and Maxillofacial Regenerative Medicine(中国医学科学院,口腔颌面再生医学研究单元)

专题命中 评测与基准 :foundation model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14036 2025-10-17 cs.SE cs.AI 77%

One Bug, Hundreds Behind: LLMs for Large-Scale Bug Discovery

Qiushi Wu, Yue Xiao, Dhilung Kirat, Kevin Eykholt, Jiyong Jang, Douglas Lee Schales

机构 * IBM Research(IBM研究院) William & Mary(威廉与玛丽大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20934 2025-10-17 cs.SE cs.AI 77%

Leveraging LLMs, IDEs, and Semantic Embeddings for Automated Move Method Refactoring

Abhiram Bellur, Fraol Batole, Mohammed Raihan Ullah, Malinda Dilhara, Yaroslav Zharov, Timofey Bryksin, Kai Ishikawa, Haifeng Chen, Masaharu Morimoto, Shota Motoura, Takeo Hosomi, Tien N. Nguyen, Hridesh Rajan, Nikolaos Tsantalis, Danny Dig

机构 * University of Colorado(科罗拉多大学) Tulane University(路易斯安那州立大学) Amazon Web Services(亚马逊网络服务) JetBrains Research(JetBrains研究) NEC Corporation(日本电报电话公司) NEC Laboratories America(日本电报电话美洲实验室) University of Texas at Dallas(德克萨斯大学达拉斯分校) Concordia University(康科迪亚大学) University of Colorado, JetBrains Research(科罗拉多大学,JetBrains研究)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Published at the International Conference on Software Maintenance and Evolution (ICSME'25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16191 2025-10-17 cs.SE cs.AI 77%

The Last Dependency Crusade: Solving Python Dependency Conflicts with LLMs

Antony Bartlett, Cynthia Liem, Annibale Panichella

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Pre-print - Accepted at the first annual workshop on Agentic Software Engineering (AgenticSE) co-located with ASE'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18583 2025-10-17 cs.LG 77%

Benchmarking drug-drug interaction prediction methods: a perspective of distribution changes

Zhenqian Shen, Mingyang Zhou, Yongqi Zhang, Quanming Yao

机构 * Department of Electrical Engineering(电气工程系) State Key laboratory of Space Network(空间网络与通信国家重点实验室) The Hong Kong University of Science(香港科学大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13835 2025-10-17 cs.CL cs.AI 76%

ConDABench: Interactive Evaluation of Language Models for Data Analysis

Avik Dutta, Priyanshu Gupta, Hosein Hasanbeig, Rahul Pratap Singh, Harshit Nigam, Sumit Gulwani, Arjun Radhakrishna, Gustavo Soares, Ashish Tiwari

机构 * Microsoft(微软)

专题命中 评测与基准 :language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14621 2025-10-17 cs.AI cs.CL 73%

ColorBench: Benchmarking Mobile Agents with Graph-Structured Framework for Complex Long-Horizon Tasks

Yuanyi Song, Heyuan Huang, Qiqiang Lin, Yin Zhao, Xiangmou Qu, Jun Wang, Xingyu Lou, Weiwen Liu, Zhuosheng Zhang, Jun Wang, Yong Yu, Weinan Zhang, Zhaoxiang Wang

机构 * Shanghai Jiao Tong University(上海交通大学) OPPO

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04137 2025-10-17 cs.CL cs.LG 73%

Detecting Token-Level Hallucinations Using Variance Signals: A Reference-Free Approach

Keshav Kumar

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04426 2025-10-17 cs.CL cs.AI cs.CY 73%

The simulation of judgment in LLMs

Edoardo Loru, Jacopo Nudo, Niccolò Di Marco, Alessandro Santirocchi, Roberto Atzeni, Matteo Cinelli, Vincenzo Cestari, Clelia Rossi-Arnaud, Walter Quattrociocchi

机构 * Department of Computer, Control and Management Engineering, Sapienza University of Rome(计算机、控制与管理工程系,罗马萨皮恩扎大学) Department of Computer Science, Sapienza University of Rome(计算机科学系,罗马萨皮恩扎大学) Department of Legal, Social, and Educational Sciences, Tuscia University(法律、社会与教育科学系,图斯西亚大学) Department of Psychology, Sapienza University of Rome(心理学系,罗马萨皮恩扎大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Please refer to published version: https://doi.org/10.1073/pnas.2518443122

Journal ref Proc. Natl. Acad. Sci. U.S.A. 122 (42) e2518443122, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17439 2025-10-17 cs.CL cs.AI 73%

AI-generated Essays: Characteristics and Implications on Automated Scoring and Academic Integrity

Yang Zhong, Jiangang Hao, Michael Fauss, Chen Li, Yuan Wang

机构 * University of Pittsburgh(匹兹堡大学) ETS Research Institute(教育考试服务中心研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05966 2025-10-17 cs.CL cs.AI 73%

Natural Language Processing RELIES on Linguistics

Juri Opitz, Shira Wein, Nathan Schneider

机构 * University of Zurich(苏黎世大学) Amherst College(阿默斯特学院) Georgetown University(乔治城大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Appeared in Computational Linguistics. Journal version at https://doi.org/10.1162/coli_a_00560

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14560 2025-10-17 cs.CV 71%

Eyes Wide Open: Ego Proactive Video-LLM for Streaming Video

Yulin Zhang, Cheng Shi, Yang Wang, Sibei Yang

机构 * ShanghaiTech University(上海科技大学) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Computing and Data Science, The University of Hong Kong(香港大学计算科学与数据科学学院)

专题命中 评测与基准 :LLM(title)

Comments Accepted at NeurIPS 2025 (preview; camera-ready in preparation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13911 2025-10-17 q-bio.QM 71%

OralGPT: A Two-Stage Vision-Language Model for Oral Mucosal Disease Diagnosis and Description

Jia Zhang, Bodong Du, Yitong Miao, Dongwei Sun, Xiangyong Cao

专题命中 评测与基准 :language model(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16601 2025-10-17 cs.CV eess.IV 71%

MetaQAP - A Meta-Learning Approach for Quality-Aware Pretraining in Image Quality Assessment

Nisar Ahmed, Gulshan Saleem, Nazik Alturki, Nada Alasbali

机构 * Department of Informatics and Systems(信息学与系统系) University of Management and Technology(管理与技术大学) Faculty of Information Technology and Computer Science(信息技术与计算机科学学院) University of Central Punjab(中央理工大学) Department of Information Systems(信息系统系) College of Computer and Information Sciences(计算机与信息科学学院) Princess Nourah bint Abdulrahman University(努拉·阿卜杜勒拉赫曼女王大学) Department of Informatics and Computer Systems(信息学与计算机系统系) College of Computer Science(计算机科学学院) King Khalid University(卡利德大学)

专题命中 评测与基准 :pretraining(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14937 2025-10-17 cs.CL 70%

AI-Powered Early Diagnosis of Mental Health Disorders from Real-World Clinical Conversations

Jianfeng Zhu, Julina Maharjan, Xinyu Li, Karin G. Coifman, Ruoming Jin

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL

Comments 7 pages 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14537 2025-10-17 cs.AI 70%

JSPLIT: A Taxonomy-based Solution for Prompt Bloating in Model Context Protocol

Emanuele Antonioni, Stefan Markovic, Anirudha Shankar, Jaime Bernardo, Lovro Markovic, Silvia Pareti, Benedetto Proietti

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14395 2025-10-17 cs.CL 70%

Suicidal Comment Tree Dataset: Enhancing Risk Assessment and Prediction Through Contextual Analysis

Jun Li, Qun Zhao

机构 * Department of Computing(计算系) The Hong Kong Polytechnic University(香港理工大学) Department of Language Science and Technology(语言科学与技术系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03867 2025-10-17 cs.CL 70%

Drivel-ology: Challenging LLMs with Interpreting Nonsense with Depth

Yang Wang, Chenghao Xiao, Chia-Yi Hsiao, Zi Yan Chang, Chi-Li Chen, Tyler Loakman, Chenghua Lin

机构 * The University of Manchester(曼彻斯特大学) Durham University(杜伦大学) The University of Sheffield(谢菲尔德大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted for oral presentation at the EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16566 2025-10-17 cs.CL 70%

ScholarBench: A Bilingual Benchmark for Abstraction, Comprehension, and Reasoning Evaluation in Academic Contexts

Dongwon Noh, Donghyeok Koh, Junghun Yuk, Gyuwan Kim, Jaeyong Lee, Kyungtae Lim, Cheoneum Park

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13699 2025-10-17 cs.IR cs.AI 70%

A Comprehensive Review of Recommender Systems: Transitioning from Theory to Practice

Shaina Raza, Mizanur Rahman, Safiullah Kamawal, Armin Toroghi, Ananya Raval, Farshad Navah, Amirmohammad Kazemeini

机构 * Vector Institute(向量研究所) Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments we quarterly update of this literature

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13914 2025-10-17 cs.SE 67%

A11YN: aligning LLMs for accessible web UI code generation

Janghan Yoon, Jaegwan Cho, Junhyeok Kim, Jiwan Chung, Jaehyun Jeon, Youngjae Yu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14307 2025-10-17 cs.CL cs.AI 62%

MERLIN: A Testbed for Multilingual Multimodal Entity Recognition and Linking

Sathyanarayanan Ramamoorthy, Vishwa Shah, Simran Khanuja, Zaid Sheikh, Shan Jie, Ann Chia, Shearman Chua, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Defence Science and Technology Agency(国防科学与技术局)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17473 2025-10-17 cs.CV cs.AI cs.CL 62%

InfoDet: A Dataset for Infographic Element Detection

Jiangning Zhu, Yuxing Zhou, Zheng Wang, Juntao Yao, Yima Gu, Yuhui Yuan, Shixia Liu

机构 * BNRist, Tsinghua University(清华大学信息与技术研究院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

Comments Submitted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏