arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32207 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32207 篇

2510.10762 2025-10-14 cs.CL stat.AP 88%

Large Language Models for Full-Text Methods Assessment: A Case Study on Mediation Analysis

Wenqing Zhang, Trang Nguyen, Elizabeth A. Stuart, Yiqun T. Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02359 2025-10-14 cs.CL 88%

Add-One-In: Incremental Sample Selection for Large Language Models via a Choice-Based Greedy Paradigm

Zhuo Li, Yuhao Du, Xiaoqi Jiao, Yiwen Guo, Yuege Feng, Xiang Wan, Anningzhe Gao, Jinpeng Hu

机构 * Shenzhen International Center for Industrial and Applied Mathematics(深圳工业与应用数学国际中心) Shenzhen Research Institute of Big Data(深圳大数据研究 institute) The Chinese University of Hong Kong Shenzhen(香港中文大学(深圳)) LIGHTSPEED STUDIOS Birmingham City University(伯明翰城市大学) Hefei University of Technology(合肥工业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01444 2025-10-10 cs.CR cs.AI 88%

PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization

Aofan Liu, Lulu Tang, Ting Pan, Yuguo Yin, Bin Wang, Ao Yang

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments Accepted to IEEE International Conference on Multimedia and Expo (ICME) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09278 2025-10-09 cs.CV cs.AI 88%

Towards a Multimodal Large Language Model with Pixel-Level Insight for Biomedicine

Xiaoshuang Huang, Lingdong Shen, Jia Liu, Fangxin Shang, Hongxiang Li, Haifeng Huang, Yehui Yang

机构 * Baidu Inc.(百度公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments Accepted by AAAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06430 2025-10-09 cs.CL 88%

MathRobust-LV: Evaluation of Large Language Models' Robustness to Linguistic Variations in Mathematical Reasoning

Neeraja Kirtane, Yuvraj Khanna, Peter Relan

机构 * Got It Education(Got It 教育)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04155 2025-10-09 cs.CL 88%

GlotEval: A Test Suite for Massively Multilingual Evaluation of Large Language Models

Hengyu Luo, Zihao Li, Joseph Attieh, Sawal Devkota, Ona de Gibert, Xu Huang, Shaoxiong Ji, Peiqin Lin, Bhavani Sai Praneeth Varma Mantina, Ananda Sreenidhi, Raúl Vázquez, Mengjie Wang, Samea Yusofi, Fei Yuan, Jörg Tiedemann

机构 * University of Helsinki(赫尔辛基大学) Technical University of Darmstadt(达姆施塔特技术大学) University of Munich(慕尼黑大学) Nanjing University(南京大学) ELLIS Institute Finland(芬兰ELLIS研究所) University of Turku(图尔库大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP demo 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19017 2025-10-09 cs.CL 88%

Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models

Bin Zhu, Yinxuan Gui, Huiyan Qi, Jingjing Chen, Chong-Wah Ngo, Ee-Peng Lim

机构 * Singapore Management University(新加坡管理大学) Fudan University(复旦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Project website: https://yxg1005.github.io/GaslightingNegationAttacks/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03408 2025-10-08 cs.CL cs.CV 88%

Trajectory Prediction Meets Large Language Models: A Survey

Yi Xu, Ruining Yang, Yitian Zhang, Jianglin Lu, Mingyuan Zhang, Yizhou Wang, Lili Su, Yun Fu

机构 * Department of Electrical and Computer Engineering, Northeastern University(电气与计算机工程系,东北大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 16 pages, GitHub: https://github.com/colorfulfuture/Awesome-Trajectory-Motion-Prediction-Papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23500 2025-10-07 cs.SE cs.CL cs.DL 88%

Identity resolution of software metadata using Large Language Models

Eva Martín del Pico, Josep Lluís Gelpí, Salvador Capella-Gutiérrez

机构 * Barcelona Supercomputing Center, Barcelona, Spain(巴塞罗那超级计算中心) Department of Biochemistry and Molecular Biology, University of Barcelona, Barcelona, Spain(生物化学与分子生物学系,巴塞罗那大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02665 2025-10-06 cs.CL 88%

Self-Improvement in Multimodal Large Language Models: A Survey

Shijian Deng, Kai Wang, Tianyu Yang, Harsh Singh, Yapeng Tian

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Toronto(多伦多大学) University of Notre Dame(诺特丹大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01576 2025-10-03 cs.CV cs.AI cs.HC 88%

Guiding Multimodal Large Language Models with Blind and Low Vision People Visual Questions for Proactive Visual Interpretations

Ricardo Gonzalez Penuela, Felipe Arias-Russi, Victor Capriles

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 7 pages, 2 figure, 2 tables, CV4A11y Workshop at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01286 2025-10-03 cs.CY cs.AI 88%

Emergent evaluation hubs in a decentralizing large language model ecosystem

Manuel Cebrian, Tomomi Kito, Raul Castro Fernandez

机构 * Center for Automation and Robotics, Spanish National Research Council, Spain(自动化与机器人中心,西班牙国家研究理事会) Graduate School of Creative Science and Engineering, Waseda University, Japan(创意科学与工程研究生院,早稻田大学) Department of Computer Science, University of Chicago, USA(计算机科学系,芝加哥大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 15 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00567 2025-10-02 cs.CL 88%

Are Large Language Models Chronically Online Surfers? A Dataset for Chinese Internet Meme Explanation

Yubo Xie, Chenkai Wang, Zongyang Ma, Fahui Miao

机构 * Shanghai Maritime University(上海 Maritime 大学) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院) Xi’an Jiaotong Liverpool University(西安交通大学利物浦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 Main Conference. 22 pages, 3 figures, 13 tables. GitHub: github.com/yuboxie/chime

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24888 2025-09-30 cs.CV cs.CL 88%

MMRQA: Signal-Enhanced Multimodal Large Language Models for MRI Quality Assessment

Fankai Jia, Daisong Gan, Zhe Zhang, Zhaochi Wen, Chenchen Dan, Dong Liang, Haifeng Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) ShanghaiTech University(上海理工大学) Southern University of Science and Technology(南方科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23579 2025-09-30 cs.CL 88%

Jackal: A Real-World Execution-Based Benchmark Evaluating Large Language Models on Text-to-JQL Tasks

Kevin Frank, Anmol Gulati, Elias Lumer, Sindy Campagna, Vamse Kumar Subbiah

机构 * PricewaterhouseCoopers(普华永道)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02648 2025-09-30 cs.AI 88%

Truly Assessing Fluid Intelligence of Large Language Models through Dynamic Reasoning Evaluation

Yue Yang, MingKang Chen, Qihua Liu, Mengkang Hu, Qiguang Chen, Gengrui Zhang, Shuyue Hu, Guangtao Zhai, Yu Qiao, Yu Wang, Wenqi Shao, Ping Luo

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) The University of Hong Kong(香港大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19566 2025-09-25 cs.AI q-bio.GN 88%

Nano Bio-Agents (NBA): Small Language Model Agents for Genomics

George Hong, Daniel Trejo Banos

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02737 2025-09-25 cs.CL 88%

Large Language Models for Multilingual Previously Fact-Checked Claim Detection

Ivan Vykopal, Matúš Pikuliak, Simon Ostermann, Tatiana Anikina, Michal Gregor, Marián Šimko

机构 * Faculty of Information Technology, Brno University of Technology(布拉格技术大学信息学院) Kempelen Institute of Intelligent Technologies(智能技术研究所) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Centre for European Research in Trusted AI (CERTAIN)(可信人工智能欧洲研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted for the EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18792 2025-09-24 cs.CL 88%

Beyond the Leaderboard: Understanding Performance Disparities in Large Language Models via Model Diffing

Sabri Boughorbel, Fahim Dalvi, Nadir Durrani, Majd Hawasly

机构 * Qatar Computing Research Institute, HBKU(卡塔尔计算研究所,哈瓦那大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 12 pages, accepted to the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18690 2025-09-24 cs.AI 88%

Advances in Large Language Models for Medicine

Zhiyu Kan, Wensheng Gan, Zhenlian Qi, Philip S. Yu

机构 * Jinan University(济南大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments Preprint. 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18420 2025-09-24 cs.AI 88%

Instruction-Following Evaluation in Function Calling for Large Language Models

Nikolai Skripko

机构 * Higher School of Economics(俄罗斯高等经济学院) SberDevices

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11101 2025-09-24 cs.CL 88%

Seeing is Not Understanding: A Benchmark on Perception-Cognition Disparities in Large Language Models

Haokun Li, Yazhou Zhang, Jizhi Ding, Qiuchi Li, Peng Zhang

机构 * Tianjin University(天津大学) Shandong Institute of Petroleum and Chemical Technology(山东石油化学工业技术研究所) Beijing Institute of Technology(北京理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments I need to modify the content of the article

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13707 2025-09-24 cs.CV cs.AI 88%

EventVL: Understand Event Streams via Multimodal Large Language Model

Pengteng Li, Yunfan Lu, Pinghao Song, Wuyang Li, Huizai Yao, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) KU Leuven(根特大学) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Carleton University(卡尔顿大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17938 2025-09-23 cs.CL 88%

D-REX: A Benchmark for Detecting Deceptive Reasoning in Large Language Models

Satyapriya Krishna, Andy Zou, Rahul Gupta, Eliot Krzysztof Jones, Nick Winter, Dan Hendrycks, J. Zico Kolter, Matt Fredrikson, Spyros Matsoukas

机构 * Amazon Nova Responsible AI(亚马逊Nova负责任的人工智能) Center for AI Safety(人工智能安全中心) CMU(卡内基梅隆大学) Gray Swan AI(灰天鹅人工智能)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15218 2025-09-19 cs.CL 88%

LNE-Blocking: An Efficient Framework for Contamination Mitigation Evaluation on Large Language Models

Ruijie Hou, Yueyang Jiao, Hanxu Hu, Yingming Li, Wai Lam, Huajian Zhang, Hongyuan Lu

机构 * Zhejiang University(浙江大学) FaceMind Corporation(FaceMind公司) University of Zurich(苏黎世大学) The Chinese University of Hong Kong(香港中文大学) Westlake University(西湖大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15114 2025-09-19 cs.CL 88%

Large Language Model probabilities cannot distinguish between possible and impossible language

Evelina Leivada, Raquel Montero, Paolo Morosi, Natalia Moskvina, Tamara Serrano, Marcel Aguilar, Fritz Guenther

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14922 2025-09-19 cs.CL 88%

A Comparative Evaluation of Large Language Models for Persian Sentiment Analysis and Emotion Detection in Social Media Texts

Kian Tohidi, Kia Dashtipour, Simone Rebora, Sevda Pourfaramarz

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 19 pages, 8 Figures, 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14546 2025-09-19 cs.AI 88%

Rationality Check! Benchmarking the Rationality of Large Language Models

Zhilun Zhou, Jing Yi Wang, Nicholas Sukiennik, Chen Gao, Fengli Xu, Yong Li, James Evans

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系、BNRist、清华大学) Department of Sociology, University of Chicago(社会学系、芝加哥大学) Santa Fe Institute(圣菲研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00269 2025-09-18 cs.CL 88%

A review of faithfulness metrics for hallucination assessment in Large Language Models

Ben Malin, Tatiana Kalganova, Nikoloas Boulgouris

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);prompting(abstract)

Comments 13 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07107 2025-09-18 cs.CL cs.IR 88%

Large Language Models for Information Retrieval: A Survey

Yutao Zhu, Huaying Yuan, Shuting Wang, Jiongnan Liu, Wenhan Liu, Chenlong Deng, Haonan Chen, Zheng Liu, Zhicheng Dou, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence and School of Information, Renmin University of China(中国人民大学信息学院和首都人工智能学院) Beijing Academy of Artificial Intelligence, China(北京人工智能研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Updated to version 4; Accepted by ACM TOIS

详情

展开后加载摘要…

URL PDF HTML 收藏