arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-12 至 2025-08-12 共收录 69 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 69 篇

2508.07284 2025-08-12 cs.CL cs.AI cs.CY 91%

"Pull or Not to Pull?'': Investigating Moral Biases in Leading Large Language Models Across Ethical Dilemmas

Junchen Ding, Penghao Jiang, Zihao Xu, Ziqi Ding, Yichen Zhu, Jiaojiao Jiang, Yuekang Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08109 2025-08-12 cs.CL cs.AI cs.LG 90%

A Closer Look at Machine Unlearning for Large Language Models

Xiaojian Yuan, Tianyu Pang, Chao Du, Kejiang Chen, Weiming Zhang, Min Lin

机构 * University of Science and Technology of China(中国科学技术大学) Sea AI Lab, Singapore(新加坡Sea AI实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07959 2025-08-12 cs.CL 89%

Large Language Models for Subjective Language Understanding: A Survey

Changhao Song, Yazhou Zhang, Hui Gao, Ben Yao, Peng Zhang

机构 * College of Intelligence and Computing(智能与计算学院) Tianjin University(天津大学) School of Nursing(护理学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07714 2025-08-12 cs.CV cs.AI cs.ET 89%

DoorDet: Semi-Automated Multi-Class Door Detection Dataset via Object Detection and Large Language Models

Licheng Zhang, Bach Le, Naveed Akhtar, Tuan Ngo

机构 * The University of Melbourne(墨尔本大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07283 2025-08-12 cs.HC cs.AI eess.SP q-bio.NC 89%

Fine-Tuning Large Language Models Using EEG Microstate Features for Mental Workload Assessment

Bujar Raufi

机构 * School of Computer Science, Technological University Dublin, Dublin, Ireland(计算机科学学院,都柏林技术大学,都柏林,爱尔兰) Artificial Intelligence and Cognitive Load Lab, Applied Intelligence Research Centre, School of Computer Science, Technological University Dublin, Dublin, Ireland(人工智能与认知负荷实验室,应用智能研究中心,计算机科学学院,都柏林技术大学,都柏林,爱尔兰)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 17 Pages, 7 figures, 3 tables and one prompt template

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07196 2025-08-12 cs.DL cs.AI 89%

Can Smaller Large Language Models Evaluate Research Quality?

Mike Thelwall

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07111 2025-08-12 cs.CL cs.AI 88%

Investigating Intersectional Bias in Large Language Models using Confidence Disparities in Coreference Resolution

Falaah Arif Khan, Nivedha Sivakumar, Yinong Oliver Wang, Katherine Metcalf, Cezanne Camacho, Barry-John Theobald, Luca Zappella, Nicholas Apostoloff

机构 * Apple(苹果公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07766 2025-08-12 cs.CV cs.AI 88%

UniSVG: A Unified Dataset for Vector Graphic Understanding and Generation with Multimodal Large Language Models

Jinke Li, Jiarui Yu, Chenxing Wei, Hande Dong, Qiang Lin, Liangjing Yang, Zhicai Wang, Yanbin Hao

机构 * Zhejiang University(浙江大学) Tencent(腾讯) Shenzhen University(深圳大学) Hefei University of Technology(合肥工业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments Accepted at ACM MM 2025 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07753 2025-08-12 cs.CL 88%

Exploring Causal Effect of Social Bias on Faithfulness Hallucinations in Large Language Models

Zhenliang Zhang, Junzhe Zhang, Xinyu Hu, HuiXuan Zhang, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted by CIKM 2025 (Full Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12962 2025-08-12 cs.CL cs.SD eess.AS 88%

CLAIR-A: Leveraging Large Language Models to Judge Audio Captions

Tsung-Han Wu, Joseph E. Gonzalez, Trevor Darrell, David M. Chan

机构 * Department of Electrical Engineering and Computer Science (EECS)(电气工程与计算机科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted to ASRU 2025; Code is publicly available at https://github.com/DavidMChan/clair-a

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06851 2025-08-12 cs.AI cs.CY 88%

MDK12-Bench: A Comprehensive Evaluation of Multimodal Large Language Models on Multidisciplinary Exams

Pengfei Zhou, Xiaopeng Peng, Fanrui Zhang, Zhaopan Xu, Jiaxin Ai, Yansheng Qiu, Chuanhao Li, Zhen Li, Ming Li, Yukang Feng, Jianwen Sun, Haoquan Zhang, Zizhen Li, Xiaofeng Mao, Zekai Li, Wangbo Zhao, Kai Wang, Xiaojun Chang, Wenqi Shao, Yang You, Kaipeng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) USTC(中国科学技术大学) RIT(罗切斯特理工学院) HIT(哈尔滨工业大学) WHU(武汉大学) MBZUAI(马克斯·普朗克人工智能研究所) NUS(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 35 pages, 33 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07818 2025-08-12 cs.CV 88%

Segmenting and Understanding: Region-aware Semantic Attention for Fine-grained Image Quality Assessment with Large Language Models

Chenyue Song, Chen Hui, Haiqi Zhu, Feng Jiang, Yachun Mi, Wei Zhang, Shaohui Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16104 2025-08-12 cs.CY 88%

Beauty and the Bias: Exploring the Impact of Attractiveness on Multimodal Large Language Models

Aditya Gulati, Moreno D'Incà, Nicu Sebe, Bruno Lepri, Nuria Oliver

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments 39 pages, 4 figures, 33 tables; Accepted for publication at the Eighth AAAI/ACM Conference on AI, Ethics and Society (AIES 2025) (https://www.aies-conference.com/2025/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07805 2025-08-12 cs.CL 87%

Can You Trick the Grader? Adversarial Persuasion of LLM Judges

Yerin Hwang, Dongryeol Lee, Taegwan Kang, Yongil Kim, Kyomin Jung

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06729 2025-08-12 cs.CL cs.AI 87%

Large Language Models for Oral History Understanding with Text Classification and Sentiment Analysis

Komala Subramanyam Cherukuri, Pranav Abishai Moses, Aisa Sakata, Jiangping Chen, Haihua Chen

机构 * University of North Texas(北卡罗来纳州立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14701 2025-08-12 cs.CL cs.AI cs.HC cs.LG q-bio.NC 87%

COMPASS: Computational Mapping of Patient-Therapist Alliance Strategies with Language Modeling

Baihan Lin, Djallel Bouneffouf, Yulia Landa, Rachel Jespersen, Cheryl Corcoran, Guillermo Cecchi

机构 * Department of Artificial Intelligence and Human Health, Icahn School of Medicine at Mount Sinai(人工智能与人类健康系,伊坎医学院 Mount Sinai 分校) Department of Psychiatry, Icahn School of Medicine at Mount Sinai(精神病学系,伊坎医学院 Mount Sinai 分校) Department of Neuroscience, Icahn School of Medicine at Mount Sinai(神经科学系,伊坎医学院 Mount Sinai 分校) Berkman Klein Center for Internet & Society, Harvard University(互联网与社会研究中心,哈佛大学) IBM Research, T.J. Watson Research Center(IBM 研究,T.J. Watson 研究中心) Mental Illness Research, Education and Clinical Center, James J. Peters VA Medical Center(精神疾病研究、教育与临床中心,James J. Peters VA 医疗中心)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Translational Psychiatry, in press. This work extends our research series in computational psychiatry (e.g auto annotation in arXiv:2204.05522, topic extraction in arXiv:2204.10189, and diagnosis in arXiv:2210.15603) with the introduction of LLMs to complete the full cycle of interpreting and understanding psychotherapy strategies as a comprehensive analytical framework

Journal ref Transl Psychiatry 15, 166 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08096 2025-08-12 cs.CL cs.LG 86%

Assessing LLM Text Detection in Educational Contexts: Does Human Contribution Affect Detection?

Lukas Gehring, Benjamin Paaßen

机构 * Faculty of Technology, Bielefeld University(技术学院,比勒菲尔德大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Preprint as provided by the authors (19 pages, 12 figures, 9 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07668 2025-08-12 cs.LG cs.AI 86%

AIS-LLM: A Unified Framework for Maritime Trajectory Prediction, Anomaly Detection, and Collision Risk Assessment with Explainable Forecasting

Hyobin Park, Jinwook Jung, Minseok Seo, Hyunsoo Choi, Deukjae Cho, Sekil Park, Dong-Geol Choi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06709 2025-08-12 cs.CL cs.AI 86%

Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge

Evangelia Spiliopoulou, Riccardo Fogliato, Hanna Burnsky, Tamer Soliman, Jie Ma, Graham Horwood, Miguel Ballesteros

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19997 2025-08-12 cs.LG cs.CL cs.CY 86%

Embracing Imperfection: Simulating Students with Diverse Cognitive Levels Using LLM-based Agents

Tao Wu, Jingyuan Chen, Wang Lin, Mengze Li, Yumeng Zhu, Ang Li, Kun Kuang, Fei Wu

机构 * Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17066 2025-08-12 cs.CR cs.AI 85%

Improving LLM Outputs Against Jailbreak Attacks with Expert Model Integration

Tatia Tsmindashvili, Ana Kolkhidashvili, Dachi Kurtskhalia, Nino Maghlakelidze, Elene Mekvabishvili, Guram Dentoshvili, Orkhan Shamilov, Zaal Gachechiladze, Steven Saporta, David Dachi Choladze

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Journal ref IEEE Access, vol. 13, pp. 134976-134988, Jul. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02233 2025-08-12 cs.SE 85%

A Methodological Framework for LLM-Based Mining of Software Repositories

Vincenzo De Martino, Joel Castaño, Fabio Palomba, Xavier Franch, Silverio Martínez-Fernández

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06327 2025-08-12 cs.SE 85%

A Taxonomy of Inefficiencies in LLM-Generated Python Code

Altaf Allah Abbassi, Leuson Da Silva, Amin Nikanjam, Foutse Khomh

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07273 2025-08-12 cs.CL cs.AI eess.AS 84%

Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models

Qiongqiong Wang, Hardik B. Sailor, Jeremy H. M. Wong, Tianchi Liu, Shuo Sun, Wenyu Zhang, Muhammad Huzaifah, Nancy Chen, Ai Ti Aw

机构 * Institute for Infocomm Research (I 2 R), Agency for Science, Technology

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted at (ASRU 2025) 2025 IEEE Automatic Speech Recognition and Understanding Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09373 2025-08-12 cs.CL 83%

QUDsim: Quantifying Discourse Similarities in LLM-Generated Text

Ramya Namuduri, Yating Wu, Anshun Asher Zheng, Manya Wadhwa, Greg Durrett, Junyi Jessy Li

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

Comments COLM 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06530 2025-08-12 cs.CV cs.LG 83%

What Makes "Good" Distractors for Object Hallucination Evaluation in Large Vision-Language Models?

Ming-Kun Xie, Jia-Hao Xiao, Gang Niu, Lei Feng, Zhiqiang Kou, Min-Ling Zhang, Masashi Sugiyama

机构 * Center for Advanced Intelligence Project, RIKEN(先进智能项目中心,日本理化学研究所) Southeast University(东南大学) The University of Tokyo(东京大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05228 2025-08-12 cs.CL 83%

NoveltyBench: Evaluating Language Models for Humanlike Diversity

Yiming Zhang, Harshita Diddee, Susan Holm, Hanchen Liu, Xinyue Liu, Vinay Samuel, Barry Wang, Daphne Ippolito

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07179 2025-08-12 cs.CL cs.AI cs.DB 82%

Schema Lineage Extraction at Scale: Multilingual Pipelines, Composite Evaluation, and Language-Model Benchmarks

Jiaqi Yin, Yi-Wei Chen, Meng-Lung Lee, Xiya Liu

机构 * Microsoft Redmond, WA(微软红木城) Antra. Inc.(Antra公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);small language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07918 2025-08-12 cs.CV 82%

RSVLM-QA: A Benchmark Dataset for Remote Sensing Vision Language Model-based Question Answering

Xing Zi, Jinghao Xiao, Yunxiao Shi, Xian Tao, Jun Li, Ali Braytee, Mukesh Prasad

机构 * School of Computer Science, University of Technology Sydney(技术悉尼大学计算机科学学院) SEDE, University of Technology Sydney(技术悉尼大学SEDE) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract)

Comments This paper has been accepted to the proceedings of the 33rd ACM International Multimedia Conference (ACM Multimedia 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07421 2025-08-12 cs.RO 82%

Triple-S: A Collaborative Multi-LLM Framework for Solving Long-Horizon Implicative Tasks in Robotics

Zixi Jia, Hongbin Gao, Fashe Li, Jiqiang Liu, Hexiao Li, Qinghua Liu

机构 * Faculty of Robot Science and Engineering, Northeastern University(机器人科学与工程学院,东北大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

Comments Accepted to IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏