arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32208 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32208 篇

2505.19236 2026-01-30 cs.CL 90%

Evaluating Text Creativity across Diverse Domains: A Dataset and Large Language Model Evaluator

在不同领域评估文本创造力:一个数据集和大语言模型评估器

Qian Cao, Xiting Wang, Yuzhuo Yuan, Yahui Liu, Fang Luo, Ruihua Song

机构 * Renmin University of China(中国人民大学) Beijing Normal University(北京师范大学) Kuaishou Technology(快手科技)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出了一种基于CreataSet数据集的CrEval评估器,通过结合人类和合成数据提升大语言模型的创造力评估效果。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16444 2026-01-27 cs.CL 90%

Exploring the Effects of Alignment on Numerical Bias in Large Language Models

探索对大型语言模型中数值偏差的影响

Ayako Sato, Hwichan Kim, Zhousi Chen, Masato Mita, Mamoru Komachi

机构 * Tokyo Metropolitan University(东京 Metropolitan 大学) Hitotsubashi University(立命馆大学) CyberAgent Inc.(CyberAgent 公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

AI总结 本文研究了对齐对大型语言模型数值偏差的影响,发现对齐会增加偏差,并提出分数范围调整作为缓解策略。

Comments Accepted at AIBSD 2026 (Workshop at AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17344 2026-01-27 cs.CL 90%

The Shadow Self: Intrinsic Value Misalignment in Large Language Model Agents

阴影自我:大型语言模型代理中的内在价值偏差

Chen Chen, Kim Young Il, Yuan Yang, Wenhao Su, Yilin Zhang, Xueluan Gong, Qian Wang, Yongsen Zheng, Ziyao Liu, Kwok-Yan Lam

机构 * Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 研究提出IMPRESS框架,系统评估大型语言模型代理中的内在价值偏差风险,发现其在不同模型中普遍存在,且受上下文化和框架机制显著影响。

Comments 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16549 2026-01-26 cs.AI 90%

LLM is Not All You Need: A Systematic Evaluation of ML vs. Foundation Models for text and image based Medical Classification

LLM并非万能:对ML与基础模型在文本和图像医学分类中的系统评估

Meet Raval, Tejul Pandit, Dhvani Upadhyay

机构 * University of Southern California Los Angeles, USA(美国南加州大学) Dhirubhani Ambani University Gandhinagar, India(印度达尔布哈尼·阿班尼大学)

专题命中 评测与基准 :LLM(title,abstract);foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文系统评估了ML与基础模型在医学分类中的表现,发现传统ML模型在多数任务中表现优异,而PEFT方法的效果依赖于适应策略。

Comments 9 pages, 5 figures, 3 tables, paper accepted in AAIML'26 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11003 2026-01-26 cs.SE cs.AI 90%

EmbedAgent: Benchmarking Large Language Models in Embedded System Development

EmbedAgent: 在嵌入式系统开发中评估大型语言模型

Ruiyang Xu, Jialun Cao, Mingyuan Wu, Wenliang Zhong, Yaojie Lu, Ben He, Xianpei Han, Shing-Chi Cheung, Le Sun

机构 * University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Peng Cheng Laboratory(鹏城实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 本文提出EmbedAgent和Embedbench,用于评估LLMs在嵌入式系统开发中的能力,发现通用LLMs在特定任务中表现不佳,提出检索增强生成和编译器反馈策略以提升性能。

Comments 12 pages, accepted by International Conference on Software Engineering (ICSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05582 2026-01-12 cs.CL 90%

Can large language models interpret unstructured chat data on dynamic group decision-making processes? Evidence on joint destination choice

大型语言模型能否在动态群体决策过程中解释非结构化聊天数据?关于共同目的地选择的证据

Sung-Yoo Lim, Koki Sato, Kiyoshi Takami, Giancarlos Parady, Eui-Jin Kim

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本研究探讨了大型语言模型在解释动态群体决策过程中非结构化聊天数据的能力,通过日本共同用餐活动的数据,评估了LLM在自动标注和捕捉显性与隐性决策因素方面的潜力与局限。

Comments 23 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05339 2026-01-12 cs.CR cs.AI 90%

Multi-turn Jailbreaking Attack in Multi-Modal Large Language Models

多轮劫持攻击在多模态大语言模型中的应用

Badhan Chandra Das, Md Tasnim Jawad, Joaquin Molto, M. Hadi Amini, Yanzhao Wu

机构 * Knight Foundation School of Computing and Information Science, Florida International University(骑士基金会计算与信息科学学院,佛罗里达国际大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出多轮劫持攻击及FragGuard防御机制,评估其在多模态大语言模型中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02716 2025-12-17 cs.AI 90%

Menta: A Small Language Model for On-Device Mental Health Prediction

Menta:一种用于设备端心理健康预测的小型语言模型

Tianyi Zhang, Xiangyuan Xue, Lingyan Ruan, Shiya Fu, Feng Xia, Simon D'Alfonso, Vassilis Kostakos, Ting Dang, Hong Jia

机构 * The University of Melbourne(墨尔本大学) The University of Auckland(奥克兰大学) RMIT University(皇家墨尔本理工学院)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)

AI总结 Menta是一种优化的小型语言模型,用于设备端社交媒体数据中的多任务心理健康预测,通过联合训练和平衡损失函数在多个任务上提升了性能,同时保持较小的模型大小和低资源需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06272 2025-12-09 cs.CL cs.CE 90%

Golden Touchstone: A Comprehensive Bilingual Benchmark for Evaluating Financial Large Language Models

黄金触点:一种全面的双语基准,用于评估金融大语言模型

Xiaojun Wu, Junxi Liu, Huanyi Su, Zhouchi Lin, Yiyan Qi, Chengjin Xu, Jiajun Su, Jiajie Zhong, Fuwei Wang, Saizhuo Wang, Fengrui Hua, Jia Li, Jian Guo

机构 * IDEA Research(IDEA研究机构) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Nanjing University(南京大学) South China Normal University(华南师范大学) DataArcTech Ltd.(DataArcTech有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

AI总结 本研究提出Golden Touchstone双语基准,用于全面评估金融大语言模型的性能,通过对比分析揭示模型在处理复杂金融信息时的优势与局限。

Comments Published in Findings of EMNLP 2025

Journal ref In Findings of the Association for Computational Linguistics: EMNLP 2025, pages 22544-22560, Suzhou, China. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05339 2025-12-08 cs.LG 90%

Taxonomy-Adaptive Moderation Model with Robust Guardrails for Large Language Models

具有鲁棒防护栏的分类适应调谐模型用于大型语言模型

Mahesh Kumar Nandwana, Youngwan Lim, Joseph Liu, Alex Yang, Varun Notibala, Nishchaie Khanna

机构 * Project Lead(项目负责人)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 Roblox Guard 1.0通过指令微调提升大型语言模型的安全性,采用输入输出调谐和可扩展的安全分类评估框架。

Comments To be presented at AAAI-26 PerFM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19872 2025-11-27 cs.AI 90%

Simulated Self-Assessment in Large Language Models: A Psychometric Approach to AI Self-Efficacy

大语言模型的模拟自我评估:一种心理测量方法用于AI自我效能

Daniel I Jackson, Emma L Jensen, Syed-Amad Hussain, Emre Sezgin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文通过心理测量方法评估大语言模型的自我效能,发现模型自我评估与实际表现不一致,且不同任务表现差异显著。

Comments 25 pages,5 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15585 2025-11-27 cs.SE cs.CL cs.PL 90%

Leveraging Test Driven Development with Large Language Models for Reliable and Verifiable Spreadsheet Code Generation: A Research Framework

利用大型语言模型进行测试驱动开发以实现可靠且可验证的电子表格代码生成:一种研究框架

Simon Thorne, Advait Sarkar

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出一种结合测试驱动开发与大型语言模型的框架,以提高电子表格代码生成的可靠性与准确性。

Comments 16 pages

Journal ref Proceedings of the EuSpRIG 2025 Conference "Spreadsheet Productivity & Risks" ISBN : 978-1-905404-60-5

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16383 2025-11-26 cs.CL 90%

Large Language Models in Argument Mining: A Survey

大型语言模型在论证挖掘中的应用:综述

Hao Li, Viktor Schlegel, Yizheng Sun, Riza Batista-Navarro, Goran Nenadic

机构 * University of Manchester(曼彻斯特大学) Imperial College London(伦敦帝国学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文综述了大型语言模型对论证挖掘领域的影响,分析了LLM如何改变任务设计、数据集构建和评估方法,并提出了未来研究方向。

Comments Work draft

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06227 2025-11-11 cs.SE cs.AI cs.CE 90%

Assertion-Aware Test Code Summarization with Large Language Models

Anamul Haque Mollah, Ahmed Aljohani, Hyunsook Do

机构 * University of North Texas(北卡罗来纳州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted for publication at 2nd ACM International Conference on AI-powered Software (AIware 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20916 2025-11-11 cs.CL 90%

SageLM: A Multi-aspect and Explainable Large Language Model for Speech Judgement

Yuan Ge, Junxiang Zhang, Xiaoqian Liu, Bei Li, Xiangnan Ma, Chenglong Wang, Kaiyang Ye, Yangfan Du, Linfeng Zhang, Yuxin Huang, Tong Xiao, Zhengtao Yu, JingBo Zhu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04989 2025-11-10 cs.CL 90%

Acquiring Common Chinese Emotional Events Using Large Language Model

Ya Wang, Guangzheng Zhu, Cungen Cao, Jingjing Li, He Li, Xin Huang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments I am the second author (Guangzheng Zhu) and I am submitting this paper on behalf of all co-authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11137 2025-11-10 cs.CL 90%

Scalable Medication Extraction and Discontinuation Identification from Electronic Health Records Using Large Language Models

Chong Shao, Douglas Snyder, Chiran Li, Bowen Gu, Kerry Ngan, Chun-Ting Yang, Jiageng Wu, Richard Wyss, Kueiyu Joshua Lin, Jie Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04328 2025-11-07 cs.AI 90%

RxSafeBench: Identifying Medication Safety Issues of Large Language Models in Simulated Consultation

Jiahao Zhao, Luxin Xu, Minghuan Tan, Lichao Zhang, Ahmadreza Argha, Hamid Alinejad-Rokny, Min Yang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) University of Electronic Science and Technology of China(电子科技大学) Shenzhen University of Advanced Technology(深圳大学) School of Biomedical Engineering, UNSW Sydney(生物医学工程学院,UNSW悉尼)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments To appear in BIBM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02458 2025-11-05 cs.CL cs.CE econ.GN q-fin.EC 90%

Prompting for Policy: Forecasting Macroeconomic Scenarios with Synthetic LLM Personas

Giulia Iadisernia, Carolina Camassa

机构 * Banca d’Italia(意大利银行)

专题命中 评测与基准 :LLM(title,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)

Comments 9 pages, 8-pages appendix, accepted at ICAIF 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11373 2025-11-03 cs.CL cs.CY 90%

Cancer-Myth: Evaluating Large Language Models on Patient Questions with False Presuppositions

Wang Bill Zhu, Tianqi Chen, Xinyan Velocity Yu, Ching Ying Lin, Jade Law, Mazen Jizzini, Jorge J. Nieva, Ruishan Liu, Robin Jia

机构 * Department of Computer Science, USC(美国斯克里普斯大学计算机科学系) Keck School of Medicine, USC(美国斯克里普斯大学凯克医学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03913 2025-10-07 cs.CL 90%

PsycholexTherapy: Simulating Reasoning in Psychotherapy with Small Language Models in Persian

Mohammad Amin Abbasi, Hassan Naderi

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02962 2025-10-06 cs.CL 90%

Leave No TRACE: Black-box Detection of Copyrighted Dataset Usage in Large Language Models via Watermarking

Jingqi Zhang, Ruibo Chen, Yingqing Yang, Peihua Mai, Heng Huang, Yan Pang

机构 * Antiquus S. Hippocampus, Natalia Cerebro & Amelie P. Amygdale Department of Computer Science Cranberry-Lemon University Pittsburgh, PA 15213, USA(计算机科学系,Cranberry-Lemon大学) Ji Q. Ren & Yevgeny LeNet Department of Computational Neuroscience University of the Witwatersrand Joburg, South Africa(计算神经科学系,沃特瓦特斯兰大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01761 2025-10-06 cs.CL 90%

Same evaluation, more tokens: On the effect of input length for machine translation evaluation using Large Language Models

Tobias Domhan, Dawei Zhu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted at EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25197 2025-10-01 cs.SE cs.AI cs.PL 90%

Towards Repository-Level Program Verification with Large Language Models

Si Cheng Zhong, Xujie Si

机构 * University of Toronto(多伦多大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted to LMPL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21192 2025-09-29 cs.CL 90%

GEP: A GCG-Based method for extracting personally identifiable information from chatbots built on small language models

Jieli Zhu, Vi Ngoc-Nha Tran

机构 * Department of Computer Science(计算机科学系) The Arctic University of Norway(挪威北极大学)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)

Comments 16 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05262 2025-09-18 cs.CL 90%

Do Large Language Models Truly Grasp Addition? A Rule-Focused Diagnostic Using Two-Integer Arithmetic

Yang Yan, Yu Lu, Renjun Xu, Zhenzhong Lan

机构 * Zhejiang University(浙江大学) School of Engineering, Westlake University(西湖大学工程学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted by EMNLP'25 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18337 2025-09-16 cs.CL 90%

Can LLMs assist with Ambiguity? A Quantitative Evaluation of various Large Language Models on Word Sense Disambiguation

T. G. D. K. Sumanathilaka, Nicholas Micallef, Julian Hough

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 12 pages,6 tables, 1 figure, Proceedings of the 1st International Conference on NLP & AI for Cyber Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08829 2025-09-12 cs.CY cs.AI cs.IR 90%

PerFairX: Is There a Balance Between Fairness and Personality in Large Language Model Recommendations?

Chandan Kumar Sah

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 10 pages, 5 figures. Accepted to the Workshop on Multimodal Continual Learning (MCL) at ICCV 2025. @2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), ICCV's 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05471 2025-09-09 cs.CR cs.AI 90%

Behind the Mask: Benchmarking Camouflaged Jailbreaks in Large Language Models

Youjia Zheng, Mohammad Zandsalimy, Shanu Sushmita

机构 * Northeastern University(东北大学) Stevens Institute of Technology(斯蒂文斯理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17675 2025-09-09 cs.LG 90%

Towards Synthesizing Normative Data for Cognitive Assessments Using Generative Multimodal Large Language Models

Victoria Yan, Honor Chotkowski, Fengran Wang, Xinhui Li, Carl Yang, Jiaying Lu, Runze Yan, Xiao Hu, Alex Fedorov

机构 * The Westminster Schools(韦斯敏斯特学校) Center for Data Science, Nell Hodgson Woodruff School of Nursing, Emory University(数据科学中心、恩莫森护理学院、埃默里大学) Department of Computer Science, Emory University(计算机科学系、埃默里大学) School of Electrical and Computer Engineering, Georgia Institute of Technology(电气与计算机工程学院、佐治亚理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏