arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-09 至 2025-09-09 共收录 62 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 62 篇

2408.04638 2025-09-09 cs.CL cs.CY 92%

Affective Computing in the Era of Large Language Models: A Survey from the NLP Perspective

Yiqun Zhang, Xiaocui Yang, Xingle Xu, Zeran Gao, Yijie Huang, Shiyi Mu, Shi Feng, Daling Wang, Yifei Zhang, Kaisong Song, Ge Yu

机构 * Northeastern University, China(东北大学) Alibaba Group, Hangzhou, China(阿里巴巴集团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);RLHF(abstract,comments);LLM(abstract)

Comments Compared with the previous version, reinforcement learning has been added (as a new section), including RLHF, RLVR, and RLAIF

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05471 2025-09-09 cs.CR cs.AI 90%

Behind the Mask: Benchmarking Camouflaged Jailbreaks in Large Language Models

Youjia Zheng, Mohammad Zandsalimy, Shanu Sushmita

机构 * Northeastern University(东北大学) Stevens Institute of Technology(斯蒂文斯理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17675 2025-09-09 cs.LG 90%

Towards Synthesizing Normative Data for Cognitive Assessments Using Generative Multimodal Large Language Models

Victoria Yan, Honor Chotkowski, Fengran Wang, Xinhui Li, Carl Yang, Jiaying Lu, Runze Yan, Xiao Hu, Alex Fedorov

机构 * The Westminster Schools(韦斯敏斯特学校) Center for Data Science, Nell Hodgson Woodruff School of Nursing, Emory University(数据科学中心、恩莫森护理学院、埃默里大学) Department of Computer Science, Emory University(计算机科学系、埃默里大学) School of Electrical and Computer Engineering, Georgia Institute of Technology(电气与计算机工程学院、佐治亚理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14096 2025-09-09 cs.CV cs.AI 90%

Image Segmentation with Large Language Models: A Survey with Perspectives for Intelligent Transportation Systems

Sanjeda Akter, Ibne Farabi Shihab, Anuj Sharma

机构 * Department of Computer Science, Iowa State University, Ames, IA, USA(Iowa State University) Department of Civil, Construction and Environmental Engineering, Iowa State University, Ames, IA, USA(Iowa State University)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18183 2025-09-09 cs.CL cs.AI cs.CY 90%

Leveraging Large Language Models for Accurate Sign Language Translation in Low-Resource Scenarios

Luana Bulla, Gabriele Tuccio, Misael Mongiovì, Aldo Gangemi

机构 * University of Catania, Italy(意大利卡塔尼亚大学) National Research Council - ISTC, Italy(意大利国家研究理事会-ISTC) University of Bologna, Italy(意大利博洛尼亚大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10291 2025-09-09 cs.AI cs.CL cs.IR 90%

ResearchArena: Benchmarking Large Language Models' Ability to Collect and Organize Information as Research Agents

Hao Kang, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06464 2025-09-09 cs.AI cs.CL 90%

Transforming Wearable Data into Personal Health Insights using Large Language Model Agents

Mike A. Merrill, Akshay Paruchuri, Naghmeh Rezaei, Geza Kovacs, Javier Perez, Yun Liu, Erik Schenck, Nova Hammerquist, Jake Sunshine, Shyam Tailor, Kumar Ayush, Hao-Wei Su, Qian He, Cory Y. McLean, Mark Malhotra, Shwetak Patel, Jiening Zhan, Tim Althoff, Daniel McDuff, Xin Liu

机构 * Google Research(谷歌研究)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 53 pages, 7 main figures, 2 main tables, accepted to Nature Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06838 2025-09-09 cs.CL cs.CR 89%

EPT Benchmark: Evaluation of Persian Trustworthiness in Large Language Models

Mohammad Reza Mirbagheri, Mohammad Mahdi Mirkamali, Zahra Motoshaker Arani, Ali Javeri, Amir Mahdi Sadeghzadeh, Rasool Jalili

机构 * Department of Computer Engineering, Sharif University of Technology(谢里夫理工大学计算机工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06065 2025-09-09 cs.CL 89%

KatotohananQA: Evaluating Truthfulness of Large Language Models in Filipino

Lorenzo Alfred Nery, Ronald Dawson Catignas, Thomas James Tiam-Lee

机构 * De La Salle University, Manila, Philippines(德拉萨大学,马尼拉,菲律宾)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 14 pages, 1 figure, 9 tables, 1 listing. To appear in Proceedings of NLPIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04809 2025-09-09 cs.AI cs.HC 89%

TalkToAgent: A Human-centric Explanation of Reinforcement Learning Agents with Large Language Models

Haechang Kim, Hao Chen, Can Li, Jong Min Lee

机构 * Department of Chemical and Biological Engineering, Seoul National University, Republic of Korea(化学与生物工程系,首尔国立大学) Davidson School of Chemical Engineering, Purdue University, United States(化学工程大卫森学院,普渡大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 31 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04078 2025-09-09 cs.SE cs.AI 89%

RepoDebug: Repository-Level Multi-Task and Multi-Language Debugging Evaluation of Large Language Models

Jingjing Liu, Zeming Liu, Zihao Cheng, Mengliang He, Xiaoming Shi, Yuhang Guo, Xiangrong Zhu, Yuanfang Guo, Yunhong Wang, Haifeng Wang

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) East China Normal University(华东师范大学) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Baidu Inc.(百度公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 30 pages, 12 figures, EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05665 2025-09-09 cs.CL 89%

Exploring the Limits of Large Language Models: A Systematic Evaluation of Masked Text Processing Ability through MskQA and MskCal

Fuka Matsuzaki, Haru-Tada Sato

机构 * Department of Data Science(数据科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05946 2025-09-09 cs.NI 89%

Large Language Models for Next-Generation Wireless Network Management: A Survey and Tutorial

Bisheng Wei, Ruihong Jiang, Ruichen Zhang, Yinqiu Liu, Dusit Niyato, Yaohua Sun, Yang Lu, Yonghui Li, Shiwen Mao, Chau Yuen, Marco Di Renzo, Mugen Peng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11689 2025-09-09 cs.CL 89%

Improve LLM-as-a-Judge Ability as a General Ability

Jiachen Yu, Shaoning Sun, Xiaohui Hu, Jiaxu Yan, Kaidong Yu, Xuelong Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05605 2025-09-09 cs.CL cs.AI 88%

Icon$^{2}$: Aligning Large Language Models Using Self-Synthetic Preference Data via Inherent Regulation

Qiyuan Chen, Hongsen Huang, Qian Shao, Jiahe Chen, Jintai Chen, Hongxia Xu, Renjie Hua, Ren Chuan, Jian Wu

机构 * Zhejiang University(浙江大学) Soochow Securities Co.,Ltd.(苏州证券有限公司) HKUST(GZ)(香港科技大学(广州)) Nanjing University(南京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05331 2025-09-09 cs.CR cs.AI cs.CL 88%

ForensicsData: A Digital Forensics Dataset for Large Language Models

Youssef Chakir, Iyad Lahsen-Cherif

机构 * INPT, CS department, Rabat, Morocco(INPT计算机科学系,摩洛哥拉巴特)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to WiMob 2025 (21st International Conference on Wireless and Mobile Computing, Networking and Communications), Marrakesh, Morocco, Oct 20-22, 2025. 6 pages, 5 figures, 5 tables. IEEEtran conference format

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05881 2025-09-09 cs.SE cs.AI 88%

GeoAnalystBench: A GeoAI benchmark for assessing large language models for spatial analysis workflow and code generation

Qianheng Zhang, Song Gao, Chen Wei, Yibo Zhao, Ying Nie, Ziru Chen, Shijie Chen, Yu Su, Huan Sun

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) The Ohio State University(俄亥根州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 34 pages, 8 figures

Journal ref Transactions in GIS, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05315 2025-09-09 cs.RO cs.AI cs.CV 88%

Evaluation of Large Language Models for Anomaly Detection in Autonomous Vehicles

Petros Loukas, David Bassir, Savvas Chatzichristofis, Angelos Amanatiadis

机构 * Democritus University of Thrace(德米特里乌斯大学) Dongguan University of Technology(东莞理工大学) ENS-Paris-Saclay University(巴黎-萨克雷大学) Neapolis University Pafos(纳皮奥斯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15865 2025-09-09 cs.RO cs.AI cs.CL 87%

BeSimulator: A Large Language Model Powered Text-based Behavior Simulator

Jianan Wang, Bin Li, Jingtao Qi, Xueying Wang, Fu Li, Hanxun Li

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) Intelligent Game and Decision Lab (IGDL)(智能游戏与决策实验室)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

Comments 19 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12226 2025-09-09 cs.CL cs.AI cs.CV cs.LG 87%

AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling

Jun Zhan, Junqi Dai, Jiasheng Ye, Yunhua Zhou, Dong Zhang, Zhigeng Liu, Xin Zhang, Ruibin Yuan, Ge Zhang, Linyang Li, Hang Yan, Jie Fu, Tao Gui, Tianxiang Sun, Yu-Gang Jiang, Xipeng Qiu

机构 * Fudan University(复旦大学) Multimodal Art Projection Research Community(多模态艺术投影研究社区) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 28 pages, 16 figures, under review, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05541 2025-09-09 cs.AI 85%

SenseCF: LLM-Prompted Counterfactuals for Intervention and Sensor Data Augmentation

Shovito Barua Soumma, Asiful Arefeen, Stephanie M. Carpenter, Melanie Hingle, Hassan Ghasemzadeh

机构 * College of Health Solutions, Arizona State University(亚利桑那州立大学健康解决方案学院) School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院) School of Nutritional Sciences and Wellness, University of Arizona(亚利桑那大学营养科学与健康学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted at the IEEE-EMBS International Conference on Body Sensor Networks (IEEE-EMBS BSN) 2025, LA, CA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13384 2025-09-09 cs.AI cs.CY stat.ME stat.OT 85%

Delving Into the Psychology of Machines: Exploring the Structure of Self-Regulated Learning via LLM-Generated Survey Responses

Leonie V. D. E. Vogelsmeier, Eduardo Oliveira, Kamila Misiejuk, Sonsoles López-Pernas, Mohammed Saqr

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05759 2025-09-09 cs.CL 85%

Reinforced Lifelong Editing for Language Models

Zherui Li, Houcheng Jiang, Hao Chen, Baolong Bi, Zhenhong Zhou, Fei Sun, Junfeng Fang, Xiang Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Science and Technology of China(中国科学技术大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

Comments Accepted by ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06422 2025-09-09 cs.CV 85%

Phantom-Insight: Adaptive Multi-cue Fusion for Video Camouflaged Object Detection with Multimodal LLM

Hua Zhang, Changjiang Luo, Ruoyu Chen

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06382 2025-09-09 cs.HC 85%

Context-Adaptive Hearing Aid Fitting Advisor through Multi-turn Multimodal LLM Conversation

Yingke Ding, Zeyu Wang, Xiyuxing Zhang, Hongbin Chen, Zhenan Xu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Ubicomp Companion 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05540 2025-09-09 cs.SE cs.AI 84%

Combining TSL and LLM to Automate REST API Testing: A Comparative Study

Thiago Barradas, Aline Paes, Vânia de Oliveira Neves

专题命中 评测与基准 :LLM(title,comments);large language model(abstract);language model(abstract);分类 cs.AI

Comments 10 pages, article computer science, software engineering, software testing, ia, llm

Journal ref SBES 2025 39th Brazilian Symposium on Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05921 2025-09-09 cs.CR 83%

Dataset Ownership in the Era of Large Language Models

Kun Li, Cheng Wang, Minghui Xu, Yue Zhang, Xiuzhen Cheng

专题命中 评测与基准 :large language model(title);language model(title)

Comments 15 pages, 1 table, accepted by the 2025 International Conference on Blockchain and Web3.0 Technology Innovation and Application Exchange (BWTAC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06341 2025-09-09 cs.AI 83%

Evaluating Multi-Turn Bargain Skills in LLM-Based Seller Agent

Issue Yishu Wang, Kakam Chong, Xiaofeng Wang, Xu Yan, DeXin Kong, Chen Ju, Ming Chen, Shuai Xiao, Shuguang Han, jufeng chen

机构 * Johns Hopkins University(约翰霍普金斯大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06609 2025-09-09 cs.LG 79%

A Survey of Generalization of Graph Anomaly Detection: From Transfer Learning to Foundation Models

Junjun Pan, Yu Zheng, Yue Tan, Yixin Liu

机构 * School of ICT Griffith University(信息与通信技术学院 格里菲斯大学) School of CSE University of New South Wales(计算机科学与工程学院 新南威尔士大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

Comments Accepted by ICKG 2025. 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05617 2025-09-09 cs.CL cs.AI 79%

From Joy to Fear: A Benchmark of Emotion Estimation in Pop Song Lyrics

Shay Dahary, Avi Edana, Alexander Apartsin, Yehudit Aperstein

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏