arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-04 至 2025-11-04 共收录 92 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 92 篇

2511.00389 2025-11-04 cs.CV 90%

Rethinking Facial Expression Recognition in the Era of Multimodal Large Language Models: Benchmark, Datasets, and Beyond

Fan Zhang, Haoxuan Li, Shengju Qian, Xin Wang, Zheng Lian, Hao Wu, Zhihong Zhu, Yuan Gao, Qiankun Li, Yefeng Zheng, Zhouchen Lin, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Tencent(腾讯) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Westlake University(西湖大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00024 2025-11-04 cs.CY cs.AI cs.CL cs.LG stat.AP 90%

Chitchat with AI: Understand the supply chain carbon disclosure of companies worldwide through Large Language Model

Haotian Hang, Yueyang Shen, Vicky Zhu, Jose Cruz, Michelle Li

机构 * University of Southern California(南加州大学) University of Michigan(密歇根大学) Babson College(巴布森学院) University of Connecticut(康涅狄格大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19667 2025-11-04 cs.CL cs.AI 90%

Can Large Language Models Analyze Graphs like Professionals? A Benchmark, Datasets and Models

Xin Li, Weize Chen, Qizhi Chu, Haopeng Li, Zhaojun Sun, Ran Li, Chen Qian, Yiwei Wei, Zhiyuan Liu, Chuan Shi, Maosong Sun, Cheng Yang

机构 * School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机科学学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) College of Petroleum Engineering, China University of Petroleum (Beijing) at Karamay(中国石油大学(北京)克拉玛依校区石油工程学院) Institute for Artificial Intelligence, Tsinghua University(清华大学人工智能研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01649 2025-11-04 cs.CL 89%

Evaluating Cultural Knowledge Processing in Large Language Models: A Cognitive Benchmarking Framework Integrating Retrieval-Augmented Generation

Hung-Shin Lee, Chen-Chi Chang, Ching-Yuan Chen, Yun-Hsiang Hsu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments This paper has been accepted by The Electronic Library, and the full article is now available on Emerald Insight

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15715 2025-11-04 cs.CL 89%

Beyond Empathy: Integrating Diagnostic and Therapeutic Reasoning with Large Language Models for Mental Health Counseling

He Hu, Yucheng Zhou, Juzheng Si, Qianning Wang, Hengheng Zhang, Fuji Ren, Fei Ma, Laizhong Cui, Qi Tian

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济发展实验室) SKL-IOTSC, CIS, University of Macau(澳门科学馆物联网与智慧城市研究中心) Shandong University(山东大学) Auckland University of Technology(技术大学(奥克兰)) University of Electronic Science and Technology of China(电子科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00624 2025-11-04 cs.SE 89%

Can Large Language Models Detect Real-World Android Software Compliance Violations?

Haoyi Zhang, Huaijin Ran, Xunzhu Tang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.09051 2025-11-04 cs.CL cs.AI cs.IR cs.LG 88%

Complex QA and language models hybrid architectures, Survey

Xavier Daull, Patrice Bellot, Emmanuel Bruno, Vincent Martin, Elisabeth Murisasco

机构 * Naval Group(海军集团) Toulon Université(图卢兹大学) Aix Marseille Univ(阿维尼昂-马赛大学) CNRS(法国国家科学研究中心) LIS(信息科学实验室)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00160 2025-11-04 cs.SE cs.AI 88%

What a diff makes: automating code migration with large language models

Katherine A. Rosenfeld, Cliff C. Kerr, Jessica Lundin

机构 * Institute for Disease Modeling, Gates Foundation(疾病模型研究所,盖茨基金会)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06350 2025-11-04 cs.CV 88%

Aligning Effective Tokens with Video Anomaly in Large Language Models

Yingxian Chen, Jiahui Liu, Ruidi Fan, Yanwei Li, Chirui Chang, Shizhen Zhao, Wilton W. T. Fok, Xiaojuan Qi, Yik-Chung Wu

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00342 2025-11-04 cs.CR cs.AI cs.LG cs.PF 85%

MH-1M: A 1.34 Million-Sample Comprehensive Multi-Feature Android Malware Dataset for Machine Learning, Deep Learning, Large Language Models, and Threat Intelligence Research

Hendrio Braganca, Diego Kreutz, Vanderson Rocha, Joner Assolin, and Eduardo Feitosa

机构 * Federal University of Amazonas(亚马逊联邦大学) Institute of Computing(计算学院) Federal University of Pampa(帕姆帕联邦大学) AI Horizon Labs(AI地平线实验室)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.AI、cs.LG

Comments 17 pages, 7 figures, 13 tables, submitted to the Scientific Data journal published by Nature Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19354 2025-11-04 cs.CR 85%

The Emerged Security and Privacy of LLM Agent: A Survey with Case Studies

Feng He, Tianqing Zhu, Dayong Ye, Bo Liu, Wanlei Zhou, Philip S. Yu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 35 pages, 19 figures. Accepted to ACM Computing Surveys (CSUR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06289 2025-11-04 q-fin.PM cs.LG q-fin.PR 83%

Automate Strategy Finding with LLM in Quant Investment

Zhizhuo Kou, Holam Yu, Junyu Luo, Jingshu Peng, Xujia Li, Chengzhong Liu, Juntao Dai, Lei Chen, Sirui Han, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Peking University(北京大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00782 2025-11-04 cs.AI 83%

Count-Based Approaches Remain Strong: A Benchmark Against Transformer and LLM Pipelines on Structured EHR

Jifan Gao, Michael Rosenthal, Brian Wolpin, Simona Cristea

机构 * Dana-Farber Cancer Institute(达纳-法伯癌症研究所)

专题命中 评测与基准 :LLM(title,abstract);foundation model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00050 2025-11-04 cs.CL cs.AI 82%

JudgeLRM: Large Reasoning Models as a Judge

Nuo Chen, Zhiyuan Hu, Qingyun Zou, Jiaying Wu, Qian Wang, Bryan Hooi, Bingsheng He

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01176 2025-11-04 cs.SE 82%

An Empirical Study of LLM-Based Code Clone Detection

Wenqing Zhu, Norihiro Yoshida, Eunjong Choi, Yutaka Matsubara, Hiroaki Takada

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01670 2025-11-04 cs.CL cs.AI 81%

SeaLLMs-Audio: Large Audio-Language Models for Southeast Asia

Chaoqun Liu, Mahani Aljunied, Guizhen Chen, Hou Pong Chan, Weiwen Xu, Yu Rong, Wenxuan Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16093 2025-11-04 cs.CL cs.AI 81%

Beyond Pointwise Scores: Decomposed Criteria-Based Evaluation of LLM Responses

Fangyi Yu, Nabeel Seedat, Dasha Herrmannova, Frank Schilder, Jonathan Richard Schwarz

机构 * Thomson Reuters Foundational Research(汤姆森·路透基础研究) Thomson Reuters Labs(汤姆森·路透实验室) Imperial College London(帝国理工学院伦敦分校)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by 2025 EMNLP industry track

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05887 2025-11-04 eess.AS 80%

Aligning Speech to Languages to Enhance Code-switching Speech Recognition

Hexin Liu, Xiangyu Zhang, Haoyang Zhang, Leibny Paola Garcia, Andy W. H. Khong, Eng Siong Chng, Shinji Watanabe

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted to IEEE Trans. Audio Speech Lang. Process., copyright has been transferred to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00092 2025-11-04 cs.AI cs.CL cs.LG quant-ph 80%

QuantumBench: A Benchmark for Quantum Problem Solving

Shunya Minami, Tatsuya Ishigaki, Ikko Hamamura, Taku Mikuriya, Youmi Ma, Naoaki Okazaki, Hiroya Takamura, Yohichi Suzuki, Tadashi Kadowaki

机构 * National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院) NVIDIA Corporation(NVIDIA公司) Yokohama National University(横滨国立大学) Institute of Science Tokyo(东京科学研究所) DENSO CORPORATION(Denso公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01340 2025-11-04 cs.CV cs.CL 79%

$\left|\,\circlearrowright\,\boxed{\text{BUS}}\,\right|$: A Large and Diverse Multimodal Benchmark for evaluating the ability of Vision-Language Models to understand Rebus Puzzles

Trishanu Das, Abhilash Nandy, Khush Bajaj, Deepiha S

机构 * Tredence Inc.(特伦德公司) Indian Institute of Technology Kharagpur(印度理工学院克拉格浦尔分校) Inria Paris-Rocquencourt(巴黎-罗克琴库特研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒姆研究实验室)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments 7 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00193 2025-11-04 cs.RO cs.LG 79%

Reducing Robotic Upper-Limb Assessment Time While Maintaining Precision: A Time Series Foundation Model Approach

Faranak Akbarifar, Nooshin Maghsoodi, Sean P Dukelow, Stephen Scott, Parvin Mousavi

机构 * School of Computing(计算学院) Queen’s University(皇后大学) Hotchkiss Brain Institute(霍克奇斯脑研究所) University of Calgary(卡尔加里大学) Centre for Neuroscience Studies(神经科学研究中心) Providence Care Hospital(普罗维登斯护理医院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12149 2025-11-04 cs.CL cs.MM cs.SI 79%

Seeing Sarcasm Through Different Eyes: Analyzing Multimodal Sarcasm Perception in Large Vision-Language Models

Junjie Chen, Xuyang Liu, Subin Huang, Linfeng Zhang, Hang Yu

机构 * Anhui Polytechnic University (AHPU)(安徽工程大学) Shanghai University (SHU)(上海大学) Shanghai Jiao Tong University (SJTU)(上海交通大学) Sichuan University (SCU)(四川大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18771 2025-11-04 cs.CL 79%

CheckEval: A reliable LLM-as-a-Judge framework for evaluating text generation using checklists

Yukyung Lee, Joonghoon Kim, Jaehee Kim, Hyowon Cho, Jaewook Kang, Pilsung Kang, Najoung Kim

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18079 2025-11-04 cs.CV cs.AI cs.CL 79%

Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding

Xiaoyi Zhang, Zhaoyang Jia, Zongyu Guo, Jiahao Li, Bin Li, Houqiang Li, Yan Lu

机构 * Microsoft Research Asia(微软亚洲研究院) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00222 2025-11-04 cs.CL cs.AI 79%

Consistently Simulating Human Personas with Multi-Turn Reinforcement Learning

Marwa Abdulhai, Ryan Cheng, Donovan Clay, Tim Althoff, Sergey Levine, Natasha Jaques

机构 * UC Berkeley(伯克利大学) University of Washington(华盛顿大学) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07017 2025-11-04 cs.CL cs.AI 79%

Finding Words Associated with DIF: Predicting Differential Item Functioning using LLMs and Explainable AI

Hotaka Maeda, Yikai Lu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 14 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00029 2025-11-04 cs.LG cs.AI 79%

Feature-Guided SAE Steering for Refusal-Rate Control using Contrasting Prompts

Samaksh Bhargav, Zining Zhu

机构 * Edison Academy Magnet School New Jersey, USA(新泽西州埃迪森磁校) Department of Computer Science(计算机科学系) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16240 2025-11-04 cs.RO 78%

Cosmos-Surg-dVRK: World Foundation Model-based Automated Online Evaluation of Surgical Robot Policy Learning

Lukas Zbinden, Nigel Nelson, Juo-Tung Chen, Xinhao Chen, Ji Woong Kim, Mahdi Azizian, Axel Krieger, Sean Huver

机构 * NVIDIA Johns Hopkins University(约翰霍普金斯大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :foundation model(title,abstract)

Comments minor metadata and notation fixes; +3 citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01360 2025-11-04 cs.CL 77%

Safer in Translation? Presupposition Robustness in Indic Languages

Aadi Palnitkar, Arjun Suresh, Rishi Rajesh, Puneet Puli

机构 * University of Maryland, College Park (UMD) College Park, MD, USA(马里兰大学 College Park 分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments This is a submission to LREC 2026 (Language Resources and Evaluation Conference 2026). Corresponding author: aadipalnitkar96@gmail.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01261 2025-11-04 cs.SD cs.AI eess.AS 77%

Speech-DRAME: A Framework for Human-Aligned Benchmarks in Speech Role-Play

Jiatong Shi, Jionghao Han, Yichen Lu, Santiago Pascual, Pengfei Wu, Chenye Cui, Shinji Watanabe, Chao Weng, Cong Zhou

机构 * Carnegie Mellon University(卡内基梅隆大学) Anuttacon(安纳塔康)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

Comments 67 pages

详情

展开后加载摘要…

URL PDF HTML 收藏