arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-04 至 2025-11-04 共收录 368 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 92 篇

2511.01340 2025-11-04 cs.CV cs.CL 79%

$\left|\,\circlearrowright\,\boxed{\text{BUS}}\,\right|$: A Large and Diverse Multimodal Benchmark for evaluating the ability of Vision-Language Models to understand Rebus Puzzles

Trishanu Das, Abhilash Nandy, Khush Bajaj, Deepiha S

机构 * Tredence Inc.(特伦德公司) Indian Institute of Technology Kharagpur(印度理工学院克拉格浦尔分校) Inria Paris-Rocquencourt(巴黎-罗克琴库特研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒姆研究实验室)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments 7 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00193 2025-11-04 cs.RO cs.LG 79%

Reducing Robotic Upper-Limb Assessment Time While Maintaining Precision: A Time Series Foundation Model Approach

Faranak Akbarifar, Nooshin Maghsoodi, Sean P Dukelow, Stephen Scott, Parvin Mousavi

机构 * School of Computing(计算学院) Queen’s University(皇后大学) Hotchkiss Brain Institute(霍克奇斯脑研究所) University of Calgary(卡尔加里大学) Centre for Neuroscience Studies(神经科学研究中心) Providence Care Hospital(普罗维登斯护理医院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12149 2025-11-04 cs.CL cs.MM cs.SI 79%

Seeing Sarcasm Through Different Eyes: Analyzing Multimodal Sarcasm Perception in Large Vision-Language Models

Junjie Chen, Xuyang Liu, Subin Huang, Linfeng Zhang, Hang Yu

机构 * Anhui Polytechnic University (AHPU)(安徽工程大学) Shanghai University (SHU)(上海大学) Shanghai Jiao Tong University (SJTU)(上海交通大学) Sichuan University (SCU)(四川大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18771 2025-11-04 cs.CL 79%

CheckEval: A reliable LLM-as-a-Judge framework for evaluating text generation using checklists

Yukyung Lee, Joonghoon Kim, Jaehee Kim, Hyowon Cho, Jaewook Kang, Pilsung Kang, Najoung Kim

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18079 2025-11-04 cs.CV cs.AI cs.CL 79%

Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding

Xiaoyi Zhang, Zhaoyang Jia, Zongyu Guo, Jiahao Li, Bin Li, Houqiang Li, Yan Lu

机构 * Microsoft Research Asia(微软亚洲研究院) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00222 2025-11-04 cs.CL cs.AI 79%

Consistently Simulating Human Personas with Multi-Turn Reinforcement Learning

Marwa Abdulhai, Ryan Cheng, Donovan Clay, Tim Althoff, Sergey Levine, Natasha Jaques

机构 * UC Berkeley(伯克利大学) University of Washington(华盛顿大学) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07017 2025-11-04 cs.CL cs.AI 79%

Finding Words Associated with DIF: Predicting Differential Item Functioning using LLMs and Explainable AI

Hotaka Maeda, Yikai Lu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 14 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00029 2025-11-04 cs.LG cs.AI 79%

Feature-Guided SAE Steering for Refusal-Rate Control using Contrasting Prompts

Samaksh Bhargav, Zining Zhu

机构 * Edison Academy Magnet School New Jersey, USA(新泽西州埃迪森磁校) Department of Computer Science(计算机科学系) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16240 2025-11-04 cs.RO 78%

Cosmos-Surg-dVRK: World Foundation Model-based Automated Online Evaluation of Surgical Robot Policy Learning

Lukas Zbinden, Nigel Nelson, Juo-Tung Chen, Xinhao Chen, Ji Woong Kim, Mahdi Azizian, Axel Krieger, Sean Huver

机构 * NVIDIA Johns Hopkins University(约翰霍普金斯大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :foundation model(title,abstract)

Comments minor metadata and notation fixes; +3 citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01360 2025-11-04 cs.CL 77%

Safer in Translation? Presupposition Robustness in Indic Languages

Aadi Palnitkar, Arjun Suresh, Rishi Rajesh, Puneet Puli

机构 * University of Maryland, College Park (UMD) College Park, MD, USA(马里兰大学 College Park 分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments This is a submission to LREC 2026 (Language Resources and Evaluation Conference 2026). Corresponding author: aadipalnitkar96@gmail.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01261 2025-11-04 cs.SD cs.AI eess.AS 77%

Speech-DRAME: A Framework for Human-Aligned Benchmarks in Speech Role-Play

Jiatong Shi, Jionghao Han, Yichen Lu, Santiago Pascual, Pengfei Wu, Chenye Cui, Shinji Watanabe, Chao Weng, Cong Zhou

机构 * Carnegie Mellon University(卡内基梅隆大学) Anuttacon(安纳塔康)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

Comments 67 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03659 2025-11-04 cs.CL 77%

Trustworthy Medical Question Answering: An Evaluation-Centric Survey

Yinuo Wang, Baiyang Wang, Robert E. Mercer, Frank Rudzicz, Sudipta Singha Roy, Pengjie Ren, Zhumin Chen, Xindi Wang

机构 * Shandong University(山东大学) University of Western Ontario(西方大学) Dalhousie University(达尔豪斯大学) University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00197 2025-11-04 cs.SE cs.AI 77%

Understanding Code Agent Behaviour: An Empirical Study of Success and Failure Trajectories

Oorja Majgaonkar, Zhiwei Fei, Xiang Li, Federica Sarro, He Ye

机构 * University College London(伦敦大学学院) Nanjing University(南京大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26101 2025-11-04 cs.CL cs.PL quant-ph 77%

QCoder Benchmark: Bridging Language Generation and Quantum Hardware through Simulator-Based Feedback

Taku Mikuriya, Tatsuya Ishigaki, Masayuki Kawarada, Shunya Minami, Tadashi Kadowaki, Yohichi Suzuki, Soshun Naito, Shunya Takata, Takumi Kato, Tamotsu Basseda, Reo Yamada, Hiroya Takamura

机构 * National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院) Yokohama National University(Yokohama国立大学) CyberAgent, Inc.(CyberAgent公司) DENSO CORPORATION(DENSO公司) The University of Tokyo(东京大学) Keio University(庆应义塾大学) NTT DATA GROUP Corporation(NTT DATA集团公司) Miletos inc.(Miletos公司) University of Tsukuba(筑波大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to INLG2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07229 2025-11-04 cs.CL 77%

SynthTextEval: Synthetic Text Data Generation and Evaluation for High-Stakes Domains

Krithika Ramesh, Daniel Smolyak, Zihao Zhao, Nupoor Gandhi, Ritu Agarwal, Margrét Bjarnadóttir, Anjalie Field

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Maryland, College Park(马里兰大学学院公园分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP 2025 System Demonstration

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18462 2025-11-04 cs.LG cs.CR 77%

MistralBSM: Leveraging Mistral-7B for Vehicular Networks Misbehavior Detection

Wissal Hamhoum, Soumaya Cherkaoui

机构 * Department of Computer and Software Engineering(计算机与软件工程系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00843 2025-11-04 cs.HC 75%

Portal UX Agent -- A Plug-and-Play Engine for Rendering UIs from Natural Language Specifications

Xinsong Li, Ning Jiang, Jay Selvaraj

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00280 2025-11-04 cs.LG cs.AI cs.CL 75%

Calibration Across Layers: Understanding Calibration Evolution in LLMs

Abhinav Joshi, Areeb Ahmad, Ashutosh Modi

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Indian Institute of Technology Kanpur (IIT Kanpur)(印度理工学院坎浦尔(IIT坎浦尔))

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at EMNLP 2025 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25760 2025-11-04 cs.CV 75%

Multimodal Spatial Reasoning in the Large Model Era: A Survey and Benchmarks

Xu Zheng, Zihao Dongfang, Lutao Jiang, Boyuan Zheng, Yulong Guo, Zhenquan Zhang, Giuliano Albanese, Runyi Yang, Mengjiao Ma, Zixin Zhang, Chenfei Liao, Dingcheng Zhen, Yuanhuiyi Lyu, Yuqian Fu, Bin Ren, Linfeng Zhang, Danda Pani Paudel, Nicu Sebe, Luc Van Gool, Xuming Hu

专题命中 评测与基准 :large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00657 2025-11-04 cs.CL 74%

Do You Know About My Nation? Investigating Multilingual Language Models' Cultural Literacy Through Factual Knowledge

Eshaan Tanwar, Anwoy Chatterjee, Michael Saxon, Alon Albalak, William Yang Wang, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度理工学院德里) University of Washington(华盛顿大学) Lila Sciences(Lila科学) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 评测与基准 :language model(title);分类 cs.CL

Comments Accepted in EMNLP 2025. Code at: https://github.com/EshaanT/XNationQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04721 2025-11-04 cs.CL 74%

SPARTA ALIGNMENT: Collectively Aligning Multiple Language Models through Combat

Yuru Jiang, Wenxuan Ding, Shangbin Feng, Greg Durrett, Yulia Tsvetkov

机构 * Zhejiang University(浙江大学) New York University(纽约大学) University of Washington(华盛顿大学)

专题命中 评测与基准 :language model(title);分类 cs.CL

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19954 2025-11-04 cs.AI cs.DB cs.LG 73%

RELATE: A Schema-Agnostic Perceiver Encoder for Multimodal Relational Graphs

Joe Meyer, Divyansha Lachi, Mahmoud Mohammadi, Roshan Reddy Upendra, Eva L. Dyer, Mark Li, Tom Palczewski

机构 * SAP Palo Alto, CA, USA(SAP帕洛阿尔托分校) University of Pennsylvania(宾夕法尼亚大学) SAP Seattle, WA, USA(SAP西雅图分校)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21907 2025-11-04 cs.CL cs.AI 73%

A Large-Scale Dataset and Citation Intent Classification in Turkish with LLMs

Kemal Sami Karaca, Bahaeddin Eravcı

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Submitted to IEEE UBMK 2025 International Conference on Computer Science and Engineering

Journal ref In Proceedings of the 10th International Conference on Computer Science and Engineering (UBMK) 1 (2025) 509-514

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17050 2025-11-04 cs.CL cs.AI cs.CE cs.CY cs.MM 73%

Towards Robust Evaluation of STEM Education: Leveraging MLLMs in Project-Based Learning

Xinyi Wu, Yanhao Jia, Qinglin Zhang, Yiran Qin, Luwei Xiao, Shuai Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17048 2025-11-04 cs.CL cs.AI cs.CY q-fin.CP q-fin.GN 73%

Words That Unite The World: A Unified Framework for Deciphering Central Bank Communications Globally

Agam Shah, Siddhant Sukhani, Huzaifa Pardawala, Saketh Budideti, Riya Bhadani, Rudra Gopal, Siddhartha Somani, Rutwik Routu, Michael Galarnyk, Soungmin Lee, Arnav Hiray, Akshar Ravichandran, Eric Kim, Pranav Aluru, Joshua Zhang, Sebastian Jaskowski, Veer Guda, Meghaj Tarte, Liqin Ye, Spencer Gosden, Rachel Yuh, Sloka Chava, Sahasra Chava, Dylan Patrick Kelly, Aiden Chiang, Harsit Mittal, Sudheer Chava

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at NeurIPS 2025 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03343 2025-11-04 cs.CR cs.AI cs.CL 73%

What Features in Prompts Jailbreak LLMs? Investigating the Mechanisms Behind Attacks

Nathalie Kirch, Constantin Weisser, Severin Field, Helen Yannakoudakis, Stephen Casper

机构 * King’s College London(伦敦国王学院) Imperial College London(伦敦帝国学院) Deepgram University of Louisville(路易斯维尔大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15413 2025-11-04 cs.CL cs.AI 73%

A Comprehensive Evaluation of Cognitive Biases in LLMs

Simon Malberg, Roman Poletukhin, Carolin M. Schuster, Georg Groh

机构 * School of Computation, Information and Technology(计算、信息与技术学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Published in "Proceedings of the 5th International Conference on Natural Language Processing for Digital Humanities"

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01365 2025-11-04 cs.CL 72%

The Ouroboros of Benchmarking: Reasoning Evaluation in an Era of Saturation

İbrahim Ethem Deveci, Duygu Ataman

机构 * Department of Cognitive Science(认知科学系) Graduate School of Informatics(信息科学研究生院) Middle East Technical University(中东部技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL;LLM(comments)

Comments Accepted to NeurIPS 2025 Workshop on LLM Evaluation (https://openreview.net/group?id=NeurIPS.cc/2025/Workshop/LLM_Evaluation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09068 2025-11-04 cs.CL cs.HC 70%

S-DAT: A Multilingual, GenAI-Driven Framework for Automated Divergent Thinking Assessment

Jennifer Haase, Paul H. P. Hanel, Sebastian Pokutta

机构 * Weizenbaum Institute and Humboldt University Berlin(魏泽内堡研究所和柏林洪堡大学) University of Essex(埃塞克斯大学) TU Berlin and Zuse Institute Berlin(柏林技术大学和柏林泽尼克研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07653 2025-11-04 cs.CL 70%

JobHop: A Large-Scale Dataset of Career Trajectories

Iman Johary, Raphael Romero, Alexandru C. Mara, Tijl De Bie

机构 * IDLab Ghent University(IDLab 格根大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏