arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-18 至 2025-09-18 共收录 154 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 41 篇

2509.13905 2025-09-18 cs.CL cs.AI 88%

Do Large Language Models Understand Word Senses?

Domenico Meconi, Simone Stirpe, Federico Martelli, Leonardo Lavalle, Roberto Navigli

机构 * Babelscape Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 20 pages, to be published in EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01081 2025-09-18 cs.CL cs.AI 88%

Assessing Large Language Models on Islamic Legal Reasoning: Evidence from Inheritance Law Evaluation

Abdessalam Bouchekif, Samer Rashwani, Heba Sbahi, Shahd Gaben, Mutaz Al-Khatib, Mohammed Ghaly

机构 * Hamad Bin Khalifa University(哈马德·本·卡西姆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 10 pages, 7 Tables, Code: https://github.com/bouchekif/inheritance_evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00269 2025-09-18 cs.CL 88%

A review of faithfulness metrics for hallucination assessment in Large Language Models

Ben Malin, Tatiana Kalganova, Nikoloas Boulgouris

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);prompting(abstract)

Comments 13 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07107 2025-09-18 cs.CL cs.IR 88%

Large Language Models for Information Retrieval: A Survey

Yutao Zhu, Huaying Yuan, Shuting Wang, Jiongnan Liu, Wenhan Liu, Chenlong Deng, Haonan Chen, Zheng Liu, Zhicheng Dou, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence and School of Information, Renmin University of China(中国人民大学信息学院和首都人工智能学院) Beijing Academy of Artificial Intelligence, China(北京人工智能研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Updated to version 4; Accepted by ACM TOIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16405 2025-09-18 cs.MM 88%

EEmo-Bench: A Benchmark for Multi-modal Large Language Models on Image Evoked Emotion Assessment

Lancheng Gao, Ziheng Jia, Yunhao Zeng, Wei Sun, Yiming Zhang, Wei Zhou, Guangtao Zhai, Xiongkuo Min

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10970 2025-09-18 cs.LG cs.AI 87%

The Psychogenic Machine: Simulating AI Psychosis, Delusion Reinforcement and Harm Enablement in Large Language Models

Joshua Au Yeung, Jacopo Dalmasso, Luca Foschini, Richard JB Dobson, Zeljko Kraljevic

机构 * King’s College Hospital(国王学院医院) Nuraxi AI Dev and Doc: AI for Healthcare(Nuraxi AI 人工智能医疗) Sage Bionetworks(Sage 生物网络) University College London(伦敦大学学院) King’s College London(国王学院伦敦)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13603 2025-09-18 cs.IR cs.AI 85%

Modernizing Facebook Scoped Search: Keyword and Embedding Hybrid Retrieval with LLM Evaluation

Yongye Su, Zeya Zhang, Jane Kou, Cheng Ju, Shubhojeet Sarkar, Yamin Wang, Ji Liu, Shengbo Guo

机构 * Meta

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 5 Pages, work done as Yongye Su's internship project at Meta

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09334 2025-09-18 cs.CR cs.AI 83%

CyberLLMInstruct: A Pseudo-malicious Dataset Revealing Safety-performance Trade-offs in Cyber Security LLM Fine-tuning

Adel ElZemity, Budi Arief, Shujun Li

机构 * University of Kent(肯特大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15022 2025-09-18 cs.CL 81%

Mind the Style Gap: Meta-Evaluation of Style and Attribute Transfer Metrics

Amalie Brogaard Pauli, Isabelle Augenstein, Ira Assent

机构 * Department of Computer Science, Aarhus University, Denmark(计算机科学系,奥胡斯大学) Department of Computer Science, University of Copenhagen, Denmark(计算机科学系,哥本哈根大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);small language model(abstract);prompting(abstract)

Comments Accepted at EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02358 2025-09-18 cs.LG cs.AI 81%

Empowering Time Series Analysis with Foundation Models: A Comprehensive Survey

Jiexia Ye, Yongzi Yu, Weiqi Zhang, Le Wang, Jia Li, Fugee Tsung

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Shanghai University of Finance and Economics(上海财经大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

Comments 10 figures, 5 tables, 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23804 2025-09-18 cs.CL cs.AI cs.LG 80%

Calibrating LLMs for Text-to-SQL Parsing by Leveraging Sub-clause Frequencies

Terrance Liu, Shuyi Wang, Daniel Preotiuc-Pietro, Yash Chandarana, Chirag Gupta

机构 * Carnegie Mellon University(卡内基梅隆大学) Bloomberg(彭博)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07445 2025-09-18 cs.CL cs.AI cs.LG 80%

Forget What You Know about LLMs Evaluations -- LLMs are Like a Chameleon

Nurit Cohen-Inger, Yehonatan Elisha, Bracha Shapira, Lior Rokach, Seffi Cohen

机构 * Ben Gurion University(本· Gurion 大学) Tel Aviv University(特拉维夫大学) Harvard University(哈佛大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13836 2025-09-18 cs.CV cs.CL 79%

Diving into Mitigating Hallucinations from a Vision Perspective for Large Vision-Language Models

Weihang Wang, Xinhao Li, Ziyue Wang, Yan Pang, Jielei Zhang, Peiyi Li, Qiang Zhang, Longwen Gao

机构 * Bilibili(哔哩哔哩) UESTC University of Virginia(弗吉尼亚大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments Accepted by EMNLP2025 Finding

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13642 2025-09-18 cs.LG cs.CV 79%

LLM-I: LLMs are Naturally Interleaved Multimodal Creators

Zirun Guo, Feng Zhang, Kai Jia, Tao Jin

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01153 2025-09-18 cs.HC cs.AI cs.LG 79%

Catch Me if You Search: When Contextual Web Search Results Affect the Detection of Hallucinations

Mahjabin Nahar, Eun-Ju Lee, Jin Won Park, Dongwon Lee

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Department of Communication & Center for Trustworthy Artificial Intelligence (CTAI)(通信系与可信人工智能中心) Seoul National University(首尔国立大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted to Computers in Human Behavior

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00308 2025-09-18 cs.CY cs.AI cs.CL cs.HC 79%

MythTriage: Scalable Detection of Opioid Use Disorder Myths on a Video-Sharing Platform

Hayoung Jung, Shravika Mittal, Ananya Aatreya, Navreet Kaur, Munmun De Choudhury, Tanushree Mitra

机构 * Princeton University(普林斯顿大学) University of Washington(华盛顿大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments To appear at EMNLP 2025. Please cite EMNLP version when proceedings are available

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13572 2025-09-18 cs.RO 78%

Using Visual Language Models to Control Bionic Hands: Assessment of Object Perception and Grasp Inference

Ozan Karaali, Hossam Farag, Strahinja Dosen, Cedomir Stefanovic

机构 * Department of Electronic Systems, Aalborg University, Denmark(电子系统系,奥胡斯大学) Department of Health Science and Technology, Aalborg University, Denmark(健康科学与技术系,奥胡斯大学)

专题命中 评测与基准 :language model(title,abstract)

Comments ICAT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06652 2025-09-18 cs.CL 77%

IntrEx: A Dataset for Modeling Engagement in Educational Conversations

Xingwei Tan, Mahathi Parvatham, Chiara Gambi, Gabriele Pergola

机构 * Department of Computer Science, University of Warwick, UK(沃里克大学计算机科学系) School of Computer Science, University of Sheffield, UK(谢菲尔德大学计算机科学学院) Department of Psychology, University of Warwick, UK(沃里克大学心理学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL

Comments EMNLP 2025 Findings camera-ready, 9+7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14187 2025-09-18 eess.AS 75%

Read to Hear: A Zero-Shot Pronunciation Assessment Using Textual Descriptions and LLMs

Yu-Wen Chen, Melody Ma, Julia Hirschberg

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments EMNLP 2025 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18325 2025-09-18 cs.AI cs.LG 73%

Understanding and Mitigating Overrefusal in LLMs from an Unveiling Perspective of Safety Decision Boundary

Licheng Pan, Yongqi Tong, Xin Zhang, Xiaolu Zhang, Jun Zhou, Zhixuan Chu

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) Language and Machine Intelligence Department, Ant Group(蚂蚁集团语言与机器智能部门)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13706 2025-09-18 cs.CL cs.AI 73%

Automated Triaging and Transfer Learning of Incident Learning Safety Reports Using Large Language Representational Models

Peter Beidler, Mark Nguyen, Kevin Lybarger, Ola Holmberg, Eric Ford, John Kang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13672 2025-09-18 cs.CL cs.AI 73%

CL$^2$GEC: A Multi-Discipline Benchmark for Continual Learning in Chinese Literature Grammatical Error Correction

Shang Qin, Jingheng Ye, Yinghui Li, Hai-Tao Zheng, Qi Li, Jinxiao Shan, Zhixing Li, Hong-Gee Kim

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Peng Cheng Laboratory(鹏城实验室) China Merchants Group(中国远洋集团) Zhipu AI(智谱AI) Seoul National University(首尔国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10327 2025-09-18 cs.CR 71%

BERTector: An Intrusion Detection Framework Constructed via Joint-dataset Learning Based on Language Model

Haoyang Hu, Xun Huang, Chenyu Wu, Shiwen Liu, Zhichao Lian, Shuangquan Zhang

专题命中 评测与基准 :language model(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13814 2025-09-18 cs.CL 70%

Findings of the Third Automatic Minuting (AutoMin) Challenge

Kartik Shinde, Laurent Besacier, Ondrej Bojar, Thibaut Thonet, Tirthankar Ghosal

机构 * NAVER Labs Europe(NAVER欧洲实验室) Charles University(查尔斯大学) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Automin 2025 Website: https://ufal.github.io/automin-2025/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13782 2025-09-18 cs.SE cs.AI cs.MA 70%

Who is Introducing the Failure? Automatically Attributing Failures of Multi-Agent Systems via Spectrum Analysis

Yu Ge, Linna Xie, Zhong Li, Yu Pei, Tian Zhang

机构 * Nanjing University(南京大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13569 2025-09-18 cs.CL 70%

Overview of Dialog System Evaluation Track: Dimensionality, Language, Culture and Safety at DSTC 12

John Mendonça, Lining Zhang, Rahul Mallidi, Alon Lavie, Isabel Trancoso, Luis Fernando D'Haro, João Sedoc

机构 * INESC-ID Instituto Superior Técnico - University of Lisbon(理工学院 - 里斯本大学) Department of Technology, Operations, and Statistics, New York University(技术、运营与统计系,纽约大学) Speech Technology and Machine Learning Group - Universidad Politécnica de Madrid(语音技术与机器学习小组 - 马德里理工大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments DSTC12 Track 1 Overview Paper. https://chateval.org/dstc12

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19749 2025-09-18 cs.CL 70%

What's Not Said Still Hurts: A Description-Based Evaluation Framework for Measuring Social Bias in LLMs

Jinhao Pan, Chahat Raj, Ziyu Yao, Ziwei Zhu

机构 * George Mason University(乔治·马歇尔大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01086 2025-09-18 cs.CV cs.AI 70%

DPDEdit: Detail-Preserved Diffusion Models for Multimodal Fashion Image Editing

Xiaolong Wang, Zhi-Qi Cheng, Jue Wang, Xiaojiang Peng

机构 * Shenzhen Technology University(深圳科技大学) University of Washington(华盛顿大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 13 pages,12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09595 2025-09-18 cs.CV 67%

Kling-Avatar: Grounding Multimodal Instructions for Cascaded Long-Duration Avatar Animation Synthesis

Yikang Ding, Jiwen Liu, Wenyuan Zhang, Zekun Wang, Wentao Hu, Liyuan Cui, Mingming Lao, Yingchao Shao, Hui Liu, Xiaohan Li, Ming Chen, Xiaoqiang Liu, Yu-Shen Liu, Pengfei Wan

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments Technical Report. Project Page: https://klingavatar.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13941 2025-09-18 cs.SE cs.AI cs.CL 62%

An Empirical Study on Failures in Automated Issue Solving

Simiao Liu, Fang Liu, Liehao Li, Xin Tan, Yinghao Zhu, Xiaoli Lian, Li Zhang

机构 * Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏