arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-19 至 2025-09-19 共收录 173 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 29 篇

2502.18042 2025-09-19 cs.CV cs.AI 57%

VLM-E2E: Enhancing End-to-End Autonomous Driving with Multimodal Driver Attention Fusion

Pei Liu, Haipeng Liu, Haichao Liu, Xin Liu, Jinxin Ni, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Li Auto Inc.(Li汽车公司) the School of Aeronautics and Astronautics, Xiamen University(厦门大学航空航天学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07917 2025-09-19 cs.RO 50%

MolmoAct: Action Reasoning Models that can Reason in Space

Jason Lee, Jiafei Duan, Haoquan Fang, Yuquan Deng, Shuo Liu, Boyang Li, Bohan Fang, Jieyu Zhang, Yi Ru Wang, Sangho Lee, Winson Han, Wilbert Pumacay, Angelica Wu, Rose Hendrix, Karen Farley, Eli VanderBilt, Ali Farhadi, Dieter Fox, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :foundation model(abstract)

Comments Updated GR00T result to N1.5

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 55 篇

2509.14519 2025-09-19 cs.LG cs.AI cs.CR 90%

BEACON: Behavioral Malware Classification with Large Language Model Embeddings and Deep Learning

Wadduwage Shanika Perera, Haodi Jiang

机构 * Department of Computer Science(计算机科学系) Sam Houston State University(萨姆霍茨州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14749 2025-09-19 cs.CL cs.IR 89%

Evaluating Large Language Models for Cross-Lingual Retrieval

Longfei Zuo, Pingjun Hong, Oliver Kraus, Barbara Plank, Robert Litschko

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted at EMNLP 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14623 2025-09-19 cs.SE cs.AI cs.PL cs.SY eess.SY 89%

Automating Modelica Module Generation Using Large Language Models: A Case Study on Building Control Description Language

Hanlong Wan, Xing Lu, Yan Chen, Karthik Devaprasad, Laura Hinkle

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments This is the pre-peer-review version of a journal paper; the repo is available at: https://github.com/pnnl/prompt2control

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12629 2025-09-19 cs.SE 89%

Ensembling Large Language Models for Code Vulnerability Detection: An Empirical Evaluation

Zhihong Sun, Jia Li, Yao Wan, Chuanyi Li, Hongyu Zhang, Zhi jin, Ge Li, Hong Liu, Chen Lyu, Songlin Hu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19335 2025-09-19 cs.HC 89%

Knoll: Creating a Knowledge Ecosystem for Large Language Models

Dora Zhao, Diyi Yang, Michael S. Bernstein

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 21 pages, 8 figures, 7 tables; see https://stanfordhci.github.io/knoll/

Journal ref UIST 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16307 2025-09-19 cs.CL cs.AI cs.LG 89%

PMPO: Probabilistic Metric Prompt Optimization for Small and Large Language Models

Chenzhuo Zhao, Ziqian Liu, Xinda Wang, Junting Lu, Chaoyi Ruan

机构 * Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15218 2025-09-19 cs.CL 88%

LNE-Blocking: An Efficient Framework for Contamination Mitigation Evaluation on Large Language Models

Ruijie Hou, Yueyang Jiao, Hanxu Hu, Yingming Li, Wai Lam, Huajian Zhang, Hongyuan Lu

机构 * Zhejiang University(浙江大学) FaceMind Corporation(FaceMind公司) University of Zurich(苏黎世大学) The Chinese University of Hong Kong(香港中文大学) Westlake University(西湖大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15114 2025-09-19 cs.CL 88%

Large Language Model probabilities cannot distinguish between possible and impossible language

Evelina Leivada, Raquel Montero, Paolo Morosi, Natalia Moskvina, Tamara Serrano, Marcel Aguilar, Fritz Guenther

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14922 2025-09-19 cs.CL 88%

A Comparative Evaluation of Large Language Models for Persian Sentiment Analysis and Emotion Detection in Social Media Texts

Kian Tohidi, Kia Dashtipour, Simone Rebora, Sevda Pourfaramarz

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 19 pages, 8 Figures, 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14546 2025-09-19 cs.AI 88%

Rationality Check! Benchmarking the Rationality of Large Language Models

Zhilun Zhou, Jing Yi Wang, Nicholas Sukiennik, Chen Gao, Fengli Xu, Yong Li, James Evans

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系、BNRist、清华大学) Department of Sociology, University of Chicago(社会学系、芝加哥大学) Santa Fe Institute(圣菲研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15027 2025-09-19 cs.CL cs.AI 87%

CLEAR: A Comprehensive Linguistic Evaluation of Argument Rewriting by Large Language Models

Thomas Huber, Christina Niklaus

机构 * University of St. Gallen(圣加尔登大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14624 2025-09-19 cs.CL cs.AI cs.LG 87%

Reveal and Release: Iterative LLM Unlearning with Self-generated Data

Linxi Xie, Xin Teng, Shichang Ke, Hongyi Wen, Shengjie Wang

机构 * New York University Shanghai(纽约大学上海)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14404 2025-09-19 cs.SE cs.AI cs.CL cs.PL 86%

A Taxonomy of Prompt Defects in LLM Systems

Haoye Tian, Chong Wang, BoYang Yang, Lyuye Zhang, Yang Liu

机构 * School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院) Jisuan Institute of Technology, Beijing JudaoYouda Network Technology Co. Ltd.(智算技术研究所,北京judaoYouda网络技术有限公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19477 2025-09-19 cs.AI 85%

Judging with Many Minds: Do More Perspectives Mean Less Prejudice? On Bias Amplifications and Resistance in Multi-Agent Based LLM-as-Judge

Chiyu Ma, Enpei Zhang, Yilun Zhao, Wenjun Liu, Yaning Jia, Peijun Qing, Lin Shi, Arman Cohan, Yujun Yan, Soroush Vosoughi

机构 * Dartmouth College(达特茅斯学院) Yale University(耶鲁大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19176 2025-09-19 cs.CL 85%

Assistant-Guided Mitigation of Teacher Preference Bias in LLM-as-a-Judge

Zhuo Liu, Moxin Li, Xun Deng, Qifan Wang, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Meta AI

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06469 2025-09-19 cs.AI cs.HC 85%

KCluster: An LLM-based Clustering Approach to Knowledge Component Discovery

Yumou Wei, Paulo Carvalho, John Stamper

机构 * Human-Computer Interaction Institute(人机交互研究所) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted to the Educational Data Mining (EDM) 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14668 2025-09-19 cs.AR 85%

DeepAssert: An LLM-Aided Verification Framework with Fine-Grained Assertion Generation for Modules with Extracted Module Specifications

Yonghao Wang, Jiaxin Zhou, Hongqin Lyu, Zhiteng Chao, Tiancheng Wang, Huawei Li

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 7 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14483 2025-09-19 cs.SE 85%

An LLM-based multi-agent framework for agile effort estimation

Thanh-Long Bui, Hoa Khanh Dam, Rashina Hoda

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Submitted to ASE'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14515 2025-09-19 cs.CL cs.SD eess.AS 83%

From Turn-Taking to Synchronous Dialogue: A Survey of Full-Duplex Spoken Language Models

Yuxuan Chen, Haoyuan Yu

机构 * Jilin University, Changchun, China(吉林大学) Hunan University, Changsha, China(湖南大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14543 2025-09-19 cs.CL cs.AI 82%

Catch Me If You Can? Not Yet: LLMs Still Struggle to Imitate the Implicit Writing Styles of Everyday Authors

Zhengxiang Wang, Nafis Irtiza Tripto, Solha Park, Zhenzhen Li, Jiawei Zhou

机构 * Stony Brook University(石英溪大学) The Pennsylvania State University(宾夕法尼亚州立大学) Bosch Center for AI(博世人工智能中心)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments EMNLP 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02591 2025-09-19 eess.IV cs.AI cs.CV 79%

Ensemble of Pathology Foundation Models for MIDOG 2025 Track 2: Atypical Mitosis Classification

Mieko Ochi, Bae Yuan

机构 * Department of Pathology, Japanese Red Cross Medical Center(病理科,日本红十字医疗中心)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14279 2025-09-19 cs.SE cs.AI cs.LG 79%

Towards Robust Agentic CUDA Kernel Benchmarking, Verification, and Optimization

Robert Tjarko Lange, Qi Sun, Aaditya Prasad, Maxence Faldor, Yujin Tang, David Ha

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 62 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14267 2025-09-19 cs.CL cs.AI cs.IT math.IT 79%

Graph-Enhanced Retrieval-Augmented Question Answering for E-Commerce Customer Support

Piyushkumar Patel

机构 * Microsoft(微软)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14739 2025-09-19 cs.CV 78%

FMGS-Avatar: Mesh-Guided 2D Gaussian Splatting with Foundation Model Priors for 3D Monocular Avatar Reconstruction

Jinlong Fan, Bingyu Hu, Xingguang Li, Yuxiang Yang, Jing Zhang

机构 * HangZhou Dianzi University(杭州电子大学) Shenzhen Polytechnic University(深圳职业技术大学) WuHan University(武汉大学)

专题命中 评测与基准 :foundation model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15020 2025-09-19 cs.CL 77%

Mind the Gap: A Closer Look at Tokenization for Multiple-Choice Question Answering with LLMs

Mario Sanz-Guerrero, Minh Duc Bui, Katharina von der Wense

机构 * Johannes Gutenberg University Mainz(法兰克福-马因茨大学) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14477 2025-09-19 cs.CL 77%

Ticket-Bench: A Kickoff for Multilingual and Regionalized Agent Evaluation

Thales Sales Almeida, João Guilherme Alves Santos, Thiago Laitz, Giovana Kerche Bonás

机构 * Institute of Computing (IC) State University of Campinas(计算学院(IC)坎皮纳斯州立大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14436 2025-09-19 cs.IR cs.AI 77%

When Content is Goliath and Algorithm is David: The Style and Semantic Effects of Generative Search Engine

Lijia Ma, Juan Qin, Xingchen Xu, Yong Tan

机构 * Belk College of Business, University of North Carolina at Charlotte(北卡罗来纳州立大学查尔斯顿分校商学院) Faculty of Business for Science and Technology, School of Management, University of Science and Technology of China(中国科学技术大学管理学院科学技术商学院) Michael G. Foster School of Business, University of Washington(华盛顿大学Michael G. Foster商学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 59 pages, 6 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18650 2025-09-19 cs.CL 77%

Single- vs. Dual-Prompt Dialogue Generation with LLMs for Job Interviews in Human Resources

Joachim De Baer, A. Seza Doğruöz, Thomas Demeester, Chris Develder

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 12 pages. Accepted to the Fourth Workshop on Generation, Evaluation and Metrics (GEM^2) at ACL 2025. ACL Anthology version available at https://aclanthology.org/2025.gem-1.74

Journal ref Proceedings of the Fourth Workshop on Generation, Evaluation and Metrics (GEM^2), pages 947-957, Vienna, Austria and virtual meeting, August 2025. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏