arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-10 至 2025-10-10 共收录 247 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 66 篇

2510.08511 2025-10-10 cs.AI cs.CL cs.LG 80%

AutoMLGen: Navigating Fine-Grained Optimization for Coding Agents

Shangheng Du, Xiangchao Yan, Dengyang Jiang, Jiakang Yuan, Yusong Hu, Xin Li, Liang He, Bo Zhang, Lei Bai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21889 2025-10-10 cs.CL 79%

QoNext: Towards Next-generation QoE for Foundation Models

Yijin Guo, Zicheng Zhang, Ye Shen, Farong Wen, Junying Wang, Qi Jia, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07920 2025-10-10 cs.AI 79%

Profit Mirage: Revisiting Information Leakage in LLM-based Financial Agents

Xiangyu Li, Yawen Zeng, Xiaofen Xing, Jin Xu, Xiangmin Xu

机构 * South China University of Technology(华南理工大学) Pazhou Lab(黄埔实验室)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00088 2025-10-10 cs.CR cs.AI cs.LG 79%

AEGIS : Automated Co-Evolutionary Framework for Guarding Prompt Injections Schema

Ting-Chun Liu, Ching-Yu Hsu, Kuan-Yi Lee, Chi-An Fu, Hung-yi Lee

机构 * Electrical Engineering, National Taiwan University(国家台湾大学电子工程系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20875 2025-10-10 cs.CL cs.AI 79%

Trans-EnV: A Framework for Evaluating the Linguistic Robustness of LLMs Against English Varieties

Jiyoung Lee, Seungho Kim, Jieun Han, Jun-Min Lee, Kitaek Kim, Alice Oh, Edward Choi

机构 * KAIST(韩国科学技术院) Suresoft Technologies(Suresoft技术公司) Seoul National University(首尔国立大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2025 Track on Datasets and Benchmarks (27 pages, 6 figures, 16 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01571 2025-10-10 cs.CV 78%

PainFormer: a Vision Foundation Model for Automatic Pain Assessment

Stefanos Gkikas, Raul Fernandez Rojas, Manolis Tsiknakis

机构 * Hellenic Mediterranean University, Department of Electrical and Computer Engineering(希腊地中海大学电子与计算机工程系) Institute of Computer Science, Foundation for Research & Technology-Hellas(希腊研究所计算机科学研究所) University of Canberra, Faculty of Science and Technology(堪培拉大学科学与技术学院)

专题命中 评测与基准 :foundation model(title,abstract)

Journal ref IEEE Transactions on Affective Computing; 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13468 2025-10-10 cs.RO cs.AI cs.HC 77%

ERR@HRI 2.0 Challenge: Multimodal Detection of Errors and Failures in Human-Robot Conversations

Shiye Cao, Maia Stiber, Amama Mahmood, Maria Teresa Parreira, Wendy Ju, Micol Spitale, Hatice Gunes, Chien-Ming Huang

机构 * Johns Hopkins University(约翰霍普金斯大学) Microsoft Research(微软研究院) Cornell University(康奈尔大学) University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07931 2025-10-10 cs.CL 77%

Vision-Enabled LLMs in Historical Lexicography: Digitising and Enriching Estonian-German Dictionaries from the 17th and 18th Centuries

Madis Jürviste, Joonatan Jakobson

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05444 2025-10-10 cs.CL 77%

SimulatorArena: Are User Simulators Reliable Proxies for Multi-Turn Evaluation of AI Assistants?

Yao Dou, Michel Galley, Baolin Peng, Chris Kedzie, Weixin Cai, Alan Ritter, Chris Quirk, Wei Xu, Jianfeng Gao

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted at EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04097 2025-10-10 cs.AI 77%

WebRenderBench: Enhancing Web Interface Generation through Layout-Style Consistency and Reinforcement Learning

Peichao Lai, Jinhui Zhuang, Kexuan Zhang, Ningchang Xiong, Shengjie Wang, Yanwei Xu, Chong Chen, Yilei Wang, Bin Cui

机构 * Peking University(北京大学) Xiamen Huaxia University(厦门华夏大学) Fuzhou University(福州市大学) City University of Hong Kong(香港城市大学) Huawei Cloud BU(华为云业务单元)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03020 2025-10-10 cs.CL cs.IR 77%

Training LLMs to be Better Text Embedders through Bidirectional Reconstruction

Chang Su, Dengliang Shi, Siyuan Huang, Jintao Du, Changhua Meng, Yu Cheng, Weiqiang Wang, Zhouhan Lin

机构 * LUMIA Lab, Shanghai Jiao Tong University(上海交通大学LUMIA实验室) Tiansuan Lab, Ant Group Co., Ltd.(蚂蚁集团天算实验室) LUMIA Lab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院LUMIA实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments accepted by EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22889 2025-10-10 cs.HC cs.CY 75%

Confident-Knowledge Diversity Drives Human-Human and Human-AI Free Discussion Synergy and Reveals Pure-AI Discussion Shortfalls

Tom Sheffer, Alon Miron, Asael Sklar, Yaniv Dover, Ariel Goldstein

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23798 2025-10-10 cs.CL cs.AI 74%

Adaptive Layer-skipping in Pre-trained LLMs

Xuan Luo, Weizhi Wang, Xifeng Yan

机构 * Department of Computer Science, UC Santa Barbara(计算机科学系,UC Santa Barbara)

专题命中 评测与基准 :language model(abstract,journal_ref);large language model(abstract);分类 cs.CL、cs.AI

Journal ref Second Conference on Language Modeling, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13694 2025-10-10 cs.CL cs.AI cs.IR 73%

Multi-Source Knowledge Pruning for Retrieval-Augmented Generation: A Benchmark and Empirical Study

Shuo Yu, Mingyue Cheng, Qi Liu, Daoyu Wang, Jiqian Yang, Jie Ouyang, Yucong Luo, Chenyi Lei, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted by CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07489 2025-10-10 cs.AI cs.CL cs.CY cs.IR cs.LG 71%

Evaluation of LLMs for Process Model Analysis and Optimization

Akhil Kumar, Jianliang Leon Zhao, Om Dobariya

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG;large language model(comments);language model(comments)

Comments 15 pages, 5 tables, 4 figures; full research paper currently under review for the Workshop on Information Technologies and Systems (WITS) 2025. The paper presents a comprehensive evaluation of large language models (LLMs) for business process model analysis and optimization, including error detection, reasoning, and scenario-based redesign

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07740 2025-10-10 cs.SE cs.AI 70%

AppForge: From Assistant to Independent Developer -- Are GPTs Ready for Software Development?

Dezhi Ran, Yuan Cao, Mengzhou Wu, Simin Chen, Yuzhe Guo, Jun Ren, Zihe Song, Hao Yu, Jialei Wei, Linyi Li, Wei Yang, Baishakhi Ray, Tao Xie

机构 * Key Lab of HCST (PKU), MOE(HCST关键实验室(PKU)) School of Computer Science, Peking University, China(北京大学计算机科学学院) Columbia University, USA(哥伦比亚大学) Beijing Jiaotong University, China(北京交通大学) University of Texas at Dallas, USA(德克萨斯大学达拉斯分校) Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学) Fudan University Institute of Systems for Advanced Computing, Shanghai, China(复旦大学先进计算系统研究所) Simon Fraser University, Canada(西蒙弗雷泽大学) Shanghai Institute of Systems for Open Computing, Shanghai, China(上海开放计算系统研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Under Review. Benchmark and leadboards at https://appforge-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07881 2025-10-10 cs.CL 70%

CS3-Bench: Evaluating and Enhancing Speech-to-Speech LLMs for Mandarin-English Code-Switching

Heyang Liu, Yuhao Wang, Ziyang Cheng, Ronghua Wu, Qunshan Gu, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07728 2025-10-10 cs.IR cs.CL 70%

Who Stole Your Data? A Method for Detecting Unauthorized RAG Theft

Peiyang Liu, Ziqiang Cui, Di Liang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学) City University of Hong Kong(香港城市大学) Fudan University(复旦大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07551 2025-10-10 cs.AI 70%

An Evaluation Study of Hybrid Methods for Multilingual PII Detection

Harshit Rajgarhia, Suryam Gupta, Asif Shaik, Gulipalli Praveen Kumar, Y Santhoshraj, Sanka Nithya Tanvy Nishitha, Abhishek Mukherji

机构 * Centific Global Solutions Inc.(Centific全球解决方案公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15550 2025-10-10 cs.CL 70%

DNA-DetectLLM: Unveiling AI-Generated Text via a DNA-Inspired Mutation-Repair Paradigm

Xiaowei Zhu, Yubing Ren, Fang Fang, Qingfeng Tan, Shi Wang, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) University International College, Macau University of Science and Technology(澳门科技大学国际学院) Cyberspace Institute of Advanced Technology, Guangzhou University(广州大学网络安全技术研究所) Institute of Computing Science, Chinese Academy of Sciences(中国科学院计算科学研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03563 2025-10-10 cs.CL 70%

Say It Another Way: Auditing LLMs with a User-Grounded Automated Paraphrasing Framework

Cléa Chataigner, Rebecca Ma, Prakhar Ganesh, Yuhao Chen, Afaf Taïk, Elliot Creager, Golnoosh Farnadi

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01127 2025-10-10 cs.CL 70%

Can LLMs Grasp Implicit Cultural Values? Benchmarking LLMs' Cultural Intelligence with CQ-Bench

Ziyi Liu, Priyanka Dey, Jen-tse Huang, Zhenyu Zhao, Bowen Jiang, Rahul Gupta, Yang Liu, Yao Du, Jieyu Zhao

机构 * University of Southern California(南加州大学) Amazon AGI(亚马逊人工智慧) John Hopkins University(约翰霍普金斯大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08508 2025-10-10 cs.CV 67%

MoA-VR: A Mixture-of-Agents System Towards All-in-One Video Restoration

Lu Liu, Chunlei Cai, Shaocheng Shen, Jianfeng Liang, Weimin Ouyang, Tianxiao Ye, Jian Mao, Huiyu Duan, Jiangchao Yao, Xiaoyun Zhang, Qiang Hu, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) University of Electronic Science and Technology of China(电子科技大学) Bilibili Inc.(哔哩哔哩公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08268 2025-10-10 q-fin.CP 67%

Multi-Agent Analysis of Off-Exchange Public Information for Cryptocurrency Market Trend Prediction

Kairan Hong, Jinling Gan, Qiushi Tian, Yanglinxuan Guo, Rui Guo, Runnan Li

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08435 2025-10-10 cs.CL cs.AI cs.LG 67%

Hakim: Farsi Text Embedding Model

Mehran Sarmadi, Morteza Alikhani, Erfan Zinvandi, Zahra Pourbahman

机构 * MCINEXT Sharif University of Technology(谢里夫理工大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08729 2025-10-10 cs.CL cs.AI 66%

X-Teaming Evolutionary M2S: Automated Discovery of Multi-turn to Single-turn Jailbreak Templates

Hyunjun Kim, Junwoo Ha, Sangyoon Yu, Haon Park

机构 * AIM Intelligence(AIM智能)

专题命中 评测与基准 :LLM(abstract,comments);分类 cs.CL、cs.AI

Comments NeurIPS 2025 Workshop on Lock-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08217 2025-10-10 cs.LG cs.AI 62%

FuelCast: Benchmarking Tabular and Temporal Models for Ship Fuel Consumption

Justus Viga, Penelope Mueck, Alexander Löser, Torben Weis

机构 * KROHNE Messtechnik GmbH(克罗尼测量技术有限公司) University of Duisburg-Essen(杜伊斯堡- Essen大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

Comments This preprint has not undergone peer review or any post-submission improvements or corrections. The Version of Record of this contribution will be published in "ECML PKDD Workshop 2025 - Advanced Analytics and Learning on Temporal Data"

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08202 2025-10-10 cs.HC cs.AI cs.CL cs.ET 62%

Sentiment Matters: An Analysis of 200 Human-SAV Interactions

Lirui Guo, Michael G. Burke, Wynita M. Griggs

机构 * Department of Civil and Environmental Engineering, Monash University(莫纳什大学土木与环境工程系) Department of Electrical and Computer Systems Engineering, Monash University(莫纳什大学电子与计算机系统工程系)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted for presentation at IEEE ITSC 2025 and for publication in its Proceedings. \c{opyright} 2025 IEEE. Personal use permitted; other uses require permission from IEEE, including reprinting, republishing, or reuse of any copyrighted component of this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11552 2025-10-10 cs.CL cs.AI 62%

HiChunk: Evaluating and Enhancing Retrieval-Augmented Generation with Hierarchical Chunking

Wensheng Lu, Keyu Chen, Ruizhi Qiao, Xing Sun

机构 * Tencent Youtu Lab(腾讯优图实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

Comments 17 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07709 2025-10-10 cs.AI cs.CL cs.CY cs.MA 62%

Multimodal Safety Evaluation in Generative Agent Social Simulations

Alhim Vera, Karen Sanchez, Carlos Hinojosa, Haidar Bin Hamid, Donghoon Kim, Bernard Ghanem

机构 * University of Cincinnati(辛辛那提大学) King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏