arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-19 至 2025-09-19 共收录 173 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 55 篇

2509.14571 2025-09-19 cs.HC cs.AI cs.LG 76%

VisMoDAl: Visual Analytics for Evaluating and Improving Corruption Robustness of Vision-Language Models

Huanchen Wang, Wencheng Zhang, Zhiqiang Wang, Zhicong Lu, Yuxin Ma

机构 * Southern University of Science and Technology(南方科技大学) City University of Hong Kong(香港城市大学) George Mason University(乔治·马歇尔大学)

专题命中 评测与基准 :language model(title);分类 cs.AI、cs.LG

Comments 11 pages, 7 figures, 1 table, accepted to IEEE VIS 2025 (IEEE Transactions on Visualization and Computer Graphics)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14504 2025-09-19 cs.CL cs.AI cs.LG 75%

Introducing OmniGEC: A Silver Multilingual Dataset for Grammatical Error Correction

Roman Kovalchuk, Mariana Romanyshyn, Petro Ivaniuk

机构 * Ukrainian Catholic University(乌克兰天主教大学) Softserve Grammarly

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref Proceedings of the Fourth Ukrainian Natural Language Processing Workshop (UNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14199 2025-09-19 cs.CV cs.AI cs.CL cs.LG 75%

Dense Video Understanding with Gated Residual Tokenization

Haichao Zhang, Wenhao Chai, Shwai He, Ang Li, Yun Fu

机构 * Northeastern University(东北大学) Princeton University(普林斯顿大学) University of Maryland(马里兰大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14647 2025-09-19 cs.AI cs.CL 73%

AgentCompass: Towards Reliable Evaluation of Agentic Workflows in Production

NVJK Kartik, Garvit Sapra, Rishav Hada, Nikhil Pareek

机构 * FutureAGI Inc.(未来AGI公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14268 2025-09-19 cs.CL cs.AI cs.CY 73%

DetectAnyLLM: Towards Generalizable and Robust Detection of Machine-Generated Text Across Domains and Models

Jiachen Fu, Chun-Le Guo, Chongyi Li

机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15160 2025-09-19 cs.HC cs.CL cs.GR 70%

An Evaluation-Centric Paradigm for Scientific Visualization Agents

Kuangshi Ai, Haichao Miao, Zhimin Li, Chaoli Wang, Shusen Liu

机构 * Univ. Notre Dame(内布拉斯加大学) LLNL(劳伦斯利弗莫尔国家实验室) Vanderbilt Univ.(范德比大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Journal ref 1st Workshop on GenAI, Agents, and the Future of VIS (IEEE VIS Conference 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14448 2025-09-19 cs.AI 70%

VCBench: Benchmarking LLMs in Venture Capital

Rick Chen, Joseph Ternasky, Afriyie Samuel Kwesi, Ben Griffin, Aaron Ontoyin Yin, Zakari Salifu, Kelvin Amoaba, Xianling Mu, Fuat Alican, Yigit Ihlamur

机构 * University of Oxford(牛津大学) Vela Research(维拉研究)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14382 2025-09-19 cs.AI 70%

Detecting Pipeline Failures through Fine-Grained Analysis of Web Agents

Daniel Röder, Akhil Juneja, Roland Roller, Sven Schmeier

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14171 2025-09-19 cs.CL 70%

AssoCiAm: A Benchmark for Evaluating Association Thinking while Circumventing Ambiguity

Yifan Liu, Wenkuan Zhao, Shanshan Zhong, Jinghui Qin, Mingfu Liang, Zhongzhan Huang, Wushao Wen

机构 * Sun Yat-sen University(中山大学) Guangdong University of Technology(广东工业大学) Northwestern University(西北大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18106 2025-09-19 cs.SE cs.AI 70%

A.S.E: A Repository-Level Benchmark for Evaluating Security in AI-Generated Code

Keke Lian, Bin Wang, Lei Zhang, Libo Chen, Junjie Wang, Ziming Zhao, Yujiu Yang, Miaoqian Lin, Haotong Duan, Haoran Zhao, Shuang Liao, Mingda Guo, Jiazheng Quan, Yilu Zhong, Chenhao He, Zichuan Chen, Jie Wu, Haoling Li, Zhaoxuan Li, Jiongchi Yu, Hui Li, Dong Zhang

机构 * Tencent(腾讯公司) Peking University(北京大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Singapore Management University(新加坡国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09108 2025-09-19 cs.SE cs.AI 70%

SPICE: An Automated SWE-Bench Labeling Pipeline for Issue Clarity, Test Coverage, and Effort Estimation

Gustavo A. Oliva, Gopi Krishnan Rajbahadur, Aaditya Bhatia, Haoxiang Zhang, Yihao Chen, Zhilong Chen, Arthur Leung, Dayi Lin, Boyuan Chen, Ahmed E. Hassan

机构 * Center for Software Excellence, Huawei Canada(华为加拿大卓越软件中心)

专题命中 评测与基准 :foundation model(abstract);prompting(abstract);分类 cs.AI

Comments *First three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07546 2025-09-19 cs.IR cs.AI 70%

GRADA: Graph-based Reranking against Adversarial Documents Attack

Jingjie Zheng, Aryo Pradipta Gema, Giwon Hong, Xuanli He, Pasquale Minervini, Youcheng Sun, Qiongkai Xu

机构 * University of Melbourne(墨尔本大学) University of Edinburgh(爱丁堡大学) University College London(伦敦大学学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Macquarie University(麦觉里大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12772 2025-09-19 cs.CL cs.CV 70%

LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models

Kaichen Zhang, Bo Li, Peiyuan Zhang, Fanyi Pu, Joshua Adrian Cahyono, Kairui Hu, Shuai Liu, Yuanhan Zhang, Jingkang Yang, Chunyuan Li, Ziwei Liu

机构 * LMMs-Lab Team(LMMs实验室团队) S-Lab, NTU, Singapore(新加坡国立大学S实验室)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.CL

Comments Code ad leaderboard are available at https://github.com/EvolvingLMMs-Lab/lmms-eval and https://huggingface.co/spaces/lmms-lab/LiveBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14638 2025-09-19 cs.CV 67%

MultiEdit: Advancing Instruction-based Image Editing on Diverse and Challenging Tasks

Mingsong Li, Lin Liu, Hongjun Wang, Haoxing Chen, Xijun Gu, Shizhan Liu, Dong Gong, Junbo Zhao, Zhenzhong Lan, Jianguo Li

机构 * University of New South Wales(新南威尔士大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Westlake University(西湖大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14457 2025-09-19 cs.IR cs.DB cs.DL cs.HC 67%

Keywords are not always the key: A metadata field analysis for natural language search on open data portals

Lisa-Yao Gan, Arunav Das, Johanna Walker, Elena Simperl

专题命中 评测与基准 :LLM(abstract);prompting(abstract)

Comments Accepted to CHIRA 2025 as Full Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14273 2025-09-19 cs.SE 67%

Automated and Context-Aware Code Documentation Leveraging Advanced LLMs

Swapnil Sharma Sarker, Tanzina Taher Ifty

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13456 2025-09-19 cs.CL cs.AI cs.LG 67%

Unlocking Legal Knowledge: A Multilingual Dataset for Judicial Summarization in Switzerland

Luca Rolshoven, Vishvaksenan Rasiah, Srinanda Brügger Bose, Sarah Hostettler, Lara Burkhalter, Matthias Stürmer, Joel Niklaus

机构 * University of Bern(伯尔尼大学) Bern University of Applied Sciences(伯尔尼应用科学大学) Stanford University(斯坦福大学) University of Fribourg(弗里堡大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14718 2025-09-19 cs.LG cs.CL 62%

ToolSample: Dual Dynamic Sampling Methods with Curriculum Learning for RL-based Tool Learning

Zihao Feng, Xiaoxue Wang, Bowen Wu, Hailong Cao, Tiejun Zhao, Qun Yu, Baoxun Wang

机构 * Tencent(腾讯)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14627 2025-09-19 cs.HC cs.AI cs.CL 62%

Towards Human-like Multimodal Conversational Agent by Generating Engaging Speech

Taesoo Kim, Yongsik Jo, Hyunmin Song, Taehwan Kim

机构 * Artificial Intelligence Graduate School(人工智能研究生院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

Comments Published in Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14712 2025-09-19 cs.CL 57%

From Ground Trust to Truth: Disparities in Offensive Language Judgments on Contemporary Korean Political Discourse

Seunguk Yu, Jungmin Yun, Jinhee Jang, Youngbin Kim

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

Comments EMNLP 2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09409 2025-09-19 cs.CL 57%

Mind the Inclusivity Gap: Multilingual Gender-Neutral Translation Evaluation with mGeNTE

Beatrice Savoldi, Giuseppe Attanasio, Eleonora Cupin, Eleni Gkovedarou, Janiça Hackenbuchner, Anne Lauscher, Matteo Negri, Andrea Piergentili, Manjinder Thind, Luisa Bentivogli

机构 * Fondazione Bruno Kessler(布鲁诺·科塞尔基金会) Instituto de Telecomunicações(电信研究所) DIT Forlì - University of Bologna(福利大学迪提学院) Data Science Group - University of Hamburg(汉堡大学数据科学组) University of Trento(特伦托大学) LT 3 - Ghent University(根特大学LT 3)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13835 2025-09-19 cs.CL 57%

RAcQUEt: Unveiling the Dangers of Overlooked Referential Ambiguity in Visual LLMs

Alberto Testoni, Barbara Plank, Raquel Fernández

机构 * Amsterdam UMC, Department of Medical Informatics(阿姆斯特丹大学医学中心,医学信息学系) Center for Information and Language Processing, LMU Munich(信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML), Munich(慕尼黑机器学习中心(MCML)) Institute for Logic, Language and Computation (ILLC), University of Amsterdam(逻辑、语言与计算研究所(ILLC),阿姆斯特丹大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15205 2025-09-19 cs.AR 50%

Voyager: An End-to-End Framework for Design-Space Exploration and Generation of DNN Accelerators

Kartik Prabhu, Jeffrey Yu, Xinyuan Allen Pan, Zhouhua Xie, Abigail Aleshire, Zihan Chen, Ammar Ali Ratnani, Priyanka Raina

专题命中 评测与基准 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14985 2025-09-19 cs.CV 50%

PRISM: Product Retrieval In Shopping Carts using Hybrid Matching

Arda Kabadayi, Senem Velipasalar, Jiajing Chen

机构 * Syracuse University(苏塞克斯大学) Amazon(亚马逊)

专题命中 评测与基准 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14829 2025-09-19 cs.SE 50%

RulER: Automated Rule-Based Semantic Error Localization and Repair for Code Translation

Shuo Jin, Songqiang Chen, Xiaoyuan Xie, Shing-Chi Cheung

专题命中 评测与基准 :prompting(abstract)

Comments Due to the limitation "The abstract field cannot be longer than 1,920 characters", the abstract here is shorter than that in the PDF file

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17076 2025-09-19 cs.IR 50%

Towards a Real-World Aligned Benchmark for Unlearning in Recommender Systems

Pierre Lubitzsch, Olga Ovcharenko, Hao Chen, Maarten de Rijke, Sebastian Schelter

专题命中 评测与基准 :post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02435 2025-09-19 cs.DB 50%

NLI4DB: A Systematic Review of Natural Language Interfaces for Databases

Mengyi Liu, Jianqiu Xu

专题命中 评测与基准 :LLM(abstract)

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-025-50592-w}

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 23 篇

2509.15089 2025-09-19 cs.CL 92%

LLM-OREF: An Open Relation Extraction Framework Based on Large Language Models

Hongyao Tu, Liang Zhang, Yujie Lin, Xin Lin, Haibo Zhang, Long Zhang, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) LLM Team, Shopee Pte. Ltd.(Shopee Pte. Ltd. 机器学习团队) National Institute for Data Science in Health and Medicine, Xiamen University(厦门大学医学数据科学国家研究院)

专题命中 效率与部署 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14526 2025-09-19 cs.CL cs.AI cs.LG 90%

Delta Knowledge Distillation for Large Language Models

Yihan Cao, Yanbin Kang, Zhengming Xing, Ruijie Jiang

机构 * LinkedIn Corporation(领英公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14930 2025-09-19 cs.CL cs.AI 90%

Cross-Modal Knowledge Distillation for Speech Large Language Models

Enzhi Wang, Qicheng Li, Zhiyuan Tang, Yuhang Jia

机构 * TMCC, College of Computer Science, Nankai University, Tianjin, China(TMCC,计算机科学学院,南开大学,天津,中国) Tencent Ethereal Audio Lab, Tencent Corporation, Shenzhen, China(腾讯虚实音频实验室,腾讯公司,深圳,中国)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏