arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-07-31 至 2025-07-31 共收录 36 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 36 篇

2507.22603 2025-07-31 cs.CL cs.AI 90%

BALSAM: A Platform for Benchmarking Arabic Large Language Models

Rawan Al-Matham, Kareem Darwish, Raghad Al-Rasheed, Waad Alshammari, Muneera Alhoshan, Amal Almazrua, Asma Al Wazrah, Mais Alheraki, Firoj Alam, Preslav Nakov, Norah Alzahrani, Eman alBilali, Nizar Habash, Abdelrahman El-Sheikh, Muhammad Elmallah, Haonan Li, Hamdy Mubarak, Mohamed Anwar, Zaid Alyafeai, Ahmed Abdelali, Nora Altwairesh, Maram Hasanain, Abdulmohsen Al Thubaity, Shady Shehata, Bashar Alhafni, Injy Hamed, Go Inoue, Khalid Elmadani, Ossama Obeid, Fatima Haouari, Tamer Elsayed, Emad Alghamdi, Khalid Almubarak, Saied Alshahrani, Ola Aljarrah, Safa Alajlan, Areej Alshaqarawi, Maryam Alshihri, Sultana Alghurabi, Atikah Alzeghayer, Afrah Altamimi, Abdullah Alfaifi, Abdulrahman AlOsaimy

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22419 2025-07-31 cs.DB cs.AI 89%

Systematic Evaluation of Knowledge Graph Repair with Large Language Models

Tung-Wei Lin, Gabe Fierro, Han Li, Tianzhen Hong, Pierluigi Nuzzo, Alberto Sangiovanni-Vinentelli

机构 * UC Berkeley(加州大学伯克利分校) Lawrence Berkeley National Laboratory(伯克利国家实验室) National Renewable Energy Laboratory(国家可再生能源实验室) Colorado School of Mines(科罗拉多矿业学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14820 2025-07-31 cs.CL cs.AI 88%

Past Meets Present: Creating Historical Analogy with Large Language Models

Nianqi Li, Siyu Yuan, Jiangjie Chen, Jiaqing Liang, Feng Wei, Zujie Liang, Deqing Yang, Yanghua Xiao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to ACL 2025 (Outstanding Paper Award)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22542 2025-07-31 cs.CL 88%

A Benchmark Dataset and Evaluation Framework for Vietnamese Large Language Models in Customer Support

Long S. T. Nguyen, Truong P. Hua, Thanh M. Nguyen, Toan Q. Pham, Nam K. Ngo, An X. Nguyen, Nghi D. M. Pham, Nghia H. Nguyen, Tho T. Quan

机构 * URA Research Group, Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT), Ho Chi Minh City, Vietnam(乌尔拉研究组,计算机科学与工程学院,胡志明城理工大学(HCMUT),胡志明城,越南) Vietnam National University Ho Chi Minh City, Ho Chi Minh City, Vietnam(越南国家大学胡志明城分校,胡志明城,越南)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Under review at ICCCI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19959 2025-07-31 cs.CL 88%

MiniLongBench: The Low-cost Long Context Understanding Benchmark for Large Language Models

Zhongzhan Huang, Guoming Ling, Shanshan Zhong, Hefeng Wu, Liang Lin

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted by ACL'25 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07846 2025-07-31 cs.SE cs.AI 88%

A System for Automated Unit Test Generation Using Large Language Models and Assessment of Generated Test Suites

Andrea Lops, Fedelucio Narducci, Azzurra Ragone, Michelantonio Trizio, Claudio Bartolini

机构 * Polytechnic University of Bari \& Wideverse Bari, Italy Polytechnic University of Bari Bari, Italy Independent Researcher University of Bari Bari, Italy

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Journal ref 2025 IEEE International Conference on Software Testing, Verification and Validation Workshops (ICSTW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22619 2025-07-31 cs.AI 87%

Enhancing Manufacturing Knowledge Access with LLMs and Context-aware Prompting

Sebastian Monka, Irlan Grangel-González, Stefan Schmid, Lavdim Halilaj, Marc Rickart, Oliver Rudolph, Rui Dias

机构 * Bosch Center for Artificial Intelligence(博世人工智能中心) Robert Bosch GmbH(博世集团) Mobility Electronics(移动电子)

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments European Conference on Artificial Intelligence (ECAI) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22447 2025-07-31 cs.CR cs.LG 85%

Breaking Obfuscation: Cluster-Aware Graph with LLM-Aided Recovery for Malicious JavaScript Detection

Zhihong Liang, Xin Wang, Zhenhuang Hu, Liangliang Song, Lin Chen, Jingjing Guo, Yanbin Wang, Ye Tian

机构 * Electric Power Research Institute, CSG(电力研究院,中国南方电网) Guangdong Provincial Key Laboratory of Power System Network Security(广东省电力系统网络安全重点实验室) Hangzhou Institute of Technology, Xidian University(杭州理工大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22133 2025-07-31 cs.CR cs.CL 85%

Prompt Optimization and Evaluation for LLM Automated Red Teaming

Michael Freenor, Lauren Alvarez, Milton Leal, Lily Smith, Joel Garrett, Yelyzaveta Husieva, Madeline Woodruff, Ryan Miller, Erich Kummerfeld, Rafael Medeiros, Sander Schulhoff

机构 * Fuel iX Applied Research(Fuel iX应用研究) North Carolina State University(北卡罗来纳州立大学) University of Minnesota(明尼苏达大学) TELUS Digital(TELUS数字) Learn Prompting

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 9 pages, 5 Figures, and 1 Appendix item

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22367 2025-07-31 cs.CL cs.MM 83%

Traits Run Deep: Enhancing Personality Assessment via Psychology-Guided LLM Representations and Multimodal Apparent Behaviors

Jia Li, Yichao He, Jiacheng Xu, Tianhao Luo, Zhenzhen Hu, Richang Hong, Meng Wang

机构 * Hefei University of Technology(合肥工业大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

Comments 8 pages, 3 figures, ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01282 2025-07-31 cs.CL 83%

Prompt-Reverse Inconsistency: LLM Self-Inconsistency Beyond Generative Randomness and Prompt Paraphrasing

Jihyun Janice Ahn, Wenpeng Yin

机构 * Department of Computer Science & Engineering(计算机科学与工程系) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.CL

Comments accepted in COLM2025, 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22066 2025-07-31 cs.SE cs.CR 82%

CodableLLM: Automating Decompiled and Source Code Mapping for LLM Dataset Generation

Dylan Manuel, Paul Rad

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21919 2025-07-31 cs.CL cs.AI cs.CY 81%

Training language models to be warm and empathetic makes them less reliable and more sycophantic

Lujain Ibrahim, Franziska Sofia Hafner, Luc Rocher

机构 * Oxford Internet Institute(牛津互联网研究所) University of Oxford(牛津大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22205 2025-07-31 cs.LG cs.HC 79%

CTG-Insight: A Multi-Agent Interpretable LLM Framework for Cardiotocography Analysis and Classification

Black Sun, Die, Hu

机构 * Department of Computer Science Aarhus University Aarhus Denmark(计算机科学系 阿拉斯加大学 阿拉斯加 挪威) Anhui University of Science(安徽科学大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22092 2025-07-31 q-bio.QM cs.AI cs.CV eess.IV q-bio.TO 79%

Pathology Foundation Models are Scanner Sensitive: Benchmark and Mitigation with Contrastive ScanGen Loss

Gianluca Carloni, Biagio Brattoli, Seongho Keum, Jongchan Park, Taebum Lee, Chang Ho Ahn, Sergio Pereira

机构 * Lunit

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

Comments Accepted (Oral) in MedAGI 2025 International Workshop at MICCAI Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22692 2025-07-31 cs.CV 79%

Zero-Shot Image Anomaly Detection Using Generative Foundation Models

Lemar Abdi, Amaan Valiuddin, Francisco Caetano, Christiaan Viviers, Fons van der Sommen

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 评测与基准 :foundation model(title,abstract)

Comments Accepted at the workshop of Anomaly Detection with Foundation Models, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22387 2025-07-31 cs.CL cs.LG 79%

PATENTWRITER: A Benchmarking Study for Patent Drafting with LLMs

Homaira Huda Shomee, Suman Kalyan Maity, Sourav Medya

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14907 2025-07-31 cs.CL cs.AI 79%

GneissWeb: Preparing High Quality Data for LLMs at Scale

Hajar Emami Gohari, Swanand Ravindra Kadhe, Syed Yousaf Shah, Constantin Adam, Abdulhamid Adebayo, Praneet Adusumilli, Farhan Ahmed, Nathalie Baracaldo Angel, Santosh Subhashrao Borse, Yuan-Chi Chang, Xuan-Hong Dang, Nirmit Desai, Revital Eres, Ran Iwamoto, Alexei Karve, Yan Koyfman, Wei-Han Lee, Changchang Liu, Boris Lublinsky, Takuyo Ohko, Pablo Pesce, Maroun Touma, Shiqiang Wang, Shalisha Witherspoon, Herbert Woisetschläger, David Wood, Kun-Lung Wu, Issei Yoshida, Syed Zawad, Petros Zerfos, Yi Zhou, Bishwaranjan Bhattacharjee

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22304 2025-07-31 cs.CR 78%

Invisible Injections: Exploiting Vision-Language Models Through Steganographic Prompt Embedding

Chetan Pathade

专题命中 评测与基准 :language model(title,abstract)

Comments 14 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05008 2025-07-31 cs.CL cs.CY cs.HC 77%

Voices of Freelance Professional Writers on AI: Limitations, Expectations, and Fears

Anastasiia Ivanova, Natalia Fedorova, Sergei Tilga, Ekaterina Artemova

机构 * LMU Munich(慕尼黑大学) Toloka AI

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11198 2025-07-31 cs.SE cs.AI cs.NE 77%

Automated Prompt Engineering for Cost-Effective Code Generation Using Evolutionary Algorithm

Hamed Taherkhani, Melika Sepindband, Hung Viet Pham, Song Wang, Hadi Hemmati

机构 * York University(约克大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18044 2025-07-31 cs.LG 77%

The Geometry of Queries: Query-Based Innovations in Retrieval-Augmented Generation for Healthcare QA

Eric Yang, Jonathan Amar, Jong Ha Lee, Bhawesh Kumar, Yugang Jia

机构 * Verily Life Sciences(Verily 生物科技)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22802 2025-07-31 cs.CV cs.AI 70%

Advancing Fetal Ultrasound Image Quality Assessment in Low-Resource Settings

Dongli He, Hu Wang, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·宾·扎耶德人工智能大学)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI

Comments Accepted to the MICCAI 2025 MIRASOL Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22610 2025-07-31 cs.SE cs.AI 70%

Metamorphic Testing of Deep Code Models: A Systematic Literature Review

Ali Asgari, Milan de Koning, Pouria Derakhshanfar, Annibale Panichella

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09950 2025-07-31 cs.CV cs.AI 70%

Can GPT-4o mini and Gemini 2.0 Flash Predict Fine-Grained Fashion Product Attributes? A Zero-Shot Analysis

Shubham Shukla, Kunal Sonalkar

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Version 2: Added a missing citation

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07076 2025-07-31 cs.CV cs.AI 70%

StoryTeller: Improving Long Video Description through Global Audio-Visual Character Identification

Yichen He, Yuan Lin, Jianchao Wu, Hanchong Zhang, Yuchen Zhang, Ruicheng Le

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22076 2025-07-31 cs.LG 70%

Test-time Prompt Refinement for Text-to-Image Models

Mohammad Abdul Hafeez Khan, Yash Jain, Siddhartha Bhattacharyya, Vibhav Vineet

机构 * Florida Institute of Technology(佛罗里达理工学院) Microsoft Research(微软研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

Comments Accepted to ICCV 2025, MARS2 Workshop. Total 14 pages, 12 figures and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22346 2025-07-31 cs.CV 67%

DeltaVLM: Interactive Remote Sensing Image Change Analysis via Instruction-guided Difference Perception

Pei Deng, Wenqian Zhou, Hanlin Wu

机构 * School of Information Science and Technology, Beijing Foreign Studies University(信息科学与技术学院,北京外国语大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments 12 pages, 5 figures. Submitted to IEEE Transactions on Geoscience and Remote Sensing (TGRS). Code and dataset are available at https://github.com/hanlinwu/DeltaVLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22410 2025-07-31 cs.CL cs.AI 62%

Question Generation for Assessing Early Literacy Reading Comprehension

Xiaocheng Yang, Sumuk Shashidhar, Dilek Hakkani-Tur

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

Comments 2 pages, 1 figure, accepted by SLaTE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07631 2025-07-31 cs.LG cs.CL 62%

OWLViz: An Open-World Benchmark for Visual Question Answering

Thuy Nguyen, Dang Nguyen, Hoang Nguyen, Thuan Luong, Long Hoang Dang, Viet Dac Lai

机构 * Posts and Telecommunications Institute of Technology, Viet Nam(越南电信技术研究所) Adobe Research, USA(Adobe研究) University of Maryland, USA(美国马里兰大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

Comments 8 pages + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏