arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-01 至 2025-09-01 共收录 100 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 11 篇

2508.21080 2025-09-01 cs.CV cs.RO 50%

2COOOL: 2nd Workshop on the Challenge Of Out-Of-Label Hazards in Autonomous Driving

Ali K. AlShami, Ryan Rabinowitz, Maged Shoman, Jianwu Fang, Lukas Picek, Shao-Yuan Lo, Steve Cruz, Khang Nhut Lam, Nachiket Kamod, Lei-Lei Li, Jugal Kalita, Terrance E. Boult

机构 * University of Colorado Colorado Springs(科罗拉多州立大学) University of Tennessee–Oak Ridge Innovation Institute(田纳西大学-橡树岭创新研究所) Xi’an Jiaotong University(西安交通大学) University of West Bohemia(西波维亚大学) Honda Research Institute USA(本田美国研究机构) University of Notre Dame(诺特丹大学) Can Tho University(庆和大学)

专题命中 推理与问题求解 :language model(abstract)

Comments 11 pages, 2 figures, Accepted to ICCV 2025 Workshop on Out-of-Label Hazards in Autonomous Driving (2COOOL)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 35 篇

2508.21476 2025-09-01 cs.CL cs.AI 94%

Igniting Creative Writing in Small Language Models: LLM-as-a-Judge versus Multi-Agent Refined Rewards

Xiaolong Wei, Bo Lu, Xingyu Zhang, Zhejun Zhao, Dongdong Shen, Long Xia, Dawei Yin

机构 * Beihang University(北航) Baidu Inc.(百度公司) Beijing Jiaotong University(北京交通大学)

专题命中 评测与基准 :LLM(title,abstract);language model(title,abstract);small language model(title,abstract);large language model(abstract)

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00863 2025-09-01 cs.CL cs.LG 92%

L3Cube-MahaEmotions: A Marathi Emotion Recognition Dataset with Synthetic Annotations using CoTR prompting and Large Language Models

Nidhi Kowtal, Raviraj Joshi

机构 * Pune Institute of Computer Technology(普那计算机技术研究所) Indian Institute of Technology Madras(印度理工学院马德拉斯分校) L3Cube Labs(L3Cube实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19238 2025-09-01 cs.CL cs.CY cs.LG 91%

Revealing Fine-Grained Values and Opinions in Large Language Models

Dustin Wright, Arnav Arora, Nadav Borenstein, Srishti Yadav, Serge Belongie, Isabelle Augenstein

机构 * University of Copenhagen(哥本哈根大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Findings of EMNLP 2024; 28 pages, 20 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20008 2025-09-01 cs.AI cs.PL cs.SE 89%

QHackBench: Benchmarking Large Language Models for Quantum Code Generation Using PennyLane Hackathon Challenges

Abdul Basit, Minghao Shao, Muhammad Haider Asif, Nouhaila Innan, Muhammad Kashif, Alberto Marchisio, Muhammad Shafique

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

Comments To appear at the IEEE International Conference on Quantum Artificial Intelligence (QAI), Naples, Italy, November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18124 2025-09-01 cs.LG cs.AI 88%

CMPhysBench: A Benchmark for Evaluating Large Language Models in Condensed Matter Physics

Weida Wang, Dongchen Huang, Jiatong Li, Tengchao Yang, Ziyang Zheng, Di Zhang, Dong Han, Benteng Chen, Binzhao Luo, Zhiyu Liu, Kunling Liu, Zhiyuan Gao, Shiqi Geng, Wei Ma, Jiaming Su, Xin Li, Shuchen Pu, Yuhan Shui, Qianjia Cheng, Zhihao Dou, Dongfei Cui, Changyong He, Jin Zeng, Zeke Xie, Mao Su, Dongzhan Zhou, Yuqiang Li, Wanli Ouyang, Yunqi Cai, Xi Dai, Shufei Zhang, Lei Bai, Jinguang Cheng, Zhong Fang, Hongming Weng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

Comments 29 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21273 2025-09-01 cs.LG 87%

CALM: A Framework for Continuous, Adaptive, and LLM-Mediated Anomaly Detection in Time-Series Streams

Ashok Devireddy, Shunping Huang

机构 * Google(谷歌)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21222 2025-09-01 cs.CV cs.AI 85%

Generalizable Object Re-Identification via Visual In-Context Prompting

Zhizhong Huang, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学)

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);foundation model(abstract);分类 cs.AI

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21512 2025-09-01 cs.LG cs.CL cs.CY 84%

Accept or Deny? Evaluating LLM Fairness and Performance in Loan Approval across Table-to-Text Serialization Approaches

Israel Abebe Azime, Deborah D. Kanubala, Tejumade Afonja, Mario Fritz, Isabel Valera, Dietrich Klakow, Philipp Slusallek

机构 * Saarland University(萨尔兰大学) CISPA Helmholtz Center for Information Security(CISPA海德堡中心 for 信息安全) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11356 2025-09-01 cs.LG cs.AI 84%

ETTRL: Balancing Exploration and Exploitation in LLM Test-Time Reinforcement Learning Via Entropy Mechanism

Jia Liu, ChangYi He, YingQiao Lin, MingMin Yang, FeiYang Shen, ShaoGuo Liu

机构 * Beihang University(北京航空航天大学) Northwestern Polytechnical University(西北工业大学) Kuaishou Technology(快手科技)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13580 2025-09-01 cs.SE cs.AI 83%

LLM Test Generation via Iterative Hybrid Program Analysis

Sijia Gu, Noor Nashid, Ali Mesbah

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

Comments This paper has been accepted for publication in 2026 IEEE/ACM 48th International Conference on Software Engineering (ICSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21294 2025-09-01 cs.CL cs.AI 82%

BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning

João Guilherme Alves Santos, Giovana Kerche Bonás, Thales Sales Almeida

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments 12 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11079 2025-09-01 eess.AS cs.AI cs.CL cs.SD 82%

Improving Child Speech Recognition and Reading Mistake Detection by Using Prompts

Lingyun Gao, Cristian Tejedor-Garcia, Catia Cucchiarini, Helmer Strik

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments This paper is accepted to Interspeech 2025. This publication is part of the project Responsible AI for Voice Diagnostics (RAIVD) with file number NGF.1607.22.013 of the research programme NGF AiNed Fellowship Grants which is financed by the Dutch Research Council (NWO)

Journal ref https://www.isca-archive.org/interspeech_2025/gao25c_interspeech.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21206 2025-09-01 cs.CL cs.AI 81%

Enhancing Robustness of Autoregressive Language Models against Orthographic Attacks via Pixel-based Approach

Han Yang, Jian Lan, Yihong Liu, Hinrich Schütze, Thomas Seidl

机构 * LMU Munich(慕尼黑大学) GESIS - Leibniz Institute for the Social Sciences(莱比锡社会科学院) Center for Information and Language Processing(信息与语言处理中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21777 2025-09-01 cs.CV cs.AI cs.LG 79%

Benchmarking GPT-5 in Radiation Oncology: Measurable Gains, but Persistent Need for Expert Oversight

Ugur Dinc, Jibak Sarkar, Philipp Schubert, Sabine Semrau, Thomas Weissmann, Andre Karius, Johann Brand, Bernd-Niklas Axer, Ahmed Gomaa, Pluvio Stephan, Ishita Sheth, Sogand Beirami, Annette Schwarz, Udo Gaipl, Benjamin Frey, Christoph Bert, Stefanie Corradini, Rainer Fietkau, Florian Putz

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Under review in Frontiers in Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21034 2025-09-01 cs.CR cs.AI cs.LG 79%

SAGA: A Security Architecture for Governing AI Agentic Systems

Georgios Syros, Anshuman Suri, Jacob Ginesin, Cristina Nita-Rotaru, Alina Oprea

机构 * Northeastern University(东北大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21354 2025-09-01 cs.IR 78%

Evaluating Recabilities of Foundation Models: A Multi-Domain, Multi-Dataset Benchmark

Qijiong Liu, Jieming Zhu, Yingxin Lai, Xiaoyu Dong, Lu Fan, Zhipeng Bian, Zhenhua Dong, Xiao-Ming Wu

专题命中 评测与基准 :foundation model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19650 2025-09-01 cs.CV 78%

Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models

Hou Xia, Zheren Fu, Fangcan Ling, Jiajun Li, Yi Tu, Zhendong Mao, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) HUAWEI(华为)

专题命中 评测与基准 :language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12263 2025-09-01 cs.CV cs.AI 77%

Region-Level Context-Aware Multimodal Understanding

Hongliang Wei, Xianqi Zhang, Xingtao Wang, Xiaopeng Fan, Debin Zhao

机构 * Faculty of Computing, Harbin Institute of Technology(计算机学院,哈尔滨工业大学) Department of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术系,哈尔滨工业大学) Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院长) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.AI

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21693 2025-09-01 cs.CV cs.AI cs.CL cs.LG 75%

Why Stop at Words? Unveiling the Bigger Picture through Line-Level OCR

Shashank Vempati, Nishit Anand, Gaurav Talebailkar, Arpan Garai, Chetan Arora

机构 * Typeface, India(印度Typeface公司) University of Maryland, College Park, USA(美国马里兰大学 College Park分校) Tata 1mg, India(印度Tata 1mg公司) Vellore Institute of Technology, Vellore, India(印度维洛雷技术学院) Indian Institute of Technology Delhi, India(印度德里理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 11 pages. Project Website: https://nishitanand.github.io/line-level-ocr-website

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18956 2025-09-01 cs.SE 75%

Towards Automated Detection of Inline Code Comment Smells

Ipek Oztas, U Boran Torun, Eray Tüzün

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Journal ref Presented at EASE 2025 29th International Conference on Evaluation and Assessment in Software Engineering in AI Models / Data Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18948 2025-09-01 cs.CR cs.AI 74%

RevPRAG: Revealing Poisoning Attacks in Retrieval-Augmented Generation through LLM Activation Analysis

Xue Tan, Hao Luan, Mingyu Luo, Xiaoyan Sun, Ping Chen, Jun Dai

机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院) Department of Computer Science, Worcester Polytechnic Institute(沃思堡理工学院计算机科学系) Institute of Big Data, Fudan University(复旦大学大数据研究院)

专题命中 评测与基准 :LLM(title);分类 cs.AI

Comments Accepted to Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17178 2025-09-01 cs.CL cs.AI 73%

SKA-Bench: A Fine-Grained Benchmark for Evaluating Structured Knowledge Understanding of LLMs

Zhiqiang Liu, Enpei Niu, Yin Hua, Mengshu Sun, Lei Liang, Huajun Chen, Wen Zhang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ZJU-Ant Group Joint Lab of Knowledge Graph(浙江大学蚂蚁集团知识图谱联合实验室) Ant Group(蚂蚁集团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04342 2025-09-01 cs.CL cs.AI 73%

Retrieval-Augmented Machine Translation with Unstructured Knowledge

Jiaan Wang, Fandong Meng, Yingxue Zhang, Jie Zhou

机构 * Pattern Recognition Center, WeChat AI, Tencent Inc(模式识别中心、微信AI、腾讯公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21209 2025-09-01 cs.HC cs.CL 70%

Designing Smarter Conversational Agents for Kids: Lessons from Cognitive Work and Means-Ends Analyses

Vanessa Figueiredo

机构 * University of Regina(里贾纳大学)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21084 2025-09-01 cs.CL cs.CY 70%

Mapping Toxic Comments Across Demographics: A Dataset from German Public Broadcasting

Jan Fillies, Michael Peter Hoffmann, Rebecca Reichel, Roman Salzwedel, Sven Bodemer, Adrian Paschke

机构 * Freie Universität Berlin(柏林自由大学) Fraunhofer FOKUS(弗劳恩霍夫研究所(FOKUS)) MSB Medical School Berlin(柏林医学学校(MSB)) funk - Content-Netzwerk ARD / ZDF(ARD/ZDF内容网络) InfAI Leipzig(莱比锡InfAI)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL

Comments The paper has been accepted to the EMNLP 2025 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15663 2025-09-01 cs.CV cs.AI 70%

IQAGPT: Image Quality Assessment with Vision-language and ChatGPT Models

Zhihao Chen, Bin Hu, Chuang Niu, Tao Chen, Yuxin Li, Hongming Shan, Ge Wang

机构 * ISTBI Fudan University(ISTBI 复旦大学) Huashan Hospital Fudan University(复旦大学华山医院) BME & CBIS Rensselaer Polytechnic Institute(生物医学工程与生物信息学研究中心罗切斯特理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 14 pages, 9 figures

Journal ref Visual Computing for Industry, Biomedicine, and Art, 7, 20, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15376 2025-09-01 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

Towards Understanding Camera Motions in Any Video

Zhiqiu Lin, Siyuan Cen, Daniel Jiang, Jay Karhade, Hewei Wang, Chancharik Mitra, Tiffany Ling, Yuhan Huang, Sifan Liu, Mingyu Chen, Rushikesh Zawar, Xue Bai, Yilun Du, Chuang Gan, Deva Ramanan

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Project site: https://linzhiqiu.github.io/papers/camerabench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21389 2025-09-01 cs.CL cs.AI 62%

AllSummedUp: un framework open-source pour comparer les metriques d'evaluation de resume

Tanguy Herserant, Vincent Guigue

机构 * AgroParisTech - MIA(阿格罗巴黎技术学院-信息分析中心)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

Comments in French language

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21081 2025-09-01 cs.LG cs.CL 62%

Normalisation of SWIFT Message Counterparties with Feature Extraction and Clustering

Thanasis Schoinas, Benjamin Guinard, Diba Esbati, Richard Chalk

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏