arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-19 至 2025-11-19 共收录 195 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 51 篇

2505.20338 2025-11-19 cs.CL cs.AI 79%

Assessing the Capability of LLMs in Solving POSCOMP Questions

Cayo Viegas, Rohit Gheyi, Márcio Ribeiro

机构 * UFCG(乌弗拉联邦大学) UFAL(阿拉戈斯联邦大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14002 2025-11-19 cs.SE cs.AI cs.LG cs.PL 79%

FlakyGuard: Automatically Fixing Flaky Tests at Industry Scale

Chengpeng Li, Farnaz Behrang, August Shi, Peng Liu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Uber Technologies(优步技术)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments To appear in ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13900 2025-11-19 cs.CL cs.AI 79%

What Works for 'Lost-in-the-Middle' in LLMs? A Study on GM-Extract and Mitigations

Mihir Gupte, Eshan Dixit, Muhammad Tayyab, Arun Adiththan

机构 * General Motors(通用汽车)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments To be submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04418 2025-11-19 cs.SE 78%

Characterizing Multi-Hunk Patches: Divergence, Proximity, and LLM Repair Challenges

Noor Nashid, Daniel Ding, Keheliya Gallaba, Ahmed E. Hassan, Ali Mesbah

专题命中 评测与基准 :LLM(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10240 2025-11-19 cs.AR cs.LG 77%

Graph Neural Networks Based Analog Circuit Link Prediction

Guanyuan Pan, Tiansheng Zhou, Jianxiang Zhao, Zhi Li, Yugui Lin, Bingtao Ma, Yaqi Wang, Pietro Liò, Shuai Wang

机构 * HDU-ITMO Joint Institute, Hangzhou Dianzi University(杭州电子科技大学信息处理联合研究所) Intelligent Information Processing Laboratory, Hangzhou Dianzi University(杭州电子科技大学智能信息处理实验室) Innovation Center for Electronic Design Automation Technology, Hangzhou Dianzi University(杭州电子科技大学电子设计自动化技术创新中心) School of Computer Science and Technology, South China Business College, Guangdong University of Foreign Studies(广东外语外贸大学南方商学院计算机科学与技术学院) Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Code and data will be made available on request to the corresponding author

Journal ref Pan, G., Zhou, T., Zhao, J., Li, Z., Lin, Y., Ma, B., ... & Wang, S. (2026). Graph Neural Networks Based Analog Circuit Link Prediction. Engineering Applications of Artificial Intelligence, 163, 113035

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11858 2025-11-19 cs.CL 77%

OpeNLGauge: An Explainable Metric for NLG Evaluation with Open-Weights LLMs

Ivan Kartáč, Mateusz Lango, Ondřej Dušek

机构 * Charles University, Faculty of Mathematics and Physics(查尔斯大学数学与物理学院) Institute of Formal and Applied Linguistics(形式与应用语言学研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments INLG 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14062 2025-11-19 cs.SE cs.LG 77%

LogPurge: Log Data Purification for Anomaly Detection via Rule-Enhanced Filtering

Shenglin Zhang, Ziang Chen, Zijing Que, Yilun Liu, Yongqian Sun, Sicheng Wei, Dan Pei, Hailin Li

机构 * Nankai University(南开大学) Huawei(华为) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16194 2025-11-19 cs.AI 77%

Towards Automatic Evaluation and Selection of PHI De-identification Models via Multi-Agent Collaboration

Guanchen Wu, Zuhui Chen, Yuzhang Xie, Carl Yang

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) Department of Statistics, Columbia University(哥伦比亚大学统计系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Agents4Science 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17153 2025-11-19 cs.SE 75%

UniDebugger: Hierarchical Multi-Agent Framework for Unified Software Debugging

Cheryl Lee, Chunqiu Steven Xia, Longji Yang, Jen-tse Huang, Zhouruixin Zhu, Lingming Zhang, Michael R. Lyu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted by EMNLP'25, Main Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14249 2025-11-19 cs.CL 70%

Towards Authentic Movie Dubbing with Retrieve-Augmented Director-Actor Interaction Learning

Rui Liu, Yuan Zhao, Zhenqi Jia

机构 * Rui Liu \equalcontrib , Yuan Zhao \equalcontrib , Zhenqi Jia(Rui Liu、Yuan Zhao、Zhenqi Jia)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13689 2025-11-19 cs.CL cs.CV 70%

Crossing Borders: A Multimodal Challenge for Indian Poetry Translation and Image Generation

Sofia Jamil, Kotla Sai Charan, Sriparna Saha, Koustava Goswami, Joseph K J

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10205 2025-11-19 cs.AI 70%

PIXEL: Adaptive Steering Via Position-wise Injection with eXact Estimated Levels under Subspace Calibration

Manjiang Yu, Hongji Li, Priyanka Singh, Xue Li, Di Wang, Lijie Hu

机构 * University of Queensland(昆士兰大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Provable Responsible AI and Data Analytics (PRADA) Lab(可证责任AI与数据分析师实验室) King Abdullah University of Science and Technology (KAUST)(国王 Abdullah 科学与技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 20 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14066 2025-11-19 cs.IR cs.AI 70%

Retrieval-Augmented Generation in Industry: An Interview Study on Use Cases, Requirements, Challenges, and Evaluation

Lorenz Brehme, Benedikt Dornauer, Thomas Ströhle, Maximilian Ehrhart, Ruth Breu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments This preprint was accepted for presentation at the 17th International Conference on Knowledge Discovery and Information Retrieval (KDIR25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02175 2025-11-19 cs.SD cs.CL eess.AS 70%

Hidden in the Noise: Unveiling Backdoors in Audio LLMs Alignment through Latent Acoustic Pattern Triggers

Liang Lin, Miao Yu, Kaiwen Luo, Yibo Zhang, Lilan Peng, Dexian Wang, Xuehai Tang, Yuanhe Zhang, Xikang Yang, Zhenhong Zhou, Kun Wang, Yang Liu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14600 2025-11-19 cs.SD 67%

A Controllable Perceptual Feature Generative Model for Melody Harmonization via Conditional Variational Autoencoder

Dengyun Huang, Yonghua Zhu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments 13 pages, 8 figures, 2 url links

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13993 2025-11-19 cs.CV 67%

Learning Skill-Attributes for Transferable Assessment in Video

Kumar Ashutosh, Kristen Grauman

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments NeurIPS 2025, Project webpage: https://vision.cs.utexas.edu/projects/CrossTrainer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15584 2025-11-19 cs.CV cs.GR 67%

Deep Learning and Machine Learning -- Object Detection and Semantic Segmentation: From Theory to Applications

Jintao Ren, Ziqian Bi, Qian Niu, Xinyuan Song, Zekun Jiang, Junyu Liu, Benji Peng, Sen Zhang, Xuanhe Pan, Jinlang Wang, Keyu Chen, Caitlyn Heqi Yin, Pohsun Feng, Yizhu Wen, Tianyang Wang, Silin Chen, Ming Li, Jiawei Xu, Ming Liu

机构 * Aarhus University(阿arhus大学) Indiana University(印第安纳大学) Kyoto University(京都大学) Emory University(埃默里大学) Sichuan University(四川大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Georgia Institute of Technology(佐治亚理工学院) University of Hawaii(夏威夷大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) Zhejiang University(浙江大学) Purdue University(普渡大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments 167 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16597 2025-11-19 cs.CV 67%

EventHallusion: Diagnosing Event Hallucinations in Video LLMs

Jiacheng Zhang, Yang Jiao, Shaoxiang Chen, Na Zhao, Zhiyu Tan, Hao Li, Xingjun Ma, Jingjing Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05430 2025-11-19 cs.CV cs.AI cs.LG 62%

Explaining Similarity in Vision-Language Encoders with Weighted Banzhaf Interactions

Hubert Baniecki, Maximilian Muschalik, Fabian Fumagalli, Barbara Hammer, Eyke Hüllermeier, Przemyslaw Biecek

机构 * University of Warsaw(华沙大学) Warsaw University of Technology(华沙理工大学) LMU Munich(慕尼黑大学) MCML DFKI(德累斯顿大学) Bielefeld University(比勒菲尔德大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025. Code: https://github.com/hbaniecki/fixlip

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13884 2025-11-19 cs.CL cs.AI 62%

Can QE-informed (Re)Translation lead to Error Correction?

Govardhan Padmanabhan

机构 * Institute for People-Centred AI(以人为本的人工智能研究所) University of Surrey(萨里大学) United Kingdom(英国)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 3 figures, WMT25 Shared Task in EMNLP 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13759 2025-11-19 cs.LG cs.AI 62%

Multi-Agent VLMs Guided Self-Training with PNU Loss for Low-Resource Offensive Content Detection

Han Wang, Deyi Ji, Junyu Lu, Lanyun Zhu, Hailong Zhang, Haiyang Wu, Liqun Liu, Peng Shu, Roy Ka-Wei Lee

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

Comments 8 pages, 4 figures, Fortieth AAAI Conference on Artificial Intelligence (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11086 2025-11-19 cs.LG cs.AI 62%

A Survey of Cross-domain Graph Learning: Progress and Future Directions

Haihong Zhao, Zhixun Li, Chenyi Zi, Aochuan Chen, Fugee Tsung, Jia Li, Jeffrey Xu Yu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14255 2025-11-19 cs.CL 57%

AfriSpeech-MultiBench: A Verticalized Multidomain Multicountry Benchmark Suite for African Accented English ASR

Gabrial Zencha Ashungafac, Mardhiyah Sanni, Busayo Awobade, Alex Gichamba, Tobi Olatunji

机构 * Intron Health(Intron健康)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

Comments Accepted As a Conference Paper IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22481 2025-11-19 cs.CY cs.CL 57%

Theories of "Sexuality" in Natural Language Processing Bias Research

Jacob Hobbs

机构 * Department of Computer Science(计算机科学系) Department of Women, Gender, and Sexuality(性别研究系)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

Comments 17 pages, 6 tables, 1 figure, undergraduate senior thesis, submitted to The Spectra: The Virginia Engineering and Science Research Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.13352 2025-11-19 cs.LG cs.CR cs.DC 57%

High Dimensional Distributed Gradient Descent with Arbitrary Number of Byzantine Attackers

Wenyu Liu, Tianqiang Huang, Pengfei Zhang, Zong Ke, Minghui Min, Puning Zhao

专题命中 评测与基准 :prompting(abstract);分类 cs.LG

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14467 2025-11-19 cs.NI 50%

From Topology to Behavioral Semantics: Enhancing BGP Security by Understanding BGP's Language with LLMs

Heng Zhao, Ruoyu Wang, Tianhang Zheng, Qi Li, Bo Lv, Yuyi Wang, Wenliang Du

专题命中 评测与基准 :LLM(abstract)

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13135 2025-11-19 cs.CV 50%

MedGEN-Bench: Contextually entangled benchmark for open-ended multimodal medical generation

Junjie Yang, Yuhao Yan, Gang Wu, Yuxuan Wang, Ruoyu Liang, Xinjie Jiang, Xiang Wan, Fenglei Fan, Yongquan Zhang, Feiwei Qin, Changmiao Wang

机构 * South China University of Technology(华南理工大学) Sun Yat-sen University(中山大学) Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University of Finance & Economics(浙江财经大学) National University of Singapore(新加坡国立大学) Shenzhen Research Institute of Big Data(深圳大数据研究院) City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :language model(abstract)

Comments CVPR 2026 Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13015 2025-11-19 cs.CV 50%

Geometry Meets Light: Leveraging Geometric Priors for Universal Photometric Stereo under Limited Multi-Illumination Cues

King-Man Tam, Satoshi Ikehata, Yuta Asano, Zhaoyi An, Rei Kawakami

专题命中 评测与基准 :foundation model(abstract)

Comments Accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10701 2025-11-19 cs.CV cs.RO 50%

CARScenes: Semantic VLM Dataset for Safe Autonomous Driving

Yuankai He, Weisong Shi

机构 * st Yuankai He(第一作者) nd Weisong Shi(第二作者)

专题命中 评测与基准 :language model(abstract)

Comments 8 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23982 2025-11-19 cs.CV cs.RO 50%

StyleDrive: Towards Driving-Style Aware Benchmarking of End-To-End Autonomous Driving

Ruiyang Hao, Bowen Jing, Haibao Yu, Zaiqing Nie

机构 * AIR, Tsinghua University(空气动力学研究所,清华大学) King’s College London(伦敦国王学院) The University of Manchester(曼彻斯特大学) The University of Hong Kong(香港大学)

专题命中 评测与基准 :language model(abstract)

Comments 25 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏