arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-11 至 2025-08-11 共收录 47 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 47 篇

2508.06277 2025-08-11 cs.CL cs.LG cs.SD 90%

Large Language Model Data Generation for Enhanced Intent Recognition in German Speech

Theresa Pekarek Rosin, Burak Can Kaplan, Stefan Wermter

机构 * University of Hamburg - Knowledge Technology(汉堡大学-知识技术)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments 11 pages, 3 figures, accepted at KONVENS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20910 2025-08-11 cs.CL 89%

Automated Privacy Information Annotation in Large Language Model Interactions

Hang Zeng, Xiangyu Liu, Yong Hu, Chaoyue Niu, Fan Wu, Shaojie Tang, Guihai Chen

机构 * Shanghai Jiao Tong University(上海交通大学) WeChat Tencent(微信腾讯) University at Buffalo(布法罗大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 8 content pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06155 2025-08-11 cs.CL 88%

Semantic and Structural Analysis of Implicit Biases in Large Language Models: An Interpretable Approach

Renhan Zhang, Lian Lian, Zhen Qi, Guiran Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06145 2025-08-11 cs.AI 88%

Retrieval Augmented Large Language Model System for Comprehensive Drug Contraindications

Byeonghun Bang, Jongsuk Yoon, Dong-Jin Chang, Seho Park, Yong Oh Lee

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10970 2025-08-11 cs.CL cs.AI cs.HC 88%

The Alternative Annotator Test for LLM-as-a-Judge: How to Statistically Justify Replacing Human Annotators with LLMs

Nitay Calderon, Roi Reichart, Rotem Dror

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06047 2025-08-11 cs.AR 87%

ArchXBench: A Complex Digital Systems Benchmark Suite for LLM Driven RTL Synthesis

Suresh Purini, Siddhant Garg, Mudit Gaur, Sankalp Bhat, Sohan Mupparapu, Arun Ravindran

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Published in 7th ACM/IEEE International Symposium on Machine Learning for CAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06467 2025-08-11 cs.LG 85%

LLM Unlearning using Gradient Ratio-Based Influence Estimation and Noise Injection

Ameya Anjarlekar, Sandeep Pombra

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments 14 Pages, 3 Figures, 11 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05669 2025-08-11 cs.IR cs.AI cs.CL cs.CV cs.LG 85%

Fine-Tuning Vision-Language Models for Markdown Conversion of Financial Tables in Malaysian Audited Financial Reports

Jin Khye Tan, En Jun Choong, Ethan Jeremiah Chitty, Yan Pheng Choo, John Hsin Yang Wong, Chern Eu Cheah

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI、cs.LG

Comments 28 pages, 14 figures, 5 tables. Evaluation code (LLM-as-a-judge and Markdown TEDS) is available at https://github.com/jinkhye/MyFinMarkdown. The development dataset and evaluation benchmark are available on Hugging Face at https://huggingface.co/datasets/jinkhye/MyFinMarkdown-sample and https://huggingface.co/datasets/jinkhye/MyFinMarkdown-bench respectively

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00207 2025-08-11 cs.HC 85%

Can LLM "Self-report"?: Evaluating the Validity of Self-report Scales in Measuring Personality Design in LLM-based Chatbots

Huiqi Zou, Pengda Wang, Zihan Yan, Tianjun Sun, Ziang Xiao

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted by COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06087 2025-08-11 cs.CR cs.LG stat.ML 84%

Adaptive Backtracking for Privacy Protection in Large Language Models

Zhihao Yao, Yuxuan Gu, Xiachong Feng, Weitao Ma, Bo Li, Xiaocheng Feng

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17747 2025-08-11 cs.CL cs.AI 84%

Pretraining on the Test Set Is No Longer All You Need: A Debate-Driven Approach to QA Benchmarks

Linbo Cao, Jinman Zhao

机构 * Faculty of Mathematics University of Waterloo(数学系大学水疗)

专题命中 评测与基准 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 22 pages, 7 figures. Accepted to COLM 2025. Code available at: github.com/l6cao/Debate-Driven-Evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13677 2025-08-11 cs.CL cs.AI cs.LG 82%

Revisiting Uncertainty Quantification Evaluation in Language Models: Spurious Interactions with Response Length Bias Results

Andrea Santilli, Adam Golinski, Michael Kirchhof, Federico Danieli, Arno Blaas, Miao Xiong, Luca Zappella, Sinead Williamson

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at ACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17008 2025-08-11 cs.CL 81%

Benchmarking LLMs on the Semantic Overlap Summarization Task

John Salvador, Naman Bansal, Mousumi Akter, Souvika Sarkar, Anupam Das, Shubhra Kanti Karmaker

机构 * Research Center Trustworth Data Science and Security, Technical University of Dortmund(多特蒙德技术大学信任数据科学与安全研究中心) School of Computing, Wichita State University(威斯康星州立大学计算机学院) Department of Computer Science, NC State University(北卡罗来纳州立大学计算机科学系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06284 2025-08-11 eess.AS 80%

Leveraging LLMs for Scalable Non-intrusive Speech Quality Assessment

Fredrik Cumlin, Xinyu Liang, Anubhab Ghosh, Saikat Chatterjee

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments ECAI workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06004 2025-08-11 cs.DL cs.IR 80%

When a Paper Has 1000 Authors: Rethinking Citation Metrics in the Era of LLMs

Weihang Guo, Zhao Song, Jiahao Zhang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05684 2025-08-11 cs.CR cs.LG 79%

MM-FusionNet: Context-Aware Dynamic Fusion for Multi-modal Fake News Detection with Large Vision-Language Models

Junhao He, Tianyu Liu, Jingyuan Zhao, Benjamin Turner

机构 * Huaiyin Institute of Technology(淮阴职业技术学院) Universidad Autónoma de Asunción(阿斯unción自治大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18364 2025-08-11 cs.RO 78%

ImLPR: Image-based LiDAR Place Recognition using Vision Foundation Models

Minwoo Jung, Lanke Frank Tarimo Fu, Maurice Fallon, Ayoung Kim

专题命中 评测与基准 :foundation model(title,abstract)

Comments CoRL2025 Accepted, 23 Pages, 15 Figures and 14 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06418 2025-08-11 cs.CL 77%

Quantifying Conversation Drift in MCP via Latent Polytope

Haoran Shi, Hongwei Yao, Shuo Shao, Shaopeng Jiao, Ziqi Peng, Zhan Qin, Cong Wang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06388 2025-08-11 cs.CL 77%

LLMs vs. Chinese Anime Enthusiasts: A Comparative Study on Emotionally Supportive Role-Playing

Lanlan Qiu, Xiao Pu, Yeqi Feng, Tianxing He

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 21 pages, 17 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05799 2025-08-11 cs.SE cs.AI cs.HC 77%

AI-Guided Exploration of Large-Scale Codebases

Yoseph Berhanu Alebachew

机构 * Department of Computer Science(计算机科学系) Virginia Tech(弗吉尼亚理工大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06484 2025-08-11 cs.HC 75%

Non-programmers Assessing AI-Generated Code: A Case Study of Business Users Analyzing Data

Yuvraj Virk, Dongyu Liu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted by VL/HCC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09105 2025-08-11 cs.CV cs.AI cs.CL cs.LG 75%

INS-MMBench: A Comprehensive Benchmark for Evaluating LVLMs' Performance in Insurance

Chenwei Lin, Hanjia Lyu, Xian Xu, Jiebo Luo

机构 * School of Computer Science Fudan University(复旦大学计算机科学学院) Department of Computer Science University of Rochester(罗切斯特大学计算机科学系) School of Economics Fudan University(复旦大学经济学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments To appear in the International Conference on Computer Vision, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14848 2025-08-11 cs.CL cs.LG cs.MA 73%

MAATS: A Multi-Agent Automated Translation System Based on MQM Evaluation

George Wang, Jiaqian Hu, Safinah Ali

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24277 2025-08-11 cs.LG cs.AI 73%

Evaluating and Designing Sparse Autoencoders by Approximating Quasi-Orthogonality

Sewoong Lee, Adam Davies, Marc E. Canby, Julia Hockenmaier

机构 * Siebel School of Computing and Data Science University of Illinois Urbana-Champaign(计算与数据科学学院 耶鲁大学伊利诺伊分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05429 2025-08-11 cs.CL cs.AI 73%

MyCulture: Exploring Malaysia's Diverse Culture under Low-Resource Language Constraints

Zhong Ken Hew, Jia Xin Low, Sze Jue Yang, Chee Seng Chan

机构 * Universiti Malaya(马来大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06072 2025-08-11 cs.CV cs.AI 70%

Can Large Models Fool the Eye? A New Turing Test for Biological Animation

Zijian Chen, Lirong Deng, Zhengyu Chen, Kaiwei Zhang, Qi Jia, Yuan Tian, Yucheng Zhu, Guangtao Zhai

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05991 2025-08-11 cs.CV cs.AI cs.CY 70%

ECMF: Enhanced Cross-Modal Fusion for Multimodal Emotion Recognition in MER-SEMI Challenge

Juewen Hu, Yexin Li, Jiulin Li, Shuo Chen, Pring Wong

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(人工智能通用基础理论国家重点实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16289 2025-08-11 cs.IR cs.LG 70%

Time to Split: Exploring Data Splitting Strategies for Offline Evaluation of Sequential Recommenders

Danil Gusak, Anna Volodkevich, Anton Klenitskiy, Alexey Vasilev, Evgeny Frolov

机构 * AIRI, Skoltech Moscow Russian Federation(AIRI,斯克里普钦斯基因工学院莫斯科俄罗斯联邦) Sber AI Lab, Skoltech Moscow Russian Federation(Sber AI Lab,斯克里普钦斯基因工学院莫斯科俄罗斯联邦) Sber AI Lab Moscow Russian Federation(Sber AI Lab,莫斯科斯克里普钦斯基因工学院俄罗斯联邦) Sber AI Lab, HSE University Moscow Russian Federation(Sber AI Lab,莫斯科高等经济大学俄罗斯联邦)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

Comments Accepted for ACM RecSys 2025. Author's version. The final published version will be available at the ACM Digital Library

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05855 2025-08-11 cs.AI cs.RO 70%

Safety of Embodied Navigation: A Survey

Zixia Wang, Jia Hu, Ronghui Mu

机构 * University of Exeter(埃克塞特大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05693 2025-08-11 cs.SE cs.AI 70%

Empirical Evaluation of AI-Assisted Software Package Selection: A Knowledge Graph Approach

Siamak Farshidi, Amir Saberhabibi, Behbod Eskafi, Niloofar Nikfarjam, Sadegh Eskandari, Slinger Jansen, Michel Chaudron, Bedir Tekinerdogan

机构 * Computer Science, Utrecht University, Utrecht, The Netherlands Michel Chaudron Department of Mathematics Computer Science, TU Eindhoven, Eindhoven, The Netherlands

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏