arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-15 至 2025-08-15 共收录 174 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 45 篇

2508.10230 2025-08-15 cs.SD cs.AI 74%

No Free Lunch from Audio Pretraining in Bioacoustics: A Benchmark Study of Embeddings

Chenggang Chen, Zhiyu Yang

机构 * Department of Biomedical Engineering Johns Hopkins University(生物医学工程系约翰·霍普金斯大学)

专题命中 评测与基准 :pretraining(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10005 2025-08-15 cs.CL cs.AI 73%

From Answers to Questions: EQGBench for Evaluating LLMs' Educational Question Generation

Chengliang Zhou, Mei Wang, Ting Zhang, Qiannan Zhu, Jian Li, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09999 2025-08-15 cs.CL cs.LG 73%

XFacta: Contemporary, Real-World Dataset and Evaluation for Multimodal Misinformation Detection with Multimodal LLMs

Yuzhuo Xiao, Zeyu Han, Yuhan Wang, Huaizu Jiang

机构 * Guizhou University(贵州大学) Northeastern University(东北大学) UC Santa Cruz(加州大学圣克ruz分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments For associated code and dataset, see https://github.com/neu-vi/XFacta

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10428 2025-08-15 cs.LG 70%

SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks

Pengbo Shen, Yaqing Wang, Ni Mu, Yao Luan, Runpeng Xie, Senhao Yang, Lexiang Wang, Hao Hu, Shuang Xu, Yiqin Yang, Bo Xu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10421 2025-08-15 cs.CL 70%

Evaluating LLMs on Chinese Idiom Translation

Cai Yang, Yao Dou, David Heineman, Xiaofeng Wu, Wei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10173 2025-08-15 cs.LG cs.CY 70%

Benchmark-Driven Selection of AI: Evidence from DeepSeek-R1

Petr Spelda, Vit Stritecky

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

Comments 17 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10015 2025-08-15 cs.CL 70%

RealTalk-CN: A Realistic Chinese Speech-Text Dialogue Benchmark With Cross-Modal Interaction Analysis

Enzhi Wang, Qicheng Li, Shiwan Zhao, Aobo Kong, Jiaming Zhou, Xi Yang, Yequan Wang, Yonghua Lin, Yong Qin

机构 * TMCC, College of Computer Science, Nankai University(TMCC,计算机科学学院,南开大学) Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08909 2025-08-15 cs.AI 70%

Compass-Thinker-7B Technical Report

Anxiang Zeng, Haibo Zhang, Kaixiang Mo, Long Zhang, Shuman Liu, Yanhui Huang, Yawen Liu, Yuepeng Sheng, Yuwei Huang

机构 * Shopee LLM Team(Shopee LLM团队)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10236 2025-08-15 cs.CR cs.AI cs.CL cs.CY cs.LG 67%

Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods

Yeonwoo Jang, Shariqah Hossain, Ashwin Sreevatsa, Diogo Cruz

机构 * Supervised Program for Alignment Research (SPAR)(对齐研究监督计划)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 19 pages, 6 figures. Accepted at COLM 2025 SoLaR Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09998 2025-08-15 cs.CL cs.AI 62%

INTIMA: A Benchmark for Human-AI Companionship Behavior

Lucie-Aimée Kaffee, Giada Pistilli, Yacine Jernite

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23701 2025-08-15 cs.AI cs.CL 62%

TextQuests: How Good are LLMs at Text-Based Video Games?

Long Phan, Mantas Mazeika, Andy Zou, Dan Hendrycks

机构 * Center for AI Safety(人工智能安全中心) Carnegie Mellon University(卡内基梅隆大学) Gray Swan AI(灰天鹅AI)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10881 2025-08-15 cs.CV cs.AI 57%

ToonComposer: Streamlining Cartoon Production with Generative Post-Keyframing

Lingen Li, Guangzhi Wang, Zhaoyang Zhang, Yaowei Li, Xiaoyu Li, Qi Dou, Jinwei Gu, Tianfan Xue, Ying Shan

机构 * The Chinese University of Hong Kong(香港中文大学) ARC Lab, Tencent PCG(腾讯PCG动画实验室) Peking University(北京大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

Comments Project Page: https://lg-li.github.io/project/tooncomposer

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10771 2025-08-15 cs.CV cs.AI 57%

AEGIS: Authenticity Evaluation Benchmark for AI-Generated Video Sequences

Jieyu Li, Xin Zhang, Joey Tianyi Zhou

机构 * National University of Singapore(新加坡国立大学) Agency for Science, Technology and Research(科技研究局)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

Comments Proceedings of the 33rd ACM International Conference on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10769 2025-08-15 cs.AI cs.MM 57%

Modeling Human Responses to Multimodal AI Content

Zhiqi Shen, Shaojing Fan, Danni Xu, Terence Sim, Mohan Kankanhalli

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10429 2025-08-15 cs.AI cs.CR cs.CV 57%

MM-Food-100K: A 100,000-Sample Multimodal Food Intelligence Dataset with Verifiable Provenance

Yi Dong, Yusuke Muraoka, Scott Shi, Yi Zhang

机构 * Codatta Kite AI Binance Wallet Community Codatta Community

专题命中 评测与基准 :language model(abstract);分类 cs.AI

Comments 10 pages, 5 figures, 6 tables. The dataset is available at https://huggingface.co/datasets/Codatta/MM-Food-100K

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10397 2025-08-15 cs.CV cs.AI 57%

PQ-DAF: Pose-driven Quality-controlled Data Augmentation for Data-scarce Driver Distraction Detection

Haibin Sun, Xinghui Song

机构 * College of Computer Science and Engineering, Shandong University of Science and Technology(计算机科学与工程学院,山东科技大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09584 2025-08-15 cs.CV 50%

SHALE: A Scalable Benchmark for Fine-grained Hallucination Evaluation in LVLMs

Bei Yan, Zhiyuan Chen, Yuecong Min, Jie Zhang, Jiahao Wang, Xiaozhen Wang, Shiguang Shan

机构 * Key Laboratory of AI Safety of CAS, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院计算技术研究所人工智能安全重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Trustworthy Technology and Engineering Laboratory, Huawei(华为可信技术与工程实验室)

专题命中 评测与基准 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09524 2025-08-15 cs.CV 50%

SOI is the Root of All Evil: Quantifying and Breaking Similar Object Interference in Single Object Tracking

Yipei Wang, Shiyu Hu, Shukun Jia, Panxi Xu, Hongfei Ma, Yiping Ma, Jing Zhang, Xiaobo Lu, Xin Zhao

专题命中 评测与基准 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00399 2025-08-15 cs.CV 50%

iSafetyBench: A video-language benchmark for safety in industrial environment

Raiyaan Abdullah, Yogesh Singh Rawat, Shruti Vyas

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 评测与基准 :language model(abstract)

Comments Accepted to VISION'25 - ICCV 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03096 2025-08-15 cs.CV 50%

Scaling Open-Vocabulary Action Detection

Zhen Hao Sia, Yogesh Singh Rawat

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 评测与基准 :pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 22 篇

2508.10304 2025-08-15 cs.CL cs.AI 90%

Yet another algorithmic bias: A Discursive Analysis of Large Language Models Reinforcing Dominant Discourses on Gender and Race

Gustavo Bonil, Simone Hashiguti, Jhessica Silva, João Gondim, Helena Maia, Nádia Silva, Helio Pedrini, Sandra Avila

机构 * Instituto de Estudos da Linguagem (IEL), Universidade Estadual de Campinas (UNICAMP)(语言研究学院(IEL),Campinas州立大学(UNICAMP)) Instituto de Computação (IC), Universidade Estadual de Campinas (UNICAMP)(计算学院(IC),Campinas州立大学(UNICAMP)) Instituto de Informática, Universidade Federal de Goiás (UFG)(信息学院,戈亚斯联邦大学(UFG))

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 29 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10696 2025-08-15 cs.CE 89%

Chem3DLLM: 3D Multimodal Large Language Models for Chemistry

Lei Jiang, Shuzhou Sun, Biqing Qi, Yuchen Fu, Xiaohua Xu, Yuqiang Li, Dongzhan Zhou, Tianfan Fu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10552 2025-08-15 cs.CL cs.AI 88%

When Language Overrules: Revealing Text Dominance in Multimodal Large Language Models

Huyu Wu, Meng Tang, Xinhan Zheng, Haiyun Jiang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10581 2025-08-15 cs.LG 85%

Technical Report: Facilitating the Adoption of Causal Inference Methods Through LLM-Empowered Co-Pilot

Jeroen Berrevoets, Julianna Piskorz, Robert Davis, Harry Amad, Jim Weatherall, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学) AstraZeneca(阿斯利康)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10778 2025-08-15 cs.CV cs.AI 85%

Warehouse Spatial Question Answering with LLM Agent

Hsiang-Wei Huang, Jen-Hao Cheng, Kuang-Ming Chen, Cheng-Yen Yang, Bahaa Alattar, Yi-Ru Lin, Pyongkun Kim, Sangwon Kim, Kwangju Kim, Chung-I Huang, Jenq-Neng Hwang

机构 * Information Processing Lab, University of Washington, USA(华盛顿大学信息处理实验室) Electronics and Telecommunications Research Institute, South Korea(韩国电子电信研究院) National Center for High-performance Computing, Taiwan(台湾高性能计算国家研究中心)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 1st Place Solution of the 9th AI City Challenge Track 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05690 2025-08-15 cs.CR cs.DB cs.LG 84%

Leveraging large language models for SQL behavior-based database intrusion detection

Meital Shlezinger, Shay Akirav, Lei Zhou, Liang Guo, Avi Kessel, Guoliang Li

机构 * Huawei Tel Aviv Research Center(华为特拉维夫研究中心) Huawei Technologies Co. LTD(华为技术有限公司) Tsinghua University(清华大学)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10701 2025-08-15 cs.LG cs.AI 82%

REFN: A Reinforcement-Learning-From-Network Framework against 1-day/n-day Exploitations

Tianlong Yu, Lihong Liu, Ziyi Zhou, Fudu Xing, Kailong Wang, Yang Yang

机构 * School of Artificial Intelligence, Hubei University(湖北大学人工智能学院) Huazhong University of Science and Technology(华中科技大学) University of Southern California(美国南加州大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06639 2025-08-15 cs.CV cs.AI cs.LG 81%

EXAONE Path 2.0: Pathology Foundation Model with End-to-End Supervision

Myeongjang Pyeon, Janghyeon Lee, Minsoo Lee, Juseung Yun, Hwanil Choi, Jonghyun Kim, Jiwon Kim, Yi Hu, Jongseong Jang, Soonyoung Lee

机构 * LG AI Research(LG人工智能研究院)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

Comments EXAONE Path 2.0 technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10251 2025-08-15 cs.PF 80%

Meta-Metrics and Best Practices for System-Level Inference Performance Benchmarking

Shweta Salaria, Zhuoran Liu, Nelson Mimura Gonzalez

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03810 2025-08-15 cs.LG cs.AI cs.CL 80%

Grouped Sequency-arranged Rotation: Optimizing Rotation Transformation for Quantization for Free

Euntae Choi, Sumin Song, Woosang Lim, Sungjoo Yoo

机构 * Seoul National University(首尔国立大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏