arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-14 至 2025-08-14 共收录 41 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 41 篇

2508.09789 2025-08-14 cs.IR cs.CV 89%

Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations

Marco De Nadai, Andreas Damianou, Mounia Lalmas

机构 * Spotify Denmark(Spotify丹麦分公司) Spotify United Kingdom(Spotify英国分公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02009 2025-08-14 cs.CL cs.LG 88%

Towards Safer Pretraining: Analyzing and Filtering Harmful Content in Webscale datasets for Responsible LLMs

Sai Krishna Mendu, Harish Yenala, Aditi Gulati, Shanu Kumar, Parag Agrawal

机构 * Microsoft(微软)

专题命中 评测与基准 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments 10 pages, 5 figures. Accepted at the International Joint Conferences on Artificial Intelligence IJCAI 2025 (main track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09515 2025-08-14 cs.CL 85%

LACA: Improving Cross-lingual Aspect-Based Sentiment Analysis with LLM Data Augmentation

Jakub Šmíd, Pavel Přibáň, Pavel Král

机构 * Department of Computer Science and Engineering(计算机科学与工程系) NTIS – New Technologies for the Information Society University of West Bohemia in Pilsen, Faculty of Applied Sciences(新信息技术社会大学西波希米亚大学皮尔森分校应用科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Published in Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics; Volume 1: Long Papers (ACL 2025). Official version: https://aclanthology.org/2025.acl-long.41/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09911 2025-08-14 cs.HC 85%

Wisdom of the Crowd, Without the Crowd: A Socratic LLM for Asynchronous Deliberation on Perspectivist Data

Malik Khadar, Daniel Runningen, Julia Tang, Stevie Chancellor, Harmanpreet Kaur

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments To appear at CSCW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09594 2025-08-14 cs.DB 85%

LLMLog: Advanced Log Template Generation via LLM-driven Multi-Round Annotation

Fei Teng, Haoyang Li, Lei Chen

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted in VLDB 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09759 2025-08-14 cs.CL 84%

Echoes of Agreement: Argument Driven Opinion Shifts in Large Language Models

Avneet Kaur

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09168 2025-08-14 cs.LG cs.CV 84%

SVGen: Interpretable Vector Graphics Generation with Large Language Models

Feiyu Wang, Zhiyuan Zhao, Yuandong Liu, Da Zhang, Junyu Gao, Hao Sun, Xuelong Li

机构 * Northwestern Polytechnical University(西北工业大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06296 2025-08-14 cs.AI cs.LG 81%

LLM Robustness Leaderboard v1 --Technical report

Pierre Peigné - Lefebvre, Quentin Feuillade-Montixi, Tom David, Nicolas Miailhe

机构 * PRISM Eval(PRISM评估)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21966 2025-08-14 cs.HC cs.AI cs.CL cs.MM 81%

MapStory: Prototyping Editable Map Animations with LLM Agents

Aditya Gunturu, Ben Pearman, Keiichi Ihara, Morteza Faraji, Bryan Wang, Rubaiat Habib Kazi, Ryo Suzuki

机构 * University of Calgary(卡尔加里大学) Adobe Research(Adobe研究)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

Comments UIST 2025. Project page: https://adigunturu.github.io/MapStory-UIST25/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09864 2025-08-14 cs.LG cs.AI cs.CL cs.CV 80%

LUMA: A Benchmark Dataset for Learning from Uncertain and Multimodal Data

Grigor Bezirganyan, Sana Sellami, Laure Berti-Équille, Sébastien Fournier

机构 * Aix Marseille Univ, CNRS, LIS(阿维尼翁-马赛大学、国家科学研究中心、LIS)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments SIGIR 2025

Journal ref Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09716 2025-08-14 cs.CL 79%

The Perils of Chart Deception: How Misleading Visualizations Affect Vision-Language Models

Ridwan Mahbub, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Mizanur Rahman, Mir Tafseer Nayeem, Enamul Hoque

机构 * York University(约克大学) University of Alberta(阿尔伯塔大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments Accepted to IEEE VIS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09945 2025-08-14 cs.CL cs.AI cs.CV 79%

VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models

Lingjie Jiang, Shaohan Huang, Xun Wu, Yixia Li, Dongdong Zhang, Furu Wei

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09152 2025-08-14 cs.NI cs.AI cs.LG 79%

5G Core Fault Detection and Root Cause Analysis using Machine Learning and Generative AI

Joseph H. R. Isaac, Harish Saradagam, Nallamothu Pardhasaradhi

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 8 pages, 3 figures and 2 tables. Accepted in Conference on Advances in Communication Networks & Systems (CoaCoNS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17619 2025-08-14 cs.CV 78%

CAS-IQA: Teaching Vision-Language Models for Synthetic Angiography Quality Assessment

Bo Wang, De-Xing Huang, Xiao-Hu Zhou, Mei-Jiang Gui, Nu-Fang Xiao, Jian-Long Hao, Ming-Yuan Liu, Zeng-Guang Hou

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology Beijing(北京科技大学) Hunan University of Science and Technology(湖南科技大学) Shanxi University of Finance and Economics(山西财经大学) Beijing Friendship Hospital, Capital Medical University(首都医科大学北京友谊医院)

专题命中 评测与基准 :language model(title,abstract)

Comments Camera ready version for ICONIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18923 2025-08-14 cs.CV 78%

Video SimpleQA: Towards Factuality Evaluation in Large Video Language Models

Meng Cao, Pengfei Hu, Yingyao Wang, Jihao Gu, Haoran Tang, Haoze Zhao, Chen Wang, Jiahua Dong, Wangbo Yu, Ge Zhang, Jun Song, Xiang Li, Bo Zheng, Ian Reid, Xiaodan Liang

专题命中 评测与基准 :language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07532 2025-08-14 cs.CL cs.AI cs.LG 78%

AI-Slop to AI-Polish? Aligning Language Models through Edit-Based Writing Rewards and Test-time Computation

Tuhin Chakrabarty, Philippe Laban, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce人工智能研究) Microsoft Research(微软研究院)

专题命中 评测与基准 :language model(title);分类 cs.CL、cs.AI、cs.LG

Comments Under Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09815 2025-08-14 cs.MA cs.CR cs.SE 75%

Extending the OWASP Multi-Agentic System Threat Modeling Guide: Insights from Multi-Agent Security Research

Klaudia Krawiecka, Christian Schroeder de Witt

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10960 2025-08-14 cs.CL cs.AI cs.CR cs.IR cs.LG 75%

ChineseHarm-Bench: A Chinese Harmful Content Detection Benchmark

Kangwei Liu, Siyuan Cheng, Bozhong Tian, Xiaozhuan Liang, Yuyang Yin, Meng Han, Ningyu Zhang, Bryan Hooi, Xi Chen, Shumin Deng

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10417 2025-08-14 cs.CL cs.AI cs.SD eess.AS 73%

Leveraging Audio and Text Modalities in Mental Health: A Study of LLMs Performance

Abdelrahman A. Ali, Aya E. Fouda, Radwa J. Hanafy, Mohammed E. Fouda

机构 * Compumacy for Artificial Intelligence solutions(人工智能解决方案公司) Department of Behavioural Health- Saint Elizabeths Hospital(行为健康部门-圣伊丽莎白医院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09762 2025-08-14 cs.AI cs.CY cs.HC 70%

The PacifAIst Benchmark:Would an Artificial Intelligence Choose to Sacrifice Itself for Human Safety?

Manuel Herrador

机构 * Polytechnic School of Jaen, University of Jaen(耶尼大学多技术学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 10 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09662 2025-08-14 cs.CL 70%

EffiEval: Efficient and Generalizable Model Evaluation via Capability Coverage Maximization

Yaoning Wang, Jiahao Ying, Yixin Cao, Yubo Ma, Yugang Jiang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09631 2025-08-14 cs.DB cs.AI 70%

AmbiGraph-Eval: Can LLMs Effectively Handle Ambiguous Graph Queries?

Yuchen Tian, Kaixin Li, Hao Chen, Ziyang Luo, Hongzhan Lin, Sebastian Schelter, Lun Du, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09622 2025-08-14 cs.CL 70%

AINL-Eval 2025 Shared Task: Detection of AI-Generated Scientific Abstracts in Russian

Tatiana Batura, Elena Bruches, Milana Shvenk, Valentin Malykh

机构 * A.P. Ershov Institute of Informatics Systems(A.P.埃尔绍夫信息系统研究所) Novosibirsk State University(新西伯利亚国立大学) ITMO University(ITMO大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments AINL 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23486 2025-08-14 cs.CL 70%

A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains

Shirui Wang, Zhihui Tang, Huaxia Yang, Qiuhong Gong, Tiantian Gu, Hongyang Ma, Yongxin Wang, Wubin Sun, Zeliang Lian, Kehang Mao, Yinan Jiang, Zhicheng Huang, Lingyun Ma, Wenjie Shen, Yajie Ji, Yunhui Tan, Chunbo Wang, Yunlu Gao, Qianling Ye, Rui Lin, Mingyu Chen, Lijuan Niu, Zhihao Wang, Peng Yu, Mengran Lang, Yue Liu, Huimin Zhang, Haitao Shen, Long Chen, Qiguang Zhao, Si-Xuan Liu, Lina Zhou, Hua Gao, Dongqiang Ye, Lingmin Meng, Youtao Yu, Naixin Liang, Jianxiong Wu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00938 2025-08-14 cs.IR cs.AI cs.DB 70%

WebArXiv: Evaluating Multimodal Agents on Time-Invariant arXiv Tasks

Zihao Sun, Ling Chen

机构 * University of Technology Sydney(悉尼技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 10 pages, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22557 2025-08-14 cs.CR cs.LG 70%

MetaCipher: A Time-Persistent and Universal Multi-Agent Framework for Cipher-Based Jailbreak Attacks for LLMs

Boyuan Chen, Minghao Shao, Abdul Basit, Siddharth Garg, Muhammad Shafique

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09517 2025-08-14 cs.CL 70%

UWBa at SemEval-2025 Task 7: Multilingual and Crosslingual Fact-Checked Claim Retrieval

Ladislav Lenc, Daniel Cífka, Jiří Martínek, Jakub Šmíd, Pavel Král

机构 * Department of Computer Science and Engineering, University of West Bohemia in Pilsen(西波希米亚大学信息科学与工程系) New Technologies for the Information Society, University of West Bohemia in Pilsen(西波希米亚大学信息社会新技术研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Published in Proceedings of the 19th International Workshop on Semantic Evaluation (SemEval-2025). Official version: https://aclanthology.org/2025.semeval-1.31/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09203 2025-08-14 cs.LG 70%

Building Safer Sites: A Large-Scale Multi-Level Dataset for Construction Safety Research

Zhenhui Ou, Dawei Li, Zhen Tan, Wenlin Li, Huan Liu, Siyuan Song

机构 * Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

Comments The paper was accepted on the CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09641 2025-08-14 cs.CE 67%

VisFinEval: A Scenario-Driven Chinese Multimodal Benchmark for Holistic Financial Understanding

Zhaowei Liu, Xin Guo, Haotian Xia, Lingfeng Zeng, Fangqi Lou, Jinyi Niu, Mengping Li, Qi Qi, Jiahuan Li, Wei Zhang, Yinglong Wang, Weige Cai, Weining Shen, Liwen Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09566 2025-08-14 cs.CV 67%

A Chain of Diagnosis Framework for Accurate and Explainable Radiology Report Generation

Haibo Jin, Haoxuan Che, Sunan He, Hao Chen

机构 * Department of Computer Science and Engineering, Hong Kong University of Science and Technology(计算机科学与工程系,香港科学理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments Accepted to IEEE TMI

详情

展开后加载摘要…

URL PDF HTML 收藏