arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-26 至 2025-08-26 共收录 302 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 63 篇

2506.20354 2025-08-26 cs.LG cs.AI 81%

A foundation model with multi-variate parallel attention to generate neuronal activity

Francesco Carzaniga, Michael Hersche, Abu Sebastian, Kaspar Schindler, Abbas Rahimi

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

Comments The code is available at https://github.com/IBM/multi-variate-parallel-transformer. The SWEC iEEG dataset is available at https://huggingface.co/datasets/NeuroTec/SWEC_iEEG_Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18179 2025-08-26 cs.AI cs.CV 79%

SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models

Zhenwei Tang, Difan Jiao, Blair Yang, Ashton Anderson

机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Coolwei AI Lab(Coolwei人工智能实验室)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17402 2025-08-26 cs.CL cs.IR 79%

DS@GT at CheckThat! 2025: A Simple Retrieval-First, LLM-Backed Framework for Claim Normalization

Aleksandar Pramov, Jiangqin Ma, Bina Patel

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

Comments CLEF 2025 Working Notes, Madrid, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09329 2025-08-26 cs.AI cs.CR 79%

When Developer Aid Becomes Security Debt: A Systematic Analysis of Insecure Behaviors in LLM Coding Agents

Matous Kozak, Roshanak Zilouchian Moghaddam, Siva Sivaraman

机构 * Microsoft(微软公司) Czech Technical University in Prague(捷克技术大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06724 2025-08-26 cs.DB cs.CL 79%

AutoDCWorkflow: LLM-based Data Cleaning Workflow Auto-Generation and Benchmark

Lan Li, Liri Fang, Bertram Ludäscher, Vetle I. Torvik

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

Comments EMNLP Findings, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16762 2025-08-26 cs.CL cs.CY 79%

Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation

Arka Mukherjee, Shreya Ghosh

机构 * KIIT Deemed University(KIIT大学) Indian Institute of Technology (IIT) Bhubaneswar(印度理工学院(Bhubaneswar分校))

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments Accepted at ASI @ ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19793 2025-08-26 cs.CR 78%

Prompt Injection Attack to Tool Selection in LLM Agents

Jiawen Shi, Zenghui Yuan, Guiyao Tie, Pan Zhou, Neil Zhenqiang Gong, Lichao Sun

专题命中 评测与基准 :LLM(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16661 2025-08-26 cs.CV 78%

QA-VLM: Providing human-interpretable quality assessment for wire-feed laser additive manufacturing parts with Vision Language Models

Qiaojie Zheng, Jiucai Zhang, Joy Gockel, Michael B. Wakin, Craig Brice, Xiaoli Zhang

机构 * Mechanical Engineering, Colorado School of Mines(机械工程,科罗拉多矿业学院) Electrical Engineering, Colorado School of Mines(电气工程,科罗拉多矿业学院)

专题命中 评测与基准 :language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16659 2025-08-26 cs.CY cs.AI cs.HC 77%

Enabling Multi-Agent Systems as Learning Designers: Applying Learning Sciences to AI Instructional Design

Jiayi Wang, Ruiwei Xiao, Xinying Hou, John Stamper

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments under review for an [anonymized according to the conference policy] conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.13852 2025-08-26 cs.LG 77%

Hyperbolic Graph Neural Networks: A Review of Methods and Applications

Menglin Yang, Min Zhou, Tong Zhang, Jiahong Liu, Zhihao Li, Lujia Pan, Hui Xiong, Irwin King

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Huawei Technologies Co., Ltd.(华为技术有限公司) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.LG

Comments The latest draft was circulated under the title "Hyperbolic Graph Learning: A Comprehensive Review." The present arXiv version retains the original title, "Hyperbolic Graph Neural Networks: A Review of Methods and Applications," for consistency, while incorporating substantial revisions and extensions

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01608 2025-08-26 cs.CV cs.AI cs.LG q-bio.OT 76%

EPFL-Smart-Kitchen-30: Densely annotated cooking dataset with 3D kinematics to challenge video and language models

Andy Bonnetto, Haozhe Qi, Franklin Leong, Matea Tashkovska, Mahdi Rad, Solaiman Shokur, Friedhelm Hummel, Silvestro Micera, Marc Pollefeys, Alexander Mathis

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑校区) Microsoft(微软) Scuola Superiore Sant’Anna(圣安娜高等学院) Swiss Federal Institute of Technology Valais (EPFL Valais)(瑞士联邦技术学院瓦莱分校) University of Geneva Medical School(日内瓦大学医学院) Eidgenössische Technische Hochschule (ETH)(瑞士联邦理工学院)

专题命中 评测与基准 :language model(title);分类 cs.AI、cs.LG

Comments Code and data at: https://github.com/amathislab/EPFL-Smart-Kitchen

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00020 2025-08-26 q-bio.GN cs.AI cs.LG 76%

Celler:A Genomic Language Model for Long-Tailed Single-Cell Annotation

Huan Zhao, Yiming Liu, Jina Yao, Ling Xiong, Zexin Zhou, Zixing Zhang

机构 * School of Computer Science and Electronic Engineering, Hunan University(计算机科学与电子工程学院,湖南大学)

专题命中 评测与基准 :language model(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14377 2025-08-26 cs.CL cs.AI cs.CY 73%

ZPD-SCA: Unveiling the Blind Spots of LLMs in Assessing Students' Cognitive Abilities

Wenhan Dong, Zhen Sun, Yuemeng Zhao, Zifan Peng, Jun Wu, Jingyi Zheng, Yule Liu, Xinlei He, Yu Wang, Ruiming Wang, Xinyi Huang, Lei Mo

机构 * School of Psychology, South China Normal University(南方科技大学心理学院) Information Hub, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) School of AI, Guangzhou University(广州大学人工智能学院) College of Cyber Security, Jinan University(济南大学网络安全学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07949 2025-08-26 q-bio.QM cs.AI cs.LG cs.NE 73%

Optimizing the Design of an Artificial Pancreas to Improve Diabetes Management

Ashok Khanna, Olivier Francon, Risto Miikkulainen

机构 * Georgia Institute of Technology(佐治亚理工学院) Cognizant AI Lab(Cognizant AI实验室) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Journal ref Proceedings of the IJCAI workshop on Advanced Neural Systems for Next-Generation Biomedical Intelligence, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17718 2025-08-26 cs.CV cs.AI 70%

Instant Preference Alignment for Text-to-Image Diffusion Models

Yang Li, Songlin Yang, Xiaoxuan Han, Wei Wang, Jing Dong, Yueming Lyu, Ziyu Xue

机构 * New Laboratory of Pattern Recognition, CASIA(模式识别新实验室,中国科学院自动化研究所) The Hong Kong University of Science and Technology(香港科技大学) Nanjing university(南京大学) Academy of Broadcasting Science, NRTA(广播科学研究院,国家广播电视总局)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14273 2025-08-26 cs.CL 70%

Let's Use ChatGPT To Write Our Paper! Benchmarking LLMs To Write the Introduction of a Research Paper

Krishna Garg, Firoz Shaik, Sambaran Bandyopadhyay, Cornelia Caragea

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL

Comments 20 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16789 2025-08-26 cs.CV cs.CL 70%

Leveraging the Power of MLLMs for Gloss-Free Sign Language Translation

Jungeun Kim, Hyeongwoo Jeon, Jongseong Bae, Ha Young Kim

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) Graduate School of Information, Yonsei University(信息研究生院,延世大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16688 2025-08-26 cs.SE cs.AI 70%

Cybernaut: Towards Reliable Web Automation

Ankur Tomar, Hengyue Liang, Indranil Bhattacharya, Natalia Larios, Francesco Carbone

机构 * Applied AI, Amazon.com, Bellevue, WA, USA(应用人工智能,亚马逊公司,西雅图,华盛顿州,美国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04866 2025-08-26 cs.CL 70%

ComplexTempQA:A 100m Dataset for Complex Temporal Question Answering

Raphael Gruber, Abdelrahman Abdallah, Michael Färber, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学) Technical University Dresden(德累斯顿技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted at EMNLP main

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17255 2025-08-26 cs.CV cs.RO 67%

SEER-VAR: Semantic Egocentric Environment Reasoner for Vehicle Augmented Reality

Yuzhi Lai, Shenghai Yuan, Peizheng Li, Jun Lou, Andreas Zell

专题命中 评测与基准 :LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17161 2025-08-26 cs.SE 67%

What Developers Ask to ChatGPT in GitHub Pull Requests? an Exploratory Study

Julyanara R. Silva, Carlos Eduardo C. Dantas, Marcelo A. Maia

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments 12 pages, 3 figures

Journal ref 12th Workshop on Software Visualization, Evolution and Maintenance, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01280 2025-08-26 cs.IR cs.MM 67%

Demo: Soccer Information Retrieval via Natural Queries using SoccerRAG

Aleksander Theo Strand, Sushant Gautam, Cise Midoglu, Pål Halvorsen

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments accepted to CBMI 2024 as a demonstration; https://github.com/simula/soccer-rag. arXiv admin note: text overlap with arXiv:2406.01273

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01273 2025-08-26 cs.IR cs.MM 67%

SoccerRAG: Multimodal Soccer Information Retrieval via Natural Queries

Aleksander Theo Strand, Sushant Gautam, Cise Midoglu, Pål Halvorsen

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments accepted to CBMI 2024 as a regular paper; https://github.com/simula/soccer-rag

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16763 2025-08-26 cs.CV 67%

WebMMU: A Benchmark for Multimodal Multilingual Website Understanding and Code Generation

Rabiul Awal, Mahsa Massoud, Aarash Feizi, Zichao Li, Suyuchen Wang, Christopher Pal, Aishwarya Agrawal, David Vazquez, Siva Reddy, Juan A. Rodriguez, Perouz Taslakian, Spandana Gella, Sai Rajeswar

机构 * ServiceNow Mila Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) École de Technologie Supérieure (ETS)(高等技术学院) Polytechnique Montréal(蒙特利尔理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments This paper has been accepted to the EMNLP 2025 main conference. Check the project page here: https://webmmu-paper.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17568 2025-08-26 cs.CV cs.AI cs.CE cs.LG cs.PL 62%

MetaGen: A DSL, Database, and Benchmark for VLM-Assisted Metamaterial Generation

Liane Makatura, Benjamin Jones, Siyuan Bian, Wojciech Matusik

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17393 2025-08-26 cs.CL cs.AI 62%

Agent-Testing Agent: A Meta-Agent for Automated Testing and Evaluation of Conversational AI Agents

Sameer Komoravolu, Khalil Mrini

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Grammarly

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17290 2025-08-26 cs.AI cs.LG 62%

MEENA (PersianMMMU): Multimodal-Multilingual Educational Exams for N-level Assessment

Omid Ghahroodi, Arshia Hemmat, Marzia Nouri, Seyed Mohammad Hadi Hosseini, Doratossadat Dastgheib, Mohammad Vali Sanian, Alireza Sahebi, Reihaneh Zohrabi, Mohammad Hossein Rohban, Ehsaneddin Asgari, Mahdieh Soleymani Baghshah

机构 * Computer Engineering Department, Sharif University of Technology, Iran(谢尔盖大学计算机工程系,伊朗) Qatar Computing Research Institute, Qatar(卡塔尔计算研究所,卡塔尔) Computer Engineering Department, University of Isfahan, Iran(伊斯法罕大学计算机工程系,伊朗) Independent Researcher(独立研究者)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09600 2025-08-26 cs.MA cs.AI cs.CL cs.CR 62%

Effective Red-Teaming of Policy-Adherent Agents

Itay Nakash, George Kour, Koren Lazar, Matan Vetzler, Guy Uziel, Ateret Anaby-Tavor

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17816 2025-08-26 cs.CV cs.AI 57%

UniSino: Physics-Driven Foundational Model for Universal CT Sinogram Standardization

Xingyu Ai, Shaoyu Wang, Zhiyuan Jia, Ao Xu, Hongming Shan, Jianhua Ma, Qiegen Liu

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17405 2025-08-26 cs.LG cs.CR 57%

FRAME : Comprehensive Risk Assessment Framework for Adversarial Machine Learning Threats

Avishag Shapira, Simon Shigol, Asaf Shabtai

机构 * Ben-Gurion University of the Negev(贝内杰尔大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏