arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-22 至 2025-08-22 共收录 142 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 41 篇

2505.17894 2025-08-22 cs.CL cs.AI 87%

Mutarjim: Advancing Bidirectional Arabic-English Translation with a Small Language Model

Khalil Hennara, Muhammad Hreden, Mohamed Motaism Hamed, Zeina Aldallal, Sara Chrouf, Safwan AlModhayan

专题命中 评测与基准 :language model(title,abstract);small language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02039 2025-08-22 cs.CL cs.AI 86%

An Investigation into Value Misalignment in LLM-Generated Texts for Cultural Heritage

Fan Bu, Zheng Wang, Siyi Wang, Ziyao Liu

机构 * Department of Archeology and Museology, Shanghai University(考古与博物馆学系,上海大学) National Collaborative Research Center for Revolutionary Cultural Heritage at Memorial of the First CPC National Congress & Shanghai University(革命文化遗产国家联合研究中心,中共一大会址纪念馆与上海大学) School of Management, Shanghai University(管理学院,上海大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13092 2025-08-22 cs.CR cs.AI 85%

VerilogLAVD: LLM-Aided Rule Generation for Vulnerability Detection in Verilog

Xiang Long, Yingjie Xia, Xiyuan Chen, Li Kuang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14716 2025-08-22 cs.LG 85%

Pairwise or Pointwise? Evaluating Feedback Protocols for Bias in LLM-Based Evaluation

Tuhina Tripathi, Manya Wadhwa, Greg Durrett, Scott Niekum

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Published at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15526 2025-08-22 cs.CL 85%

SafetyFlow: An Agent-Flow System for Automated LLM Safety Benchmarking

Xiangyang Zhu, Yuan Tian, Chunyi Li, Kaiwei Zhang, Wei Sun, Guangtao Zhai

机构 * Shanghai AI Lab(上海人工智能实验室) East China Normal University(东华大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Code and dataset are available at https://github.com/yangyangyang127/SafetyFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15429 2025-08-22 cs.CL 85%

Pub-Guard-LLM: Detecting Retracted Biomedical Articles with Reliable Explanations

Lihu Chen, Shuojie Fu, Gabriel Freedman, Cemre Zor, Guy Martin, James Kinross, Uddhav Vaghela, Ovidiu Serban, Francesca Toni

机构 * Imperial College London(伦敦帝国学院) Amazon Web Services(亚马逊网络服务) National Health Service(国家健康服务)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments long paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11060 2025-08-22 cs.CV 82%

BannerAgency: Advertising Banner Design with Multimodal LLM Agents

Heng Wang, Yotaro Shimose, Shingo Takamatsu

机构 * Sony Group Corporation(索尼集团)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

Comments Accepted as a main conference paper at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15928 2025-08-22 cs.AI cs.CL cs.HC 82%

Exploring Big Five Personality and AI Capability Effects in LLM-Simulated Negotiation Dialogues

Myke C. Cohen, Zhe Su, Hsien-Te Kao, Daniel Nguyen, Spencer Lynch, Maarten Sap, Svitlana Volkova

机构 * Aptima, Inc.(Aptima公司) Human Systems Engineering, Arizona State University(亚利桑那州立大学人类系统工程系) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

Comments Presented at the KDD 2025 Workshop on Evaluation and Trustworthiness of Agentic and Generative AI Models under the title "Evaluating the LLM-simulated Impacts of Big Five Personality Traits and AI Capabilities on Social Negotiations" (https://kdd-eval-workshop.github.io/genai-evaluation-kdd2025/assets/papers/Submission%2036.pdf)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15407 2025-08-22 cs.CL cs.AI 81%

When Audio and Text Disagree: Revealing Text Bias in Large Audio-Language Models

Cheng Wang, Gelei Deng, Xianglin Yang, Han Qiu, Tianwei Zhang

机构 * National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01619 2025-08-22 cs.SE cs.AI cs.CL cs.LG 80%

Learning to Generate Unit Tests for Automated Debugging

Archiki Prasad, Elias Stengel-Eskin, Justin Chih-Yao Chen, Zaid Khan, Mohit Bansal

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to COLM 2025. Dataset and Code: https://github.com/archiki/UTGenDebug

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19675 2025-08-22 cs.CL cs.AI cs.DL cs.IR cs.LG 80%

Annif at SemEval-2025 Task 5: Traditional XMTC augmented by LLMs

Osma Suominen, Juho Inkinen, Mona Lehtinen

机构 * National Library of Finland, University of Helsinki(芬兰国家图书馆,赫尔辛基大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 6 pages, 4 figures, published at SemEval-2025 workshop Task 5: LLMs4Subjects: https://aclanthology.org/2025.semeval-1.315/

Journal ref Proceedings of the 19th International Workshop on Semantic Evaluation (SemEval-2025), 2424--2431

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15392 2025-08-22 cs.LG cs.CL 79%

CITE: A Comprehensive Benchmark for Heterogeneous Text-Attributed Graphs on Catalytic Materials

Chenghao Zhang, Qingqing Long, Ludi Wang, Wenjuan Cui, Jianjun Yu, Yi Du

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 23 pages, 4 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15481 2025-08-22 cs.IR 78%

On Evaluating the Adversarial Robustness of Foundation Models for Multimodal Entity Linking

Fang Wang, Yongjie Wang, Zonghao Yang, Minghao Hu, Xiaoying Bai

专题命中 评测与基准 :foundation model(title);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12910 2025-08-22 cs.CR cs.AI cs.AR 77%

SecFSM: Knowledge Graph-Guided Verilog Code Generation for Secure Finite State Machines in Systems-on-Chip

Ziteng Hu, Yingjie Xia, Xiyuan Chen, Li Kuang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11288 2025-08-22 cs.AI 77%

Opus: A Prompt Intention Framework for Complex Workflow Generation

Théo Fagnoni, Mahsun Altin, Chia En Chung, Phillip Kingston, Alan Tuning, Dana O. Mohamed, Inès Adnani

机构 * AppliedAI

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 39 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12710 2025-08-22 cs.CR cs.AI cs.SE 77%

Innamark: A Whitespace Replacement Information-Hiding Method

Malte Hellmeier, Hendrik Norkowski, Ernst-Christoph Schrewe, Haydar Qarawlus, Falk Howar

机构 * Fraunhofer ISST(弗劳恩霍夫研究所) Montsecure GmbH(蒙特塞cur公司) TU Dortmund(图尔恩大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted and published in the IEEE Access journal as extended version of doi:10.24251/HICSS.2025.886

Journal ref IEEE Access, Volume 13, 2025, pp. 123120 - 123135

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15232 2025-08-22 cs.CV 75%

AeroDuo: Aerial Duo for UAV-based Vision and Language Navigation

Ruipu Wu, Yige Zhang, Jinyu Chen, Linjiang Huang, Shifeng Zhang, Xu Zhou, Liang Wang, Si Liu

机构 * Beihang University(北京航空航天大学) Sangfor Technologies Inc.(深信服科技有限公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22189 2025-08-22 cs.LG cs.CL cs.MA 73%

Exploring Modularity of Agentic Systems for Drug Discovery

Laura van Weesep, Samuel Genheden, Ola Engkvist, Jens Sjölund

机构 * Chalmers University of Technology(楚德斯理工大学) University of Gothenburg(戈尔堡大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11169 2025-08-22 cs.CL cs.AI 73%

MuSeD: A Multimodal Spanish Dataset for Sexism Detection in Social Media Videos

Laura De Grazia, Pol Pastells, Mauro Vázquez Chas, Desmond Elliott, Danae Sánchez Villegas, Mireia Farrús, Mariona Taulé

机构 * University of Barcelona, CLiC-Language and Computing Center(巴塞罗那大学,CLiC语言与计算中心) University of Copenhagen, Department of Computer Science(哥本哈根大学,计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments COLM 2025 camera-ready version: expanded Section 4.3 with an additional experiment using an extended definition-based prompt (including a definition of sexist content), and applied minor corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15218 2025-08-22 cs.CL 70%

Are Checklists Really Useful for Automatic Evaluation of Generative Tasks?

Momoka Furuhashi, Kouta Nakayama, Takashi Kodama, Saku Sugawara

机构 * Tohoku University(东洋大学) Research and Development Center for Large Language Models, National Institute of Informatics(大型语言模型研究与开发中心,日本信息处理学会) National Institute of Informatics(日本信息处理学会)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to the EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07470 2025-08-22 cs.CV 67%

AURA: A Fine-Grained Benchmark and Decomposed Metric for Audio-Visual Reasoning

Siminfar Samakoush Galougah, Rishie Raj, Sanjoy Chowdhury, Sayan Nag, Ramani Duraiswami

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15418 2025-08-22 cs.CL cs.AI cs.LG cs.MM cs.SD 67%

LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model

Yirong Sun, Yizhong Geng, Peidong Wei, Yanjun Chen, Jinghan Yang, Rongfei Chen, Wei Zhang, Xiaoyu Shen

机构 * Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin, EIT(宁波空间智能与数字衍生关键实验室,数字孪生研究院,EIT) Logic Intelligence Technology(逻辑智能技术) BUPT(北京邮电大学) Xiamen University(厦门大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15085 2025-08-22 cs.CL cs.AI cs.IR cs.LG 67%

LongRecall: A Structured Approach for Robust Recall Evaluation in Long-Form Text

MohamamdJavad Ardestani, Ehsan Kamalloo, Davood Rafiei

机构 * Department of Computing Science University of Alberta(计算科学系阿尔伯塔大学) ServiceNow Research(ServiceNow研究)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18246 2025-08-22 cs.CV 67%

Referring Expression Instance Retrieval and A Strong End-to-End Baseline

Xiangzhao Hao, Kuan Zhu, Hongyu Guo, Haiyun Guo, Ning Jiang, Quan Lu, Ming Tang, Jinqiao Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Mashang Consumer Finance Co, Ltd(马商消费金融有限公司)

专题命中 评测与基准 :language model(abstract);prompting(abstract)

Comments ACMMM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22146 2025-08-22 cs.CV cs.AI cs.CL q-bio.NC 62%

Flexible Tool Selection through Low-dimensional Attribute Alignment of Vision and Language

Guangfu Hao, Haojie Wen, Liangxuan Guo, Yang Chen, Yanchao Bi, Shan Yu

机构 * Laboratory of Brain Atlas and Brain-inspired Intelligence, Institute of Automation Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所脑图谱与类脑智能实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) School of Systems Science, Beijing Normal University(北京师范大学系统科学学院) School of Psychological and Cognitive Sciences & Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京大学心理与认知科学学院) IDG/McGovern Institute for Brain Research, Peking University(北京大学IDG/ McGovern脑科学研究院) Institute for Artificial Intelligence & Key Laboratory of Machine Perception (Ministry of Education), Peking University(北京大学人工智能研究所) School of Future Technology, University of Chinese Academy of Sciences (UCAS)(中国科学院大学未来技术学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15663 2025-08-22 cs.RO cs.AI 57%

Mind and Motion Aligned: A Joint Evaluation IsaacSim Benchmark for Task Planning and Low-Level Policies in Mobile Manipulation

Nikita Kachaev, Andrei Spiridonov, Andrey Gorodetsky, Kirill Muravyev, Nikita Oskolkov, Aditya Narendra, Vlad Shakhuro, Dmitry Makarov, Aleksandr I. Panov, Polina Fedotova, Alexey K. Kovalev

机构 * AIRI Moscow Institute of Physics and Technology (MIPT)(莫斯科物理技术学院) Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) Sberbank, Robotics Center(Sberbank机器人中心) Skoltech

专题命中 评测与基准 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15456 2025-08-22 cs.CL 57%

PyTOD: Programmable Task-Oriented Dialogue with Execution Feedback

Alexandru Coca, Bo-Hsiang Tseng, Pete Boothroyd, Jianpeng Cheng, Mark Gaynor, Zhenxing Zhang, Joe Stacey, Tristan Guigue, Héctor Martinez Alonso, Diarmuid Ó Séaghdha, Anders Johannsen

专题命中 评测与基准 :language model(abstract);分类 cs.CL

Comments 20 pages, 12 figures. To appear at SIGDIAL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15297 2025-08-22 cs.CV cs.AI 57%

DesignCLIP: Multimodal Learning with CLIP for Design Patent Understanding

Zhu Wang, Homaira Huda Shomee, Sathya N. Ravi, Sourav Medya

机构 * Department of Computer Science, University of Illinois Chicago(计算机科学系,伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

Comments Accepted by EMNLP 2025. 22 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14925 2025-08-22 cs.CR cs.LG 57%

MCPTox: A Benchmark for Tool Poisoning Attack on Real-World MCP Servers

Zhiqiang Wang, Yichao Gao, Yanting Wang, Suyuan Liu, Haifeng Sun, Haoran Cheng, Guanquan Shi, Haohua Du, Xiangyang Li

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14151 2025-08-22 eess.IV cs.AI cs.CV 57%

A Systematic Study of Deep Learning Models and xAI Methods for Region-of-Interest Detection in MRI Scans

Justin Yiu, Kushank Arora, Daniel Steinberg, Rohit Ghiya

机构 * Georgia Institute of Technology(佐治亚理工学院) Imperial College London(伦敦帝国理工学院)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏