arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-05 至 2025-08-05 共收录 292 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 84 篇

2506.10342 2025-08-05 cs.CV cs.AI 86%

UrbanSense:A Framework for Quantitative Analysis of Urban Streetscapes leveraging Vision Large Language Models

Jun Yin, Jing Zhong, Peilin Li, Ruolin Pan, Pengyu Zeng, Miao Zhang, Shuai Lu

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07739 2025-08-05 cs.CV cs.AI 86%

ArchiLense: A Framework for Quantitative Analysis of Architectural Styles Based on Vision Large Language Models

Jing Zhong, Jun Yin, Peilin Li, Pengyu Zeng, Miao Zang, Ran Luo, Shuai Lu

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01178 2025-08-05 cs.SD cs.AI cs.IR eess.AS 85%

Advancing the Foundation Model for Music Understanding

Yi Jiang, Wei Wang, Xianwen Guo, Huiyun Liu, Hanrui Wang, Youri Xu, Haoqi Gu, Zhongqian Xie, Chuanjiang Luo

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01370 2025-08-05 cs.CL cs.IR 85%

MaRGen: Multi-Agent LLM Approach for Self-Directed Market Research and Analysis

Roman Koshkin, Pengyu Dai, Nozomi Fujikawa, Masahito Togami, Marco Visentini-Scarzanella

机构 * Okinawa Institute of Science and Technology(冲绳科学技术研究所) Institute of Science Tokyo(东京科学研究所) Amazon(亚马逊)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01203 2025-08-05 cs.AI 85%

Importance Sampling is All You Need: Predict LLM's performance on new benchmark by reusing existing benchmark

Junjie Shi, Wei Ma, Shi Ying, Lingxiao Jiang, Yang liu, Bo Du

机构 * Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理学院) Wuhan University(武汉大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08113 2025-08-05 cs.SE 85%

Test Amplification for REST APIs via Single and Multi-Agent LLM Systems

Robbe Nooyens, Tolgahan Bardakci, Mutlu Beyazit, Serge Demeyer

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02035 2025-08-05 cs.CR 85%

PhishParrot: LLM-Driven Adaptive Crawling to Unveil Cloaked Phishing Sites

Hiroki Nakano, Takashi Koide, Daiki Chiba

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted for publication at IEEE GLOBECOM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01699 2025-08-05 cs.CV 85%

TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding

Zuhao Yang, Yingchen Yu, Yunqing Zhao, Shijian Lu, Song Bai

机构 * Nanyang Technological University(南洋理工大学) ByteDance Inc.(字节跳动公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01357 2025-08-05 cs.SE 85%

HyClone: Bridging LLM Understanding and Dynamic Execution for Semantic Code Clone Detection

Yunhao Liang, Ruixuan Ying, Takuya Taniguchi, Guwen Lyu, Zhe Cui

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01008 2025-08-05 cs.CV 85%

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation

Cihang Peng, Qiming Hou, Zhong Ren, Kun Zhou

机构 * State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01556 2025-08-05 cs.AI 83%

Empowering Tabular Data Preparation with Language Models: Why and How?

Mengshi Chen, Yuxiang Sun, Tengchao Li, Jianwei Wang, Kai Wang, Xuemin Lin, Ying Zhang, Wenjie Zhang

机构 * Antai College of Economics and Management, Shanghai Jiao Tong University(上海交通大学安泰经济管理学院) The University of New South Wales(新南威尔士大学) Zhejiang Gongshang University(浙江工商大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

Comments Preprint under submission, 16 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11715 2025-08-05 cs.HC 82%

ConflictLens: LLM-Based Conflict Resolution Training in Romantic Relationship

Jiwon Chun, Gefei Zhang, Meng Xia

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

Comments 2 figures. To appear in a poster at ACM UIST 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04133 2025-08-05 cs.LG cs.AI eess.SP 81%

An Electrocardiogram Foundation Model Built on over 10 Million Recordings with External Evaluation across Multiple Domains

Jun Li, Aaron Aguirre, Junior Moura, Che Liu, Lanhai Zhong, Chenxi Sun, Gari Clifford, Brandon Westover, Shenda Hong

机构 * National Institute of Health Data Science, Peking University(北京大学国家健康数据科学研究院) Department of Cardiology, Massachusetts General Hospital(麻省总医院心内科) Department of Biomedical Informatics, School of Medicine, Emory University(埃默里大学医学院生物医学信息学系) Department of Biomedical Engineering, Georgia Institute of Technology(佐治亚理工学院生物医学工程系) Harvard Medical School(哈佛医学院) Department of Neurology, Beth Israel Deaconess Medical Center(贝斯以色列医疗中心神经科) Department of Computing, Data Science Institute, Imperial College London(伦敦帝国学院计算系、数据科学研究所) Zhongshan School of Medicine, Sun Yat-sen University(中山医学院,孙逸仙大学) Institute of Medical Technology, Peking University Health Science Center(北京大学医学技术研究所,北京大学医学部) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

Comments Code: https://github.com/PKUDigitalHealth/ECGFounder

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02018 2025-08-05 cs.CL cs.AI 81%

SpeechR: A Benchmark for Speech Reasoning in Large Audio-Language Models

Wanqi Yang, Yanda Li, Yunchao Wei, Meng Fang, Ling Chen

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00858 2025-08-05 cs.LG cs.AI cs.SE 81%

Deploying Geospatial Foundation Models in the Real World: Lessons from WorldCereal

Christina Butsko, Kristof Van Tricht, Gabriel Tseng, Giorgia Milli, David Rolnick, Ruben Cartuyvels, Inbal Becker Reshef, Zoltan Szantoi, Hannah Kerner

机构 * Mila -- Quebec AI Institute, Canada(魁北克人工智能研究所) McGill University, Canada(麦吉尔大学) University of Strasbourg, France(斯特拉斯堡大学) Arizona State University, United States of America(亚利桑那州立大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07927 2025-08-05 cs.LG cs.AI cs.CL cs.CR 80%

Gandalf the Red: Adaptive Security for LLMs

Niklas Pfister, Václav Volhejn, Manuel Knott, Santiago Arias, Julia Bazińska, Mykhailo Bichurin, Alan Commike, Janet Darling, Peter Dienes, Matthew Fiedler, David Haber, Matthias Kraft, Marco Lancini, Max Mathys, Damián Pascual-Ortiz, Jakub Podolak, Adrià Romero-López, Kyriacos Shiarlis, Andreas Signer, Zsolt Terek, Athanasios Theocharis, Daniel Timbrell, Samuel Trautwein, Samuel Watts, Yun-Han Wu, Mateo Rojas-Carulla

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Niklas Pfister, Václav Volhejn and Manuel Knott contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00889 2025-08-05 cs.CL cs.AI cs.LG 80%

FECT: Factuality Evaluation of Interpretive AI-Generated Claims in Contact Center Conversation Transcripts

Hagyeong Shin, Binoy Robin Dalal, Iwona Bialynicka-Birula, Navjot Matharu, Ryan Muir, Xingwei Yang, Samuel W. K. Wong

机构 * Cresta, University of Waterloo(Cresta,滑铁卢大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted for an oral presentation at Agentic & GenAI Evaluation KDD 2025: KDD workshop on Evaluation and Trustworthiness of Agentic and Generative AI Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04322 2025-08-05 cs.LG cs.AI cs.CL cs.CY 80%

Speak Easy: Eliciting Harmful Jailbreaks from LLMs with Simple Interactions

Yik Siu Chan, Narutatsu Ri, Yuxin Xiao, Marzyeh Ghassemi

机构 * Brown University(布朗大学) Columbia University(哥伦比亚大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01691 2025-08-05 cs.SD cs.CL eess.AS 79%

Voxlect: A Speech Foundation Model Benchmark for Modeling Dialects and Regional Languages Around the Globe

Tiantian Feng, Kevin Huang, Anfeng Xu, Xuan Shi, Thanathai Lertpetchpun, Jihwan Lee, Yoonjeong Lee, Dani Byrd, Shrikanth Narayanan

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18214 2025-08-05 cs.RO cs.AI 79%

LA-RCS: LLM-Agent-Based Robot Control System

TaekHyun Park, YoungJun Choi, SeungHoon Shin, Kwangil Lee

机构 * Pusan National University(釜山国立大学) National Korea Maritime & Ocean University(韩国海洋与海洋大学) Republic of Korea Navy(韩国海军)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

Journal ref Senors and Materials 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01387 2025-08-05 cs.CV cs.AI 79%

Video-based Vehicle Surveillance in the Wild: License Plate, Make, and Model Recognition with Self Reflective Vision-Language Models

Pouya Parsa, Keya Li, Kara M. Kockelman, Seongjin Choi

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

Comments 19 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01324 2025-08-05 cs.AI 79%

Towards Evaluation for Real-World LLM Unlearning

Ke Miao, Yuke Hu, Xiaochen Li, Wenjie Bao, Zhihao Liu, Zhan Qin, Kui Ren

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17075 2025-08-05 cs.CL cs.CY 79%

Agree to Disagree? A Meta-Evaluation of LLM Misgendering

Arjun Subramonian, Vagrant Gautam, Preethi Seshadri, Dietrich Klakow, Kai-Wei Chang, Yizhou Sun

机构 * UCLA(加州大学洛杉矶分校) Saarland University(萨尔兰大学) UC Irvine(加州大学 Irvine 分校)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16172 2025-08-05 cs.AI cs.CL cs.HC cs.SE 79%

LABIIUM: AI-Enhanced Zero-configuration Measurement Automation System

Emmanuel A. Olowe, Danial Chitnis

机构 * School of Engineering The University of Edinburgh Edinburgh, UK(工程学院 埃迪逊大学 英国爱丁堡)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments accepted for IEEE I2MTC 2025

Journal ref 2025 IEEE International Instrumentation and Measurement Technology Conference (I2MTC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12806 2025-08-05 cs.AI cs.CL 79%

MCPEval: Automatic MCP-based Deep Evaluation for AI Agent Models

Zhiwei Liu, Jielin Qiu, Shiyu Wang, Jianguo Zhang, Zuxin Liu, Roshan Ram, Haolin Chen, Weiran Yao, Shelby Heinecke, Silvio Savarese, Huan Wang, Caiming Xiong

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments https://github.com/SalesforceAIResearch/MCPEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02047 2025-08-05 cs.CV 78%

Mapillary Vistas Validation for Fine-Grained Traffic Signs: A Benchmark Revealing Vision-Language Model Limitations

Sparsh Garg, Abhishek Aich

机构 * NEC Laboratories, America(美国 NEC 实验室)

专题命中 评测与基准 :language model(title,abstract)

Comments Accepted to ICCV 2025 Workshop (4th DataCV Workshop and Challenge)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01408 2025-08-05 cs.CY 78%

Artificial Intelligence and Misinformation in Art: Can Vision Language Models Judge the Hand or the Machine Behind the Canvas?

Tarian Fu, Javier Conde, Gonzalo Martínez, Pedro Reviriego, Elena Merino-Gómez, Fernando Moral

专题命中 评测与基准 :language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02452 2025-08-05 cs.CL 77%

LatentPrompt: Optimizing Promts in Latent Space

Mateusz Bystroński, Grzegorz Piotrowski, Nitesh V. Chawla, Tomasz Kajdanowicz

机构 * Wrocław University of Science and Technology(沃拉什大学科学与技术学院) University of Notre Dame(诺特大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02121 2025-08-05 cs.AI cs.MA 77%

A Survey on AgentOps: Categorization, Challenges, and Future Directions

Zexin Wang, Jingjing Li, Quan Zhou, Haotian Si, Yuanhao Liu, Jianhui Li, Gaogang Xie, Fei Sun, Dan Pei, Changhua Pei

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01680 2025-08-05 cs.AI 77%

T-GRAG: A Dynamic GraphRAG Framework for Resolving Temporal Conflicts and Redundancy in Knowledge Retrieval

Dong Li, Yichen Niu, Ying Ai, Xiang Zou, Biqing Qi, Jianxing Liu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏