arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-07-30 至 2025-07-30 共收录 39 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 39 篇

2408.11557 2025-07-30 cs.IR 89%

Enhancing Spectral Knowledge Interrogation: A Reliable Retrieval-Augmented Generative Framework on Large Language Models

Jiheng Liang, Zujie Xie, Ziru Yu, Xiangyang Yu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 16 pages,10 figures,3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21773 2025-07-30 cs.CL 88%

AgriEval: A Comprehensive Chinese Agricultural Benchmark for Large Language Models

Lian Yan, Haotian Wang, Chen Tang, Haifeng Liu, Tianyang Sun, Liangliang Liu, Yi Guan, Jingchi Jiang

机构 * Harbin Institute of Technology(哈尔滨工业大学) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)技术有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 36 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21133 2025-07-30 cs.CR cs.AI 88%

Analysis of Threat-Based Manipulation in Large Language Models: A Dual Perspective on Vulnerabilities and Performance Enhancement Opportunities

Atil Samancioglu

机构 * Atil Samancioglu(独立研究者)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21285 2025-07-30 cs.AI 87%

Curiosity by Design: An LLM-based Coding Assistant Asking Clarification Questions

Harsh Darji, Thibaud Lutellier

机构 * University of Alberta(阿尔伯塔大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21132 2025-07-30 cs.AI cs.CY cs.LG 86%

Can You Trust an LLM with Your Life-Changing Decision? An Investigation into AI High-Stakes Responses

Joshua Adrian Cahyono, Saran Subramanian

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21125 2025-07-30 cs.IR cs.AI cs.LG cs.SY eess.SY 86%

RATE: An LLM-Powered Retrieval Augmented Generation Technology-Extraction Pipeline

Karan Mirhosseini, Arya Aftab, Alireza Sheikh

机构 * Dept. of Management, Science and Technology(管理、科学与技术系) Amirkabir University of Technology(阿姆尔卡比尔科技大学) Dept. of Electrical Engineering(电气工程系) Sharif University of Technology(沙里夫科技大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 9 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21974 2025-07-30 cs.AI cs.NI 85%

Reasoning Language Models for Root Cause Analysis in 5G Wireless Networks

Mohamed Sana, Nicola Piovesan, Antonio De Domenico, Yibin Kang, Haozhe Zhang, Merouane Debbah, Fadhel Ayed

机构 * Huawei, France(华为,法国)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21113 2025-07-30 cs.CR 85%

Vulnerability Mitigation System (VMS): LLM Agent and Evaluation Framework for Autonomous Penetration Testing

Farzana Abdulzada

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21389 2025-07-30 cs.AI cs.CL 84%

Teaching Language Models To Gather Information Proactively

Tenghao Huang, Sihao Chen, Muhao Chen, Jonathan May, Longqi Yang, Mengting Wan, Pei Zhou

机构 * University of Southern California(南加州大学) Microsoft Corporation(微软公司) University of California, Davis(加州大学戴维斯分校)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21485 2025-07-30 cs.SE cs.AI 83%

HLSDebugger: Identification and Correction of Logic Bugs in HLS Code with LLM Solutions

Jing Wang, Shang Liu, Yao Lu, Zhiyao Xie

机构 * Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

Comments This work has been accepted at ICCAD 2025 (International Conference on Computer-Aided Design)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21969 2025-07-30 cs.MA 82%

Towards Cognitive Synergy in LLM-Based Multi-Agent Systems: Integrating Theory of Mind and Critical Evaluation

Adam Kostka, Jarosław A. Chudziak

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

Comments Accepted at CogSci 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22053 2025-07-30 cs.LG cs.AI 81%

Foundation Models for Demand Forecasting via Dual-Strategy Ensembling

Wei Yang, Defu Cao, Yan Liu

机构 * University of Southern California(南加州大学) AWS Supply Chain(AWS供应链)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21504 2025-07-30 cs.LG cs.AI 81%

Evaluation and Benchmarking of LLM Agents: A Survey

Mahmoud Mohammadi, Yipeng Li, Jane Lo, Wendy Yip

机构 * SAP Labs(SAP实验室)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21287 2025-07-30 cs.AI 79%

Structured Relevance Assessment for Robust Retrieval-Augmented Language Models

Aryan Raj, Astitva Veer Garg, Anitha D

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

Comments International Conference on ICT for Sustainable Development (ICT4SD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21340 2025-07-30 cs.CL cs.AI cs.DB cs.IR 79%

StructText: A Synthetic Table-to-Text Approach for Benchmark Generation with Multi-Dimensional Evaluation

Satyananda Kashyap, Sola Shirai, Nandana Mihindukulasooriya, Horst Samulowitz

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Data available: https://huggingface.co/datasets/ibm-research/struct-text and code available at: https://github.com/ibm/struct-text

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22024 2025-07-30 eess.IV cs.CV 78%

Cardiac-CLIP: A Vision-Language Foundation Model for 3D Cardiac CT Images

Yutao Hu, Ying Zheng, Shumei Miao, Xiaolei Zhang, Jiahao Xia, Yaolei Qi, Yiyang Zhang, Yuting He, Qian Chen, Jing Ye, Hongyan Qiao, Xiuhua Hu, Lei Xu, Jiayin Zhang, Hui Liu, Minwen Zheng, Yining Wang, Daimin Zhang, Ji Zhang, Wenqi Shao, Yun Liu, Longjiang Zhang, Guanyu Yang

专题命中 评测与基准 :foundation model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21507 2025-07-30 cs.CV cs.MM 78%

VAGU & GtS: LLM-Based Benchmark and Framework for Joint Video Anomaly Grounding and Understanding

Shibo Gao, Peipei Yang, Yangyang Liu, Yi Chen, Han Zhu, Xuyao Zhang, Linlin Huang

机构 * Beijing Jiaotong University(北京交通大学) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 评测与基准 :LLM(title,abstract)

Comments 21 pages, 19 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21335 2025-07-30 cs.CV 78%

Analyzing the Sensitivity of Vision Language Models in Visual Question Answering

Monika Shah, Sudarshan Balaji, Somdeb Sarkhel, Sanorita Dey, Deepak Venugopal

机构 * University of Memphis, TN, USA(密苏里大学) Adobe Research, San Jose, CA, USA(Adobe研究院) University of Maryland Baltimore County, USA(马里兰大学巴尔的摩县分校)

专题命中 评测与基准 :language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21297 2025-07-30 cond-mat.mtrl-sci 78%

Heterogeneous Ensemble Enables a Universal Uncertainty Metric for Atomistic Foundation Models

Kai Liu, Zixiong Wei, Wei Gao, Poulumi Dey, Marcel H. F. Sluiter, Fei Shuang

专题命中 评测与基准 :foundation model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20726 2025-07-30 cs.RO 78%

ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making

Liu Dai, Haina Wang, Weikang Wan, Hao Su

专题命中 评测与基准 :language agent(title);language model(abstract)

Comments Project Website: https://manitaskgen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21871 2025-07-30 q-bio.NC cs.LG 77%

Representations in vision and language converge in a shared, multidimensional space of perceived similarities

Katerina Marie Simkova, Adrien Doerig, Clayton Hickey, Ian Charest

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments 51 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21815 2025-07-30 cs.CL cs.CY 77%

HRIPBench: Benchmarking LLMs in Harm Reduction Information Provision to Support People Who Use Drugs

Kaixuan Wang, Chenxin Diao, Jason T. Jacques, Zhongliang Guo, Shuai Zhao

机构 * University of St. Andrews(圣安德鲁大学) University of Edinburgh(爱丁堡大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 15 pages, 5 figures, 12 tables, a dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21782 2025-07-30 cs.CL 77%

The Problem with Safety Classification is not just the Models

Sowmya Vajjala

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Pre-print, Short paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21193 2025-07-30 cs.CR cs.LG 77%

Interpretable Anomaly-Based DDoS Detection in AI-RAN with XAI and LLMs

Sotiris Chatzimiltis, Mohammad Shojafar, Mahdi Boloursaz Mashhadi, Rahim Tafazolli

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21130 2025-07-30 cs.AI 77%

INTEGRALBENCH: Benchmarking LLMs with Definite Integral Problems

Bintao Tang, Xin Yang, Yuhao Wang, Zixuan Qiu, Zimo Ji, Wenyuan Jiang

机构 * School of Software Engineering, Tongji University, Shanghai, China(同济大学软件工程学院) Polytechnic Institute, Zhejiang University, Zhejiang, China(浙江大学 polytechnic 院) ETH Zurich, Zurich, Switzerland(苏黎世联邦理工学院) Department of Computer Science(计算机科学系) Engineering, Hong Kong University of Science(科学大学工程学院) School of Mathematics(数学学院) Physics, Xi’an Jiaotong Liverpool University, Suzhou, China(西安交通大学利物浦大学物理学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 19 pages, 5 figures

Journal ref 2nd AI for Math Workshop @ ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22034 2025-07-30 cs.AI cs.CL cs.LG 75%

UserBench: An Interactive Gym Environment for User-Centric Agents

Cheng Qian, Zuxin Liu, Akshara Prabhakar, Zhiwei Liu, Jianguo Zhang, Haolin Chen, Heng Ji, Weiran Yao, Shelby Heinecke, Silvio Savarese, Caiming Xiong, Huan Wang

机构 * Salesforce AI Research(Salesforce AI研究部) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 25 Pages, 17 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21649 2025-07-30 cs.CV 75%

The Evolution of Video Anomaly Detection: A Unified Framework from DNN to MLLM

Shibo Gao, Peipei Yang, Haiyang Guo, Yangyang Liu, Yi Chen, Shuai Li, Han Zhu, Jian Xu, Xu-Yao Zhang, Linlin Huang

机构 * Beijing Jiaotong University(北京交通大学) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21500 2025-07-30 cs.CL cs.AI 73%

VN-MTEB: Vietnamese Massive Text Embedding Benchmark

Loc Pham, Tung Luu, Thu Vo, Minh Nguyen, Viet Hoang

机构 * GreenNode AI, Singapore(新加坡GreenNode AI) School of Electrical Engineering, International University, VNU-HCMC, Vietnam(越南国际大学电气工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 19 pages (including reference, appendix) 41 datasets from 6 tasks (retrieval, classification, pair-classification, clustering, rerank, sts) 7 figures, 16 tables, benchmark 18 text embedding models

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21753 2025-07-30 cs.AI stat.AP 72%

Towards a rigorous evaluation of RAG systems: the challenge of due diligence

Grégoire Martinon, Alexandra Lorenzo de Brionne, Jérôme Bohard, Antoine Lojou, Damien Hervault, Nicolas J-B. Brunel

专题命中 评测与基准 :LLM(abstract,comments);language model(abstract);分类 cs.AI

Comments in French language. EvalLLM2025: Workshop on Evaluation Generative Models (LLM) and Challenges, AMIAD, 2025, Marseille, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21963 2025-07-30 cs.LG 70%

SLA-Centric Automated Algorithm Selection Framework for Cloud Environments

Siana Rizwan, Tasnim Ahmed, Salimur Choudhury

机构 * School of Computing Queen's University(计算学院皇后大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏