arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-21 至 2025-10-21 共收录 356 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 74 篇

2510.16567 2025-10-21 cs.CL cs.SD eess.AS 74%

Hallucination Benchmark for Speech Foundation Models

Alkis Koudounas, Moreno La Quatra, Manuel Giollo, Sabato Marco Siniscalchi, Elena Baralis

机构 * Politecnico di Torino(都灵理工学院) Kore University of Enna(恩纳大学) Amazon AGI(亚马逊人工智能实验室) Università degli Studi di Palermo(巴勒莫大学)

专题命中 评测与基准 :foundation model(title);分类 cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16783 2025-10-21 cs.CL cs.AI 73%

LC-Eval: A Bilingual Multi-Task Evaluation Benchmark for Long-Context Understanding

Sheikh Jubair, Arwa Omayrah, Amal Alshammari, Alhanoof Althnian, Abdulhamed Alothaimen, Norah A. Alzahrani, Shahad D. Alzaidi, Nora Al-Twairesh, Abdulmohsen Al-Thubaity

机构 * HUMAIN Saudi Data and AI Authority(沙特数据与人工智能管理局) King Saud University(沙特国王大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 1 figure, 15 tables, 10 main pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16547 2025-10-21 cs.LG cs.AI 73%

Predicting life satisfaction using machine learning and explainable AI

Alif Elham Khan, Mohammad Junayed Hasan, Humayra Anjum, Nabeel Mohammed, Sifat Momen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Journal ref Heliyon, Volume 10, Issue 10, e31158 (May 30, 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06073 2025-10-21 cs.CL cs.AI cs.CV 73%

GEM: Empowering MLLM for Grounded ECG Understanding with Time Series and Images

Xiang Lan, Feng Wu, Kai He, Qinghao Zhao, Shenda Hong, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) Peking University People’s Hospital(北京大学人民医院) Peking University(北京大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2025 Camera-Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18256 2025-10-21 cs.CV 71%

SSL4Eco: A Global Seasonal Dataset for Geospatial Foundation Models in Ecology

Elena Plekhanova, Damien Robert, Johannes Dollinger, Emilia Arens, Philipp Brun, Jan Dirk Wegner, Niklaus Zimmermann

专题命中 评测与基准 :foundation model(title)

Comments CVPR 2025, EarthVision workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17764 2025-10-21 cs.CL 70%

Evaluating Medical LLMs by Levels of Autonomy: A Survey Moving from Benchmarks to Applications

Xiao Ye, Jacob Dineen, Zhaonan Li, Zhikun Xu, Weiyu Chen, Shijie Lu, Yuxi Huang, Ming Shen, Phu Tran, Ji-Eun Irene Yum, Muhammad Ali Khan, Muhammad Umar Afzal, Irbaz Bin Riaz, Ben Zhou

机构 * Arizona State University(亚利桑那州立大学) Mayo Clinic(梅奥诊所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17163 2025-10-21 cs.SE cs.AI 70%

TREAT: A Code LLMs Trustworthiness / Reliability Evaluation and Testing Framework

Shuzheng Gao, Eric John Li, Man Ho Lam, Jingyu Xiao, Yuxuan Wan, Chaozheng Wang, Ng Man Tik, Michael R. Lyu

机构 * ARISE Lab, Department of Computer Science and Engineering(ARISE实验室,计算机科学与工程系)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04303 2025-10-21 cs.MA cs.AI 70%

Audit the Whisper: Detecting Steganographic Collusion in Multi-Agent LLMs

Om Tailor

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 13 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12713 2025-10-21 cs.SE cs.CL 70%

Humanity's Last Code Exam: Can Advanced LLMs Conquer Human's Hardest Code Competition?

Xiangyang Li, Xiaopeng Li, Kuicai Dong, Quanhu Zhang, Rongju Ruan, Xinyi Dai, Xiaoshuang Liu, Shengchun Xu, Yasheng Wang, Ruiming Tang

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10908 2025-10-21 stat.ML cs.LG 70%

Probably Approximately Correct Labels

Emmanuel J. Candès, Andrew Ilyas, Tijana Zrnic

机构 * Department of Statistics(统计学系) Department of Mathematics(数学系) Stanford Data Science(斯坦福数据科学) Stanford University(斯坦福大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10833 2025-10-21 cs.LG 70%

MergeBench: A Benchmark for Merging Domain-Specialized LLMs

Yifei He, Siqi Zeng, Yuzheng Hu, Rui Yang, Tong Zhang, Han Zhao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.LG

Comments NeurIPS 2025 Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20931 2025-10-21 cs.CL 70%

Automated Evaluation of Meter and Rhyme in Russian Generative and Human-Authored Poetry

Ilya Koziev

机构 * Ilya Koziev(独立研究者)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 7 pages, 1 figure, ver.2

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17332 2025-10-21 cs.CV 67%

iDETEX: Empowering MLLMs for Intelligent DETailed EXplainable IQA

Zhaoran Zhao, Xinli Yue, Jianhui Sun, Yuhao Xie, Tao Shao, Liangchao Yao, Fan Xia, Yuetang Deng

机构 * Tencent, WeChat(腾讯,微信)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments Accepted to ICCV 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15660 2025-10-21 cs.RO cs.CV 67%

Exploring the Limits of Vision-Language-Action Manipulations in Cross-task Generalization

Jiaming Zhou, Ke Ye, Jiayi Liu, Teli Ma, Zifan Wang, Ronghe Qiu, Kun-Yu Lin, Zhilin Zhao, Junwei Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The University of Hong Kong(香港大学) Sun Yat-sen University(中山大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments Project Page: https://jiaming-zhou.github.io/AGNOSTOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16829 2025-10-21 cs.CL cs.AI cs.CY cs.HC 62%

Who's Asking? Simulating Role-Based Questions for Conversational AI Evaluation

Navreet Kaur, Hoda Ayad, Hayoung Jung, Shravika Mittal, Munmun De Choudhury, Tanushree Mitra

机构 * University of Washington(华盛顿大学) Princeton University(普林斯顿大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18196 2025-10-21 cs.CL cs.LG 62%

Auto-Prompt Generation is Not Robust: Prompt Optimization Driven by Pseudo Gradient

Zeru Shi, Zhenting Wang, Yongye Su, Weidi Luo, Hang Gao, Fan Yang, Ruixiang Tang, Yongfeng Zhang

机构 * Rutgers University(罗格斯大学) Purdue University(普渡大学) Georgia University(佐治亚大学) Wake Forest University(威克森林大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16017 2025-10-21 cs.CV cs.AI cs.CL cs.RO 62%

InfraGPT Smart Infrastructure: An End-to-End VLM-Based Framework for Detecting and Managing Urban Defects

Ibrahim Sheikh Mohamed, Abdullah Yahya Abdullah Omaisan

机构 * Independent Researchers(独立研究者)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16198 2025-10-21 cs.CL 57%

EgMM-Corpus: A Multimodal Vision-Language Dataset for Egyptian Culture

Mohamed Gamil, Abdelrahman Elsayed, Abdelrahman Lila, Ahmed Gad, Hesham Abdelgawad, Mohamed Aref, Ahmed Fares

机构 * Department of Electrical Engineering, Faculty of Engineering at Shoubra, Benha University, Cairo 11629, Egypt(电气工程系,谢布拉工程学院,本海大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05830 2025-10-21 cs.CL cs.CY 57%

"Mirror" Language AI Models of Depression are Criterion-Contaminated

Tong Li, Rasiq Hussain, Mehak Gupta, Joshua R. Oltmanns

专题命中 评测与基准 :language model(abstract);分类 cs.CL

Comments 38 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17409 2025-10-21 cs.CV 50%

Monitoring Horses in Stalls: From Object to Event Detection

Dmitrii Galimzianov, Viacheslav Vyshegorodtsev, Ivan Nezhivykh

专题命中 评测与基准 :foundation model(abstract)

Comments 12 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12668 2025-10-21 cs.SE 50%

Decompile-Bench: Million-Scale Binary-Source Function Pairs for Real-World Binary Decompilation

Hanzhuo Tan, Xiaolong Tian, Hanrui Qi, Jiaming Liu, Zuchen Gao, Siyi Wang, Qi Luo, Jing Li, Yuqun Zhang

专题命中 评测与基准 :LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16597 2025-10-21 cs.IR 50%

FRONTIER-RevRec: A Large-scale Dataset for Reviewer Recommendation

Qiyao Peng, Chen Wang, Yinghui Wang, Hongtao Liu, Xuan Guo, Wenjun Wang

专题命中 评测与基准 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16500 2025-10-21 cs.RO 50%

Advancing Off-Road Autonomous Driving: The Large-Scale ORAD-3D Dataset and Comprehensive Benchmarks

Chen Min, Jilin Mei, Heng Zhai, Shuai Wang, Tong Sun, Fanjie Kong, Haoyang Li, Fangyuan Mao, Fuyang Liu, Shuo Wang, Yiming Nie, Qi Zhu, Liang Xiao, Dawei Zhao, Yu Hu

机构 * Research Center for Intelligent Computing Systems, SKLP, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China, 100190(中国科学院计算技术研究所,智能计算系统研究中心,SKLP,北京,中国,100190) Tongji University, Shanghai, China, 200092(同济大学,上海,中国,200092) Xi’an Jiaotong University, Shaanxi, China, 710049(西安交通大学,陕西,中国,710049) Nanchang University, Jiangxi, China, 330047(南昌大学,江西,中国,330047) Defense Innovation Institute, Beijing, China, 100073(国防科技创新院,北京,中国,100073)

专题命中 评测与基准 :language model(abstract)

Comments Off-road robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14697 2025-10-21 cs.CR cs.RO 50%

AGENTSAFE: Benchmarking the Safety of Embodied Agents on Hazardous Instructions

Zonghao Ying, Le Wang, Yisong Xiao, Jiakai Wang, Yuqing Ma, Jinyang Guo, Zhenfei Yin, Mingchuan Zhang, Aishan Liu, Xianglong Liu

机构 * SKLCCSE, Beihang University(北京航空航天大学智能科学与技术研究中心) Zhongguancun Laboratory(中关村实验室) The University of Sydney(悉尼大学) Henan University of Science(河南科技大学)

专题命中 评测与基准 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 58 篇

2505.21077 2025-10-21 cs.LG cs.AI 90%

Efficient Large Language Model Inference with Neural Block Linearization

Mete Erdogan, Francesco Tonin, Volkan Cevher

机构 * Laboratory for Information and Inference Systems(信息与推断系统实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17147 2025-10-21 cs.NI 89%

Mamba4Net: Distilled Hybrid Mamba Large Language Models For Networking

Linhan Xia, Mingzhan Yang, Jingjing Wang, Ziwei Yan, Yakun Ren, Guo Yu, Kai Lei

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17705 2025-10-21 cs.AI cs.CL 88%

Contextual Attention Modulation: Towards Efficient Multi-Task Adaptation in Large Language Models

Dayan Pan, Zhaoyang Fu, Jingyuan Wang, Xiao Han, Yue Zhu, Xiangyu Zhao

机构 * SCSE, Beihang University(北京航空航天大学系统工程学院) ERC of ACAT, MOE(教育部人工智能教育联合体) City University of Hong Kong(香港城市大学) Huawei Technologies Ltd.(华为技术有限公司) Key Lab of DIM, MIIT(信息通信技术重点实验室) SEM, Beihang University(北京航空航天大学电子机械学院) Zhejiang University of Technology(浙江工业大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by CIKM' 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19505 2025-10-21 cs.CL 88%

AnTKV: Anchor Token-Aware Sub-Bit Vector Quantization for KV Cache in Large Language Models

Zeyu Li, Chuanfu Xiao, Yang Wang, Xiang Liu, Zhenheng Tang, Baotong Lu, Mao Yang, Xinyu Chen, Xiaowen Chu

机构 * DSA Thrust, The Hong Kong University of Science and Technology (Guangzhou)(DSA团队,香港科学与技术大学(广州)) School of Mathematics and Computational Science, Xiangtan University(数学与计算科学学院,湘潭大学) Microsoft(微软)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04762 2025-10-21 cs.IR cs.LG 88%

Efficient and Responsible Adaptation of Large Language Models for Robust and Equitable Top-k Recommendations

Kirandeep Kaur, Vinayak Gupta, Manya Chadha, Chirag Shah

机构 * University of Washington(华盛顿大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

Comments arXiv admin note: text overlap with arXiv:2405.00824

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10337 2025-10-21 cs.CV 88%

GeoCAD: Local Geometry-Controllable CAD Generation with Large Language Models

Zhanwei Zhang, Kaiyuan Liu, Junjie Liu, Wenxiao Wang, Binbin Lin, Liang Xie, Chen Shen, Deng Cai

机构 * State Key Lab of CAD&CG(CAD与计算机图形学国家重点实验室) Alibaba Cloud Computing(阿里云计算) Zhejiang University of Technology(浙江工业大学) School of Software Technology, Zhejiang University(浙江大学软件技术学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏