arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-03 至 2025-11-03 共收录 32 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32 篇

2509.13145 2025-11-03 cs.SD 90%

UTI-LLM: A Personalized Articulatory-Speech Therapy Assistance System Based on Multimodal Large Language Model

Yudong Yang, Xiaokang Liu, Shaofeng zhao, Rongfeng Su, Nan Yan, Lan Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, China(深圳先进技术研究院,中国科学院,中国) Key Laboratory of Biomedical Imaging Science and System, Chinese Academy of Sciences, China(生物医学成像科学与系统重点实验室,中国科学院,中国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11373 2025-11-03 cs.CL cs.CY 90%

Cancer-Myth: Evaluating Large Language Models on Patient Questions with False Presuppositions

Wang Bill Zhu, Tianqi Chen, Xinyan Velocity Yu, Ching Ying Lin, Jade Law, Mazen Jizzini, Jorge J. Nieva, Ruishan Liu, Robin Jia

机构 * Department of Computer Science, USC(美国斯克里普斯大学计算机科学系) Keck School of Medicine, USC(美国斯克里普斯大学凯克医学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27267 2025-11-03 cs.CL cs.AI 88%

MedCalc-Eval and MedCalc-Env: Advancing Medical Calculation Capabilities of Large Language Models

Kangkun Mao, Jinru Ding, Jiayuan Chen, Mouxiao Bian, Ruiyao Chen, Xinwei Peng, Sijie Ren, Linyang Li, Jie Xu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27196 2025-11-03 cs.CL cs.AI 88%

MemeArena: Automating Context-Aware Unbiased Evaluation of Harmfulness Understanding for Multimodal Large Language Models

Zixin Chen, Hongzhan Lin, Kaixin Li, Ziyang Luo, Yayue Deng, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) Beijing University of Posts and Telecommunications(北京邮电大学) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25761 2025-11-03 cs.CL 85%

DiagramEval: Evaluating LLM-Generated Diagrams via Graphs

Chumeng Liang, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01070 2025-11-03 cs.LG 85%

Eliciting Secret Knowledge from Language Models

Bartosz Cywiński, Emil Ryd, Rowan Wang, Senthooran Rajamanoharan, Neel Nanda, Arthur Conmy, Samuel Marks

机构 * Warsaw University of Technology(华沙技术大学) IDEAS Research Institute(IDEAS研究机构) University of Oxford(牛津大学) Anthropic

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24046 2025-11-03 cs.MA cs.AI 85%

PartnerMAS: An LLM Hierarchical Multi-Agent Framework for Business Partner Selection on High-Dimensional Features

Lingyao Li, Haolun Wu, Zhenkun Li, Jiabei Hu, Yu Wang, Xiaoshan Huang, Wenyue Hua, Wenqian Wang

机构 * University of South Florida(佛罗里达州立大学) McGill University(麦吉尔大学) Purdue University(普渡大学) Lingnan University(岭大大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13178 2025-11-03 cs.CR cs.AI cs.RO 85%

SafeAgentBench: A Benchmark for Safe Task Planning of Embodied LLM Agents

Sheng Yin, Xianghe Pang, Yuanzhuo Ding, Menglan Chen, Yutong Bi, Yichen Xiong, Wenhao Huang, Zhen Xiang, Jing Shao, Siheng Chen

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Shanghai Jiao Tong University(上海交通大学) Department of Computer Science(计算机科学系) University of Georgia(佐治亚大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 28 pages, 19 tables, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02901 2025-11-03 cs.AI 85%

A Comprehensive Survey on Process-Oriented Automatic Text Summarization with Exploration of LLM-Based Methods

Yang Zhang, Hanlei Jin, Dan Meng, Jun Wang, Jinghua Tan

机构 * Southwestern University of Finance and Economics(西南财经大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27521 2025-11-03 cs.HC cs.CY 85%

Independent Clinical Evaluation of General-Purpose LLM Responses to Signals of Suicide Risk

Nick Judd, Alexandre Vaz, Kevin Paeth, Layla Inés Davis, Milena Esherick, Jason Brand, Inês Amaro, Tony Rousmaniere

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26941 2025-11-03 cs.CR cs.AI 83%

LLM-based Multi-class Attack Analysis and Mitigation Framework in IoT/IIoT Networks

Seif Ikbarieh, Maanak Gupta, Elmahedi Mahalal

机构 * Department of Computer Science Tennessee Tech University(计算机科学系田纳西科技大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26937 2025-11-03 cs.LG 83%

MM-OPERA: Benchmarking Open-ended Association Reasoning for Large Vision-Language Models

Zimeng Huang, Jinxin Ke, Xiaoxuan Fan, Yufeng Yang, Yang Liu, Liu Zhonghan, Zedi Wang, Junteng Dai, Haoyi Jiang, Yuyu Zhou, Keze Wang, Ziliang Chen

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Jinan University(暨南大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.LG

Comments NeurIPS 2025 Datasets and Benchmarks Track poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03419 2025-11-03 cs.CL 83%

Curse of Knowledge: When Complex Evaluation Context Benefits yet Biases LLM Judges

Weiyuan Li, Xintao Wang, Siyu Yuan, Rui Xu, Jiangjie Chen, Qingqing Dong, Yanghua Xiao, Deqing Yang

机构 * School of Data Science, Fudan University, 2 Shanghai Key Laboratory of Data Science 3 College of Computer Science and Artificial Intelligence, Fudan University 4 ByteDance Seed, 5 College of Cryptology and Cyber Science, Nankai University(1 数据科学学院,复旦大学 2 上海数据科学实验室 3 计算机科学与人工智能学院,复旦大学 4 字节跳动种子 5 密码学与网络科学学院,南开大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02854 2025-11-03 cs.CL cs.AI cs.LG 82%

(How) Do Language Models Track State?

Belinda Z. Li, Zifan Carl Guo, Jacob Andreas

机构 * MIT EECS(麻省理工学院电子工程与计算机科学系)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 21 pages, 17 figures, 1 table. Code: http://github.com/belindal/state-tracking

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27009 2025-11-03 cs.AI cs.LG stat.ML 81%

Causal Masking on Spatial Data: An Information-Theoretic Case for Learning Spatial Datasets with Unimodal Language Models

Jared Junkin, Samuel Nathanson

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Johns Hopkins University(约翰霍普金斯大学) Whiting School of Engineering(工程学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

Comments 8 pages, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27256 2025-11-03 cs.LG cs.HC 79%

ECVL-ROUTER: Scenario-Aware Routing for Vision-Language Models

Xin Tang, Youfang Han, Fangfei Gou, Wei Zhao, Xin Meng, Yang Yu, Jinguo Zhang, Yuanchun Shi, Yuntao Wang, Tengxiang Zhang

机构 * Tsinghua University(清华大学) Goertek Inc(歌尔股份有限公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

Comments 23 pages, 13 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08249 2025-11-03 cs.DB cs.CL 79%

RADAR: Benchmarking Language Models on Imperfect Tabular Data

Ken Gu, Zhihan Zhang, Kate Lin, Yuwei Zhang, Akshay Paruchuri, Hong Yu, Mehran Kazemi, Kumar Ayush, A. Ali Heydari, Maxwell A. Xu, Girish Narayanswamy, Yun Liu, Ming-Zher Poh, Yuzhe Yang, Mark Malhotra, Shwetak Patel, Hamid Palangi, Xuhai Xu, Daniel McDuff, Tim Althoff, Xin Liu

机构 * Google Research(谷歌研究) Google DeepMind(谷歌DeepMind) University of Washington(华盛顿大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments NeurIPS 2025 Dataset and Benchmark Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20538 2025-11-03 cs.CL astro-ph.IM cs.LG 79%

AstroVisBench: A Code Benchmark for Scientific Computing and Visualization in Astronomy

Sebastian Antony Joseph, Syed Murtaza Husain, Stella S. R. Offner, Stéphanie Juneau, Paul Torrey, Adam S. Bolton, Juan P. Farias, Niall Gaffney, Greg Durrett, Junyi Jessy Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) NSF National Optical-Infrared Astronomy Research Laboratory(国家光学红外天文研究实验室) University of Virginia(弗吉尼亚大学) SLAC National Accelerator Laboratory(斯坦福直线加速器实验室) Texas Advanced Computing Center(德克萨斯高级计算中心)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Accepted at NeurIPS 2025 Datasets & Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27610 2025-11-03 cs.LG 77%

ORGEval: Graph-Theoretic Evaluation of LLMs in Optimization Modeling

Zhuohan Wang, Ziwei Zhu, Ziniu Li, Congliang Chen, Yizhou Han, Yufeng Lin, Zhihang Lin, Angyang Gu, Xinglin Hu, Ruoyu Sun, Tian Ding

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Research Institute of Big Data(深圳大数据研究院) Shenzhen Loop Area Institute(深圳河套学院) Shenzhen International Center for Industrial and Applied Mathematics(深圳国际工业与应用数学中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27565 2025-11-03 cs.SE cs.AI cs.HC 77%

CodeAlignBench: Assessing Code Generation Models on Developer-Preferred Code Adjustments

Forough Mehralian, Ryan Shar, James R. Rae, Alireza Hashemi

机构 * Apple Inc.(苹果公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27164 2025-11-03 cs.CV cs.AI 77%

Generating Accurate and Detailed Captions for High-Resolution Images

Hankyeol Lee, Gawon Seo, Kyounggyu Lee, Dogun Kim, Kyungwoo Song, Jiyoung Jung

机构 * Department of Artificial Intelligence, University of Seoul(首尔大学人工智能系) Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系) Department of Applied Statistics, Yonsei University(延世大学应用统计系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Work conducted in 2024; released for archival purposes

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10484 2025-11-03 cs.CY cs.AI 77%

Bias in Decision-Making for AI's Ethical Dilemmas: A Comparative Study of ChatGPT and Claude

Wentao Xu, Yile Yan, Yuqi Zhu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments This paper has been accepted by The 20th International AAAI Conference on Web and Social Media (ICWSM 2026), sunny Los Angeles, California

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27119 2025-11-03 cs.DB 75%

Unstructured Data Analysis using LLMs: A Comprehensive Benchmark

Qiyan Deng, Jianhui Li, Chengliang Chai, Jinqi Liu, Junzhi She, Kaisen Jin, Zhaoze Sun, Yuhao Deng, Jia Yuan, Ye Yuan, Guoren Wang, Lei Cao

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27244 2025-11-03 cs.SE cs.AI 70%

Vintage Code, Modern Judges: Meta-Validation in Low Data Regimes

Ora Nova Fandina, Gal Amram, Eitan Farchi, Shmulik Froimovich, Raviv Gal, Wesam Ibraheem, Rami Katan, Alice Podolsky, Orna Raz

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16973 2025-11-03 cs.CL 70%

VeriFastScore: Speeding up long-form factuality evaluation

Rishanth Rajendhran, Amir Zadeh, Matthew Sarte, Chuan Li, Mohit Iyyer

机构 * University of Maryland, College Park(马里兰大学 College Park分校) Lambda Labs(Lambda实验室)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27350 2025-11-03 cs.CV 67%

RzenEmbed: Towards Comprehensive Multimodal Retrieval

Weijian Jian, Yajun Zhang, Dawei Liang, Chunyu Xie, Yixiao He, Dawei Leng, Yuhui Yin

机构 * AI Research(360人工智能研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27232 2025-11-03 cs.IR 67%

A Survey on Deep Text Hashing: Efficient Semantic Text Retrieval with Binary Representation

Liyang He, Zhenya Huang, Cheng Yang, Rui Li, Zheng Zhang, Kai Zhang, Zhi Li, Qi Liu, Enhong Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27063 2025-11-03 cs.LG cs.AI cs.CL cs.IT cs.SE math.IT 67%

Towards a Measure of Algorithm Similarity

Shairoz Sohail, Taher Ali

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 11 pages, many figures and images

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27038 2025-11-03 cs.CL cs.AI 62%

Dataset Creation and Baseline Models for Sexism Detection in Hausa

Fatima Adam Muhammad, Shamsuddeen Muhammad Hassan, Isa Inuwa-Dutse

机构 * Federal University Dutse(达图塞联邦大学) Imperial College London(伦敦帝国学院) University of Huddersfield(赫德舍菲尔德大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

Comments 9 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26616 2025-11-03 cs.LG cs.AI 62%

Aeolus: A Multi-structural Flight Delay Dataset

Lin Xu, Xinyun Yuan, Yuxuan Liang, Suwan Yin, Yuankai Wu

机构 * Sichuan University(四川大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏