arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32413 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32413 篇

2504.02587 2025-04-07 cs.LG cs.CL cs.CV 86%

Rethinking RL Scaling for Vision Language Models: A Transparent, From-Scratch Framework and Comprehensive Evaluation Scheme

Yan Ma, Steffi Chern, Xuyang Shen, Yiran Zhong, Pengfei Liu

机构 * Shanghai Jiao Tong University (SJTU)(上海交通大学) Minimax Fudan University(复旦大学) SII Generative Artificial Intelligence Lab (GAIR)(生成式人工智能实验室(GAIR))

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);SFT(abstract);分类 cs.CL、cs.LG

Comments Code is public and available at: https://github.com/GAIR-NLP/MAYE

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01963 2025-04-04 cs.MA cs.AI cs.CL 86%

LLMs Working in Harmony: A Survey on the Technological Aspects of Building Effective LLM-Based Multi Agent Systems

R. M. Aratchige, W. M. K. S. Ilmini

机构 * General Sir John Kotelawala Defence University(科特拉瓦拉爵士国防大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00374 2025-04-02 cs.CL cs.AI 86%

When Persuasion Overrides Truth in Multi-Agent LLM Debates: Introducing a Confidence-Weighted Persuasion Override Rate (CW-POR)

Mahak Agarwal, Divyam Khanna

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01877 2025-03-28 cs.LG cs.AI 86%

Starjob: Dataset for LLM-Driven Job Shop Scheduling

Henrik Abgaryan, Tristan Cazenave, Ararat Harutyunyan

机构 * Université Paris Dauphine-PSL(巴黎多芬大学-PSL大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments arXiv admin note: substantial text overlap with arXiv:2408.06993

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00599 2025-03-26 cs.CV cs.AI cs.LG 86%

VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLM

Yuqian Yuan, Hang Zhang, Wentong Li, Zesen Cheng, Boqiang Zhang, Long Li, Xin Li, Deli Zhao, Wenqiao Zhang, Yueting Zhuang, Jianke Zhu, Lidong Bing

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) Shanda AI Research Institute(盛大多智研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 17 pages, 14 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17056 2025-03-26 cs.CL cs.LG 86%

The HalluRAG Dataset: Detecting Closed-Domain Hallucinations in RAG Applications Using an LLM's Internal States

Fabian Ridder, Malte Schilling

机构 * University of Münster(明斯特大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15524 2025-03-26 cs.CL cs.AI 86%

HREF: Human Response-Guided Evaluation of Instruction Following in Language Models

Xinxi Lyu, Yizhong Wang, Hannaneh Hajishirzi, Pradeep Dasigi

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17645 2025-03-25 cs.AI cs.LG 86%

A Modular Dataset to Demonstrate LLM Abstraction Capability

Adam Atanas, Kai Liu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 7 pages, 5 figures. Submitted to ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15837 2025-03-21 cs.CL cs.AI 86%

Fùxì: A Benchmark for Evaluating Language Models on Ancient Chinese Text Understanding and Generation

Shangqing Zhao, Yuhao Zhou, Yupei Ren, Zhe Chen, Chenghao Jia, Fang Zhe, Zhaogaung Long, Shu Liu, Man Lan

机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) Lab of Artificial Intelligence for Education, East China Normal University(华东师范大学教育人工智能实验室) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海教育人工智能研究院)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12651 2025-03-18 cs.AI cs.CL cs.HC 86%

VeriLA: A Human-Centered Evaluation Framework for Interpretable Verification of LLM Agent Failures

Yoo Yeon Sung, Hannah Kim, Dan Zhang

机构 * University of Maryland(马里兰大学) Megagon Labs(美加贡实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10757 2025-03-18 astro-ph.IM astro-ph.SR cs.CL cs.LG 86%

Deep Learning and LLM-based Methods Applied to Stellar Lightcurve Classification

Yu-Yang Li, Yu Bai, Cunshi Wang, Mengwei Qu, Ziteng Lu, Roberto Soria, Jifeng Liu

机构 * National Astronomical Observatories, Chinese Academy of Sciences(中国科学院国家天文台) University of Chinese Academy of Sciences(中国科学院大学) Beijing Normal University(北京师范大学) Guangzhou Institute of Geochemistry, Chinese Academy of Sciences(中国科学院广州地球化学研究所) INAF—Osservatorio Astrofisico di Torino(意大利国家天体物理研究所都灵天文台) The University of Sydney(悉尼大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 35 pages, 20 figures

Journal ref Intell Comput. 2025;4:0110

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11232 2025-03-17 cs.LG cs.CL 86%

PrivacyScalpel: Enhancing LLM Privacy via Interpretable Feature Intervention with Sparse Autoencoders

Ahmed Frikha, Muhammad Reza Ar Razi, Krishna Kanth Nakka, Ricardo Mendes, Xue Jiang, Xuebing Zhou

机构 * Huawei Munich Research Center(华为慕尼黑研究中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23746 2025-03-13 cs.CL cs.AI 86%

DetectRL: Benchmarking LLM-Generated Text Detection in Real-World Scenarios

Junchao Wu, Runzhe Zhan, Derek F. Wong, Shu Yang, Xinyi Yang, Yulin Yuan, Lidia S. Chao

机构 * University of Macau(澳门大学) NLP 2 CT Lab(NLP 2 CT实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to NeurIPS 2024 Datasets and Benchmarks Track (Camera-Ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08569 2025-03-12 cs.CL cs.LG 86%

DeepReview: Improving LLM-based Paper Review with Human-like Deep Thinking Process

Minjun Zhu, Yixuan Weng, Linyi Yang, Yue Zhang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08188 2025-03-12 cs.CL cs.AI 86%

RigoChat 2: an adapted language model to Spanish using a bounded dataset and reduced hardware

Gonzalo Santamaría Gómez, Guillem García Subies, Pablo Gutiérrez Ruiz, Mario González Valero, Natàlia Fuertes, Helena Montoro Zamorano, Carmen Muñoz Sanz, Leire Rosado Plaza, Nuria Aldama García, David Betancur Sánchez, Kateryna Sushkova, Marta Guerrero Nieto, Álvaro Barbero Jiménez

机构 * Instituto de Ingeniería del Conocimiento(知识工程研究所)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07833 2025-03-12 cs.CL cs.AI 86%

HalluVerse25: Fine-grained Multilingual Benchmark Dataset for LLM Hallucinations

Samir Abdaljalil, Hasan Kurban, Erchin Serpedin

机构 * Texas A&M University(德克萨斯农工大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04840 2025-03-10 cs.CL cs.AI cs.GT 86%

Framing the Game: How Context Shapes LLM Decision-Making

Isaac Robinson, John Burden

机构 * University of Oxford(牛津大学) University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12445 2025-03-05 cs.CL cs.AI 86%

Open Ko-LLM Leaderboard2: Bridging Foundational and Practical Evaluation for Korean LLMs

Hyeonwoo Kim, Dahyun Kim, Jihoo Kim, Sukyung Lee, Yungi Kim, Chanjun Park

机构 * Upstage AI Twelve Labs Liner Korea University(高丽大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL 2025 Industry

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03257 2025-03-05 cs.CL cs.AI 86%

Understanding LLM Development Through Longitudinal Study: Insights from the Open Ko-LLM Leaderboard

Chanjun Park, Hyeonwoo Kim

机构 * Korea University(高丽大学) Upstage AI(上stage人工智能公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL 2025 Industry

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09870 2025-03-03 cs.CL cs.AI 86%

ChroKnowledge: Unveiling Chronological Knowledge of Language Models in Multiple Domains

Yein Park, Chanwoong Yoon, Jungwoo Park, Donghyeon Lee, Minbyul Jeong, Jaewoo Kang

机构 * Korea University(高丽大学) Upstage AI AIGEN Sciences

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments ICLR 2025, 40 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20513 2025-03-03 cs.HC cs.AI cs.LG 86%

Personas Evolved: Designing Ethical LLM-Based Conversational Agent Personalities

Smit Desai, Mateusz Dubiel, Nima Zargham, Thomas Mildner, Laura Spillner

机构 * Northeastern University(东北大学) University of Luxembourg(卢森堡大学) University of Bremen(不来梅大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06172 2025-02-28 cs.AI cs.CL 86%

On Speeding Up Language Model Evaluation

Jin Peng Zhou, Christian K. Belardi, Ruihan Wu, Travis Zhang, Carla P. Gomes, Wen Sun, Kilian Q. Weinberger

机构 * Cornell University(康奈尔大学) University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19487 2025-02-26 cs.CL cs.LG 86%

HealthQ: Unveiling Questioning Capabilities of LLM Chains in Healthcare Conversations

Ziyu Wang, Hao Li, Di Huang, Hye-Sung Kim, Chae-Won Shin, Amir M. Rahmani

机构 * University of California, Irvine(加州大学欧文分校) Columbia University(哥伦比亚大学) Washington University in St. Louis(圣路易斯华盛顿大学) Kookmin University(国民大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10414 2025-02-25 cs.CR cs.CL cs.LG 86%

On Calibration of LLM-based Guard Models for Reliable Content Moderation

Hongfu Liu, Hengguan Huang, Xiangming Gu, Hao Wang, Ye Wang

机构 * National University of Singapore(新加坡国立大学) University of Copenhagen(哥本哈根大学) Rutgers University(罗格斯大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07276 2025-02-21 cs.AI cs.LG 86%

Bridging Smart Meter Gaps: A Benchmark of Statistical, Machine Learning and Time Series Foundation Models for Data Imputation

Amir Sartipi, Joaquín Delgado Fernández, Sergio Potenciano Menci, Alessio Magitteri

机构 * University of Luxembourg(卢森堡大学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13337 2025-02-20 cs.CL cs.AI 86%

Language Models are Few-Shot Graders

Chenyan Zhao, Mariana Silva, Seth Poulsen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Utah State University(犹他州立大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06647 2025-02-20 cs.SE cs.AI cs.LG 86%

How Efficient is LLM-Generated Code? A Rigorous & High-Standard Benchmark

Ruizhong Qiu, Weiliang Will Zeng, James Ezick, Christopher Lott, Hanghang Tong

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Qualcomm AI Research(高通人工智能研究部门)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18444 2025-02-19 cs.CL cs.AI 86%

Is my Meeting Summary Good? Estimating Quality with a Multi-LLM Evaluator

Frederic Kirstein, Terry Ruas, Bela Gipp

机构 * University of Göttingen(哥廷根大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Journal ref COLING 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08346 2025-02-18 cs.IR cs.AI cs.LG 86%

Graph Foundation Models for Recommendation: A Comprehensive Survey

Bin Wu, Yihang Wang, Yuanhao Zeng, Jiawei Liu, Jiashu Zhao, Cheng Yang, Yawen Li, Long Xia, Dawei Yin, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Baidu Inc.(百度公司) Wilfrid Laurier University(威尔弗里德劳里埃大学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08896 2025-02-14 cs.CL cs.AI 86%

Communication is All You Need: Persuasion Dataset Construction via Multi-LLM Communication

Weicheng Ma, Hefan Zhang, Ivory Yang, Shiyu Ji, Joice Chen, Farnoosh Hashemi, Shubham Mohole, Ethan Gearey, Michael Macy, Saeed Hassanpour, Soroush Vosoughi

机构 * Dartmouth College(达特茅斯学院) Cornell University(康奈尔大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏