arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32411 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32411 篇

2312.02073 2025-02-18 cs.CL cs.AI cs.LG 87%

A Glitch in the Matrix? Locating and Detecting Language Model Grounding with Fakepedia

Giovanni Monea, Maxime Peyrard, Martin Josifoski, Vishrav Chaudhary, Jason Eisner, Emre Kıcıman, Hamid Palangi, Barun Patra, Robert West

机构 * EPFL(洛桑联邦理工学院) Univ. Grenoble Alpes(格勒诺布尔大学) CNRS(法国国家科学研究中心) Grenoble INP(格勒诺布尔理工学院) LIG(信息与信号处理实验室) Microsoft Corporation(微软公司)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at ACL 2024 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18652 2025-02-13 cs.LG cs.AI cs.CL 87%

$C^2$: Scalable Auto-Feedback for LLM-based Chart Generation

Woosung Koh, Jang Han Yoon, MinHyung Lee, Youngjin Song, Jaegwan Cho, Jaehyun Kang, Taehyeon Kim, Se-Young Yun, Youngjae Yu, Bongshin Lee

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NAACL 2025 Main (Long)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04356 2025-02-10 cs.CL cs.AI cs.LG 87%

Open Foundation Models in Healthcare: Challenges, Paradoxes, and Opportunities with GenAI Driven Personalized Prescription

Mahdi Alkaeed, Sofiat Abioye, Adnan Qayyum, Yosra Magdi Mekki, Ilhem Berrou, Mohamad Abdallah, Ala Al-Fuqaha, Muhammad Bilal, Junaid Qadir

机构 * Qatar University(卡塔尔大学) Birmingham City University(伯明翰城市大学) Hamad Bin Khalifa University (HBKU)(哈马德·本·哈利法大学) University of the West of England (UWE)(西英格兰大学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02988 2025-02-06 cs.CL cs.AI cs.LG 87%

Training an LLM-as-a-Judge Model: Pipeline, Insights, and Practical Lessons

Renjun Hu, Yi Cheng, Libin Meng, Jiaxin Xia, Yi Zong, Xing Shi, Wei Lin

机构 * East China Normal University(华东师范大学) Alibaba Cloud Computing(阿里云) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments accepted at WWW'25 (Industrial Track), extended version

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00072 2025-02-04 cs.CR cs.AI cs.CL cs.LG 87%

LLM Cyber Evaluations Don't Capture Real-World Risk

Kamilė Lukošiūtė, Adam Swanda

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20864 2024-12-31 cs.CL cs.AI cs.LG 87%

Enhancing Annotated Bibliography Generation with LLM Ensembles

Sergio Bermejo

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13178 2024-12-25 cs.CL cs.AI cs.LG 87%

AgentBoard: An Analytical Evaluation Board of Multi-turn LLM Agents

Chang Ma, Junlei Zhang, Zhihao Zhu, Cheng Yang, Yujiu Yang, Yaohui Jin, Zhenzhong Lan, Lingpeng Kong, Junxian He

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16682 2024-12-24 cs.CR cs.AI cs.CL cs.LG 87%

The Task Shield: Enforcing Task Alignment to Defend Against Indirect Prompt Injection in LLM Agents

Feiran Jia, Tong Wu, Xin Qin, Anna Squicciarini

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11553 2024-12-12 cs.CL cs.AI cs.LG 87%

Language Ranker: A Metric for Quantifying LLM Performance Across High and Low-Resource Languages

Zihao Li, Yucheng Shi, Zirui Liu, Fan Yang, Ali Payani, Ninghao Liu, Mengnan Du

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by AAAI 2025 (Social Impact Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05357 2024-12-06 cs.LG cs.AI cs.CL 87%

Model-GLUE: Democratized LLM Scaling for A Large Model Zoo in the Wild

Xinyu Zhao, Guoheng Sun, Ruisi Cai, Yukun Zhou, Pingzhi Li, Peihao Wang, Bowen Tan, Yexiao He, Li Chen, Yi Liang, Beidi Chen, Binhang Yuan, Hongyi Wang, Ang Li, Zhangyang Wang, Tianlong Chen

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 24 pages, 4 figures, accepted to NeurIPS 2024 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04407 2024-11-26 cs.CL cs.AI cs.IR cs.LG 87%

Policy-Gradient Training of Language Models for Ranking

Ge Gao, Jonathan D. Chang, Claire Cardie, Kianté Brantley, Thorsten Joachim

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00331 2024-11-04 cs.IR 87%

Beyond Utility: Evaluating LLM as Recommender

Chumeng Jiang, Jiayin Wang, Weizhi Ma, Charles L. A. Clarke, Shuai Wang, Chuhan Wu, Min Zhang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13959 2024-11-04 cs.IR cs.AI cs.CL cs.LG 87%

FinQAPT: Empowering Financial Decisions with End-to-End LLM-driven Question Answering Pipeline

Kuldeep Singh, Simerjot Kaur, Charese Smiley

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted in ICAIF 2024, 8 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22517 2024-10-31 cs.CL cs.AI cs.LG 87%

Attention Speaks Volumes: Localizing and Mitigating Bias in Language Models

Rishabh Adiga, Besmira Nushi, Varun Chandrasekaran

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01489 2024-10-30 cs.SE cs.AI cs.CL cs.LG 87%

Agentless: Demystifying LLM-based Software Engineering Agents

Chunqiu Steven Xia, Yinlin Deng, Soren Dunn, Lingming Zhang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19317 2024-10-30 cs.LG cs.AI cs.CL 87%

Jump Starting Bandits with LLM-Generated Prior Knowledge

Parand A. Alamdari, Yanshuai Cao, Kevin H. Wilson

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09187 2024-10-28 cs.LG cs.AI cs.CL 87%

Automated Rewards via LLM-Generated Progress Functions

Vishnu Sarukkai, Brennan Shacklett, Zander Majercik, Kush Bhatia, Christopher Ré, Kayvon Fatahalian

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 26 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08928 2024-10-18 cs.CL cs.AI cs.LG 87%

Towards Multilingual LLM Evaluation for European Languages

Klaudia Thellmann, Bernhard Stadler, Michael Fromm, Jasper Schulze Buschhoff, Alex Jude, Fabio Barth, Johannes Leveling, Nicolas Flores-Herr, Joachim Köhler, René Jäkel, Mehdi Ali

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14463 2024-10-17 cs.CL cs.AI cs.LG 87%

ReadMe++: Benchmarking Multilingual Language Models for Multi-Domain Readability Assessment

Tarek Naous, Michael J. Ryan, Anton Lavrouk, Mohit Chandra, Wei Xu

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11143 2024-10-16 cs.CL cs.AI cs.LG 87%

LLM Unlearning via Loss Adjustment with Only Forget Data

Yaxuan Wang, Jiaheng Wei, Chris Yuhao Liu, Jinlong Pang, Quan Liu, Ankit Parag Shah, Yujia Bao, Yang Liu, Wei Wei

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06565 2024-10-15 cs.CL cs.AI cs.LG 87%

MixEval: Deriving Wisdom of the Crowd from LLM Benchmark Mixtures

Jinjie Ni, Fuzhao Xue, Xiang Yue, Yuntian Deng, Mahir Shah, Kabir Jain, Graham Neubig, Yang You

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00099 2024-10-08 cs.AI cs.CL cs.HC cs.LG 87%

Creative Beam Search: LLM-as-a-Judge For Improving Response Generation

Giorgio Franceschelli, Mirco Musolesi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Presented as a short paper at the 15th International Conference on Computational Creativity (ICCC'24)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03608 2024-10-07 cs.AI cs.CL cs.HC cs.LG 87%

TICKing All the Boxes: Generated Checklists Improve LLM Evaluation and Generation

Jonathan Cook, Tim Rocktäschel, Jakob Foerster, Dennis Aumiller, Alex Wang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03212 2024-10-07 cs.IR 87%

Data-Efficient Massive Tool Retrieval: A Reinforcement Learning Approach for Query-Tool Alignment with Language Models

Yuxiang Zhang, Xin Fan, Junjie Wang, Chongxian Chen, Fan Mo, Tetsuya Sakai, Hayato Yamana

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02406 2024-10-04 cs.HC 87%

ELLMA-T: an Embodied LLM-agent for Supporting English Language Learning in Social VR

Mengxu Pan, Alexandra Kitson, Hongyu Wan, Mirjana Prpa

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);language agent(abstract)

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14760 2024-10-03 cs.CL cs.AI cs.LG 87%

An LLM Feature-based Framework for Dialogue Constructiveness Assessment

Lexin Zhou, Youmna Farag, Andreas Vlachos

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Paper accepted by EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03291 2024-09-30 cs.CL cs.AI cs.CR cs.LG 87%

LLM Detectors Still Fall Short of Real World: Case of LLM-Generated Short News-Like Posts

Henrique Da Silva Gameiro, Andrei Kucharavy, Ljiljana Dolamic

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 20 pages, 7 tables, 13 figures, under consideration for EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20266 2024-09-23 cs.CL cs.AI cs.LG 87%

Latxa: An Open Language Model and Evaluation Suite for Basque

Julen Etxaniz, Oscar Sainz, Naiara Perez, Itziar Aldabe, German Rigau, Eneko Agirre, Aitor Ormazabal, Mikel Artetxe, Aitor Soroa

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2024

Journal ref Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 14952--14972. 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04900 2024-09-10 cs.CV 87%

HowToCaption: Prompting LLMs to Transform Video Annotations at Scale

Nina Shvetsova, Anna Kukleva, Xudong Hong, Christian Rupprecht, Bernt Schiele, Hilde Kuehne

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments https://github.com/ninatu/howtocaption

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11729 2024-09-04 cs.SE 87%

LLM4VV: Exploring LLM-as-a-Judge for Validation and Verification Testsuites

Zachariah Sollenberger, Jay Patel, Christian Munley, Aaron Jarmusch, Sunita Chandrasekaran

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏