arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-10 至 2025-10-10 共收录 247 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 66 篇

2507.19195 2025-10-10 cs.CL cs.AI cs.LG 91%

Can Small-Scale Data Poisoning Exacerbate Dialect-Linked Biases in Large Language Models?

Chaymaa Abbas, Mariette Awad, Razane Tajeddine

机构 * Department of Electrical and Computer Engineering, Maroun Semaan Faculty of Engineering and Architecture(电气与计算机工程系,马鲁恩·塞马安工程与建筑学院) American University of Beirut(贝鲁特美国大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11113 2025-10-10 cs.CL cs.AI 90%

Breaking the Reviewer: Assessing the Vulnerability of Large Language Models in Automated Peer Review Under Textual Adversarial Attacks

Tzu-Ling Lin, Wei-Chih Chen, Teng-Fang Hsiao, Hou-I Liu, Ya-Hsin Yeh, Yu Kai Chan, Wen-Sheng Lien, Po-Yen Kuo, Philip S. Yu, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Minor correction: Fixed sign errors in the results table. The update does not affect the main findings or conclusions

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00847 2025-10-10 cs.CL 89%

Argument Summarization and its Evaluation in the Era of Large Language Models

Moritz Altemeyer, Steffen Eger, Johannes Daxenberger, Yanran Chen, Tim Altendorf, Philipp Cimiano, Benjamin Schiller

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments EMNLP 2025 Main Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00269 2025-10-10 cs.LG cs.AI cs.CL cs.CY 89%

Reducing Large Language Model Safety Risks in Women's Health using Semantic Entropy

Jahan C. Penny-Dimri, Magdalena Bachmann, William R. Cooke, Sam Mathewlynn, Samuel Dockree, John Tolladay, Jannik Kossen, Lin Li, Yarin Gal, Gabriel Davis Jones

机构 * Oxford Digital Health Labs, Nuffield Department of Women’s and Reproductive Health(牛津数字健康实验室,女性与生殖健康系) University of Oxford(牛津大学) Oxford University Hospitals NHS Foundation Trust(牛津大学医院 NHS 基础信托) OATML, Department of Computer Science(OATML,计算机科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08043 2025-10-10 cs.CL cs.LG physics.ao-ph 88%

Climate Knowledge in Large Language Models

Ivan Kuznetsov, Jacopo Grassi, Dmitrii Pantiukhin, Boris Shapkin, Thomas Jung, Nikolay Koldunov

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments 16 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07706 2025-10-10 cs.CL cs.CE cs.LG q-bio.CB 88%

Large Language Models Meet Virtual Cell: A Survey

Krinos Li, Xianglu Xiao, Shenglong Deng, Lucas He, Zijun Zhong, Yuanjie Zou, Zhonghao Zhan, Zheng Hui, Weiye Bao, Guang Yang

机构 * Imperial College London(伦敦帝国理工学院) University College London(伦敦大学学院) New Jersey Institute of Technology(新泽西理工学院) University of Cambridge(剑桥大学) King’s College London(伦敦国王学院) Royal Brompton Hospital(皇家布隆特医院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19982 2025-10-10 cs.CL cs.LG 88%

Erasing Without Remembering: Implicit Knowledge Forgetting in Large Language Models

Huazheng Wang, Yongcheng Jing, Haifeng Sun, Yingjie Wang, Jingyu Wang, Jianxin Liao, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01444 2025-10-10 cs.CR cs.AI 88%

PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization

Aofan Liu, Lulu Tang, Ting Pan, Yuguo Yin, Bin Wang, Ao Yang

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments Accepted to IEEE International Conference on Multimedia and Expo (ICME) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07892 2025-10-10 cs.CL 86%

Metric Calculating Benchmark: Code-Verifiable Complicate Instruction Following Benchmark for Large Language Models

Hyeonseok Moon, Seongtae Hong, Jaehyung Seo, Heuiseok Lim

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

Comments Accepted to the EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07912 2025-10-10 cs.CL cs.AI 86%

Towards Human-Like Grading: A Unified LLM-Enhanced Framework for Subjective Question Evaluation

Fanwei Zhua, Jiaxuan He, Xiaoxiao Chen, Zulong Chen, Quan Lu, Chenrui Mei

机构 * Hangzhou City University(杭州市大学) Alibaba Group(阿里巴巴集团) Zhejiang Hospital(浙江省医院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07626 2025-10-10 cs.LG cs.CL 86%

LLM Unlearning Under the Microscope: A Full-Stack View on Methods and Metrics

Chongyu Fan, Changsheng Wang, Yancheng Huang, Soumyadeep Pal, Sijia Liu

机构 * Michigan State University(密歇根州立大学) IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07557 2025-10-10 cs.LG cs.AI cs.CY cs.HC 86%

Investigating Thematic Patterns and User Preferences in LLM Interactions using BERTopic

Abhay Bhandarkar, Gaurav Mishra, Khushi Juchani, Harsh Singhal

机构 * Ramaiah Institute of Technology(拉马亚院技术学院) Ecofy Finance Private Limited(Ecofy金融私人有限公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17694 2025-10-10 cs.CL cs.AI 86%

Evaluating LLM-Generated Versus Human-Authored Responses in Role-Play Dialogues

Dongxu Lu, Johan Jeuring, Albert Gatt

机构 * Utrecht University(乌得勒支大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted for publication at the 18th International Natural Language Generation Conference (INLG 2025). Revised version: improved image quality and minor corrections. No change to conclusions

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05220 2025-10-10 cs.IR cs.AI cs.CL 86%

Utility-Focused LLM Annotation for Retrieval and Retrieval-Augmented Generation

Hengran Zhang, Minghao Tang, Keping Bi, Jiafeng Guo, Shihao Liu, Daiting Shi, Dawei Yin, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室,计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Baidu Inc.(百度公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted by the EMNLP25 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05957 2025-10-10 cs.AI cs.CL 86%

AutoAgent: A Fully-Automated and Zero-Code Framework for LLM Agents

Jiabin Tang, Tianyu Fan, Chao Huang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Code: https://github.com/HKUDS/AutoAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16889 2025-10-10 cs.CL 86%

ObjexMT: Objective Extraction and Metacognitive Calibration for LLM-as-a-Judge under Multi-Turn Jailbreaks

Hyunjun Kim, Junwoo Ha, Sangyoon Yu, Haon Park

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments NeurIPS 2025 Workshop on MTI-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08569 2025-10-10 cs.CL cs.AI cs.LG 86%

ArenaBencher: Automatic Benchmark Evolution via Multi-Model Competitive Evaluation

Qin Liu, Jacob Dineen, Yuxi Huang, Sheng Zhang, Hoifung Poon, Ben Zhou, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校) Arizona State University(亚利桑那州立大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04363 2025-10-10 cs.SE cs.AI cs.CL 86%

MacroBench: A Novel Testbed for Web Automation Scripts via Large Language Models

Hyunjun Kim, Sejong Kim

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI;LLM(comments)

Comments NeurIPS 2025 Workshop on Lock-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08638 2025-10-10 cs.CL 85%

Examining Multilingual Embedding Models Cross-Lingually Through LLM-Generated Adversarial Examples

Andrianos Michail, Simon Clematide, Rico Sennrich

机构 * University of Zurich(苏黎世大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments To appear in EMNLP2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01493 2025-10-10 cs.CL 85%

Sherkala-Chat: Building a State-of-the-Art LLM for Kazakh in a Moderately Resourced Setting

Fajri Koto, Rituraj Joshi, Nurdaulet Mukhituly, Yuxia Wang, Zhuohan Xie, Rahul Pal, Daniil Orel, Parvez Mullah, Diana Turmakhan, Maiya Goloburda, Mohammed Kamran, Samujjwal Ghosh, Bokang Jia, Jonibek Mansurov, Mukhammed Togmanov, Debopriyo Banerjee, Nurkhan Laiyk, Akhmed Sakip, Xudong Han, Ekaterina Kochmar, Alham Fikri Aji, Aaryamonvikram Singh, Alok Anil Jadhav, Satheesh Katipomu, Samta Kamboj, Monojit Choudhury, Gurpreet Gosal, Gokulakrishnan Ramakrishnan, Biswajit Mishra, Sarath Chandran, Avraham Sheinin, Natalia Vassilieva, Neha Sengupta, Preslav Nakov

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Inception Cerebras Systems(Cerebras系统)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00096 2025-10-10 q-bio.QM cs.AI 85%

BixBench: a Comprehensive Benchmark for LLM-based Agents in Computational Biology

Ludovico Mitchener, Jon M Laurent, Alex Andonian, Benjamin Tenmann, Siddharth Narayanan, Geemi P Wellawatte, Andrew White, Lorenzo Sani, Samuel G Rodriques

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 8 main text pages, 5 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07550 2025-10-10 cs.CV cs.AI 83%

TRAVL: A Recipe for Making Video-Language Models Better Judges of Physics Implausibility

Saman Motamed, Minghao Chen, Luc Van Gool, Iro Laina

机构 * Visual Geometry Group, University of Oxford(视觉几何组,牛津大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18709 2025-10-10 cs.CL 83%

Adaptive Originality Filtering: Rejection Based Prompting and RiddleScore for Culturally Grounded Multilingual Riddle Generation

Duy Le, Kent Ziti, Evan Girard-Sun, Bakr Bouhaya, Sean O'Brien, Vasu Sharma, Kevin Zhu

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 评测与基准 :prompting(title,abstract);language model(abstract);分类 cs.CL

Comments Paper was accepted in to NeurIPS 2025 Workshop GenProCC

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08470 2025-10-10 cs.AI cs.CL cs.LG 82%

Looking to Learn: Token-wise Dynamic Gating for Low-Resource Vision-Language Modelling

Bianca-Mihaela Ganescu, Suchir Salhan, Andrew Caines, Paula Buttery

机构 * ALTA Institute(ALTA研究院) Department of Computer Science & Technology, University of Cambridge(计算机科学与技术系,剑桥大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to the EMNLP 2025 BabyLM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07437 2025-10-10 cs.CL cs.AI cs.LG eess.AS 82%

LASER: An LLM-based ASR Scoring and Evaluation Rubric

Amruta Parulekar, Preethi Jyothi

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06092 2025-10-10 cs.CV 82%

Q-CLIP: Unleashing the Power of Vision-Language Models for Video Quality Assessment through Unified Cross-Modal Adaptation

Yachun Mi, Yu Li, Yanting Li, Chen Hui, Tong Zhang, Zhixuan Li, Chenyue Song, Wei Yang Bryan Lim, Shaohui Liu

专题命中 评测与基准 :language model(title,abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08120 2025-10-10 cs.CL cs.AI 81%

Interpreting LLM-as-a-Judge Policies via Verifiable Global Explanations

Jasmina Gajcin, Erik Miehling, Rahul Nair, Elizabeth Daly, Radu Marinescu, Seshu Tirupathi

机构 * IBM Research Ireland(IBM爱尔兰研究院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

Comments 12 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08081 2025-10-10 cs.AI cs.CL 81%

AutoQual: An LLM Agent for Automated Discovery of Interpretable Features for Review Quality Assessment

Xiaochong Lan, Jie Feng, Yinxing Liu, Xinlei Shi, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系、百度研究院、清华大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12263 2025-10-10 cs.LG cs.AI cs.SY eess.SY 81%

A Survey of Foundation Models for IoT: Taxonomy and Criteria-Based Analysis

Hui Wei, Dong Yoon Lee, Shubham Rohal, Zhizhang Hu, Ryan Rossi, Shiwei Fang, Shijia Pan

机构 * Adobe Research(Adobe研究院) Augusta University(奥古斯塔大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

Comments Accepted by CCF Transactions on Pervasive Computing and Interaction (CCF TPCI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02944 2025-10-10 cs.LG cs.AI cs.SY eess.SY 81%

Foundation Models for Structural Health Monitoring

Luca Benfenati, Daniele Jahier Pagliari, Luca Zanatta, Yhorman Alexander Bedoya Velez, Andrea Acquaviva, Massimo Poncino, Enrico Macii, Luca Benini, Alessio Burrello

机构 * DAUIN, Politecnico di Torino(达乌因,托斯卡纳理工学院) DEI, University of Bologna(电子工程学院,博洛尼亚大学) DIST, Politecnico di Torino(信息与通信技术学院,托斯卡纳理工学院) D-ITET, ETH Zurich(信息与通信技术系,苏黎世联邦理工学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

Comments 17 pages, 6 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏