arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-06 至 2025-10-06 共收录 167 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 44 篇

2510.02665 2025-10-06 cs.CL 88%

Self-Improvement in Multimodal Large Language Models: A Survey

Shijian Deng, Kai Wang, Tianyu Yang, Harsh Singh, Yapeng Tian

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Toronto(多伦多大学) University of Notre Dame(诺特丹大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22860 2025-10-06 cs.CR cs.AI cs.LG 87%

Permissioned LLMs: Enforcing Access Control in Large Language Models

Bargav Jayaraman, Virendra J. Marathe, Hamid Mozaffari, William F. Shen, Krishnaram Kenthapadi

机构 * Oracle Labs(Oracle实验室) University of Cambridge(剑桥大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02343 2025-10-06 cs.CL cs.AI 86%

$\texttt{BluePrint}$: A Social Media User Dataset for LLM Persona Evaluation and Training

Aurélien Bück-Kaeffer, Je Qin Chooi, Dan Zhao, Maximilian Puelma Touzel, Kellin Pelrine, Jean-François Godbout, Reihaneh Rabbany, Zachary Yang

机构 * McGill University(麦吉尔大学) Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所) Harvard College(哈佛学院) NYU(纽约大学) Université de Montréal(蒙特利尔大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 8 pages, 4 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00415 2025-10-06 q-fin.CP cs.AI cs.CL cs.MA q-fin.PM 86%

MarketSenseAI 2.0: Enhancing Stock Analysis through LLM Agents

George Fatouros, Kostas Metaxas, John Soldatos, Manos Karathanassis

机构 * George Fatouros 1,2(乔治·法图罗斯(1,2)) Kostas Metaxas 1,3(科斯塔斯·梅塔克斯(1,3)) John Soldatos 2(约翰·索拉托斯(2)) Manos Karathanassis 3(曼纳斯·卡拉塔西斯(3))

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 25 pages, 7 figures, Under review at Financial Innovation (FIN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03029 2025-10-06 cs.SE cs.AI 85%

Investigating The Smells of LLM Generated Code

Debalina Ghosh Paul, Hong Zhu, Ian Bayley

机构 * School of Engineering, Computing and Mathematics, Oxford Brookes University(工程、计算与数学学院,奥克斯福德布鲁克斯大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02934 2025-10-06 cs.SE 85%

Model-Agnostic Correctness Assessment for LLM-Generated Code via Dynamic Internal Representation Selection

Thanh Trong Vu, Tuan-Dung Bui, Thu-Trang Nguyen, Son Nguyen, Hieu Dinh Vo

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02534 2025-10-06 cs.SE 80%

ZeroFalse: Improving Precision in Static Analysis with LLMs

Mohsen Iranmanesh, Sina Moradi Sabet, Sina Marefat, Ali Javidi Ghasr, Allison Wilson, Iman Sharafaldin, Mohammad A. Tayebi

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02549 2025-10-06 cs.CL cs.AI 79%

Knowledge-Graph Based RAG System Evaluation Framework

Sicheng Dong, Vahid Zolfaghari, Nenad Petrovic, Alois Knoll

机构 * Technical University of Munich, Robotics, Artificial Intelligence and Embedded Systems(慕尼黑技术大学,机器人,人工智能与嵌入式系统)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02335 2025-10-06 cs.CL cs.AI 79%

FormalML: A Benchmark for Evaluating Formal Subgoal Completion in Machine Learning Theory

Xiao-Wen Yang, Zihao Zhang, Jianuo Cao, Zhi Zhou, Zenan Li, Lan-Zhe Guo, Yuan Yao, Taolue Chen, Yu-Feng Li, Xiaoxing Ma

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Department of Computer Science, ETH Zurich, Switzerland(瑞士苏黎世联邦理工学院计算机科学系) School of Computing and Mathematical Sciences, Birkbeck, University of London, UK(伦敦大学伯克贝克学院计算与数学科学学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01227 2025-10-06 cs.CL cs.LG math.HO 79%

EEFSUVA: A New Mathematical Olympiad Benchmark

Nicole N Khatibi, Daniil A. Radamovich, Michael P. Brenner

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 16 Pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00038 2025-10-06 cs.LG cs.AI cs.CY 79%

DM-Bench: Benchmarking LLMs for Personalized Decision Making in Diabetes Management

Maria Ana Cardei, Josephine Lamp, Mark Derdzinski, Karan Bhatia

机构 * University of Virginia(弗吉尼亚大学) Dexcom(德科姆公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14052 2025-10-06 cs.IR cs.AI cs.CL 79%

FinAgentBench: A Benchmark Dataset for Agentic Retrieval in Financial Question Answering

Chanyeol Choi, Jihoon Kwon, Alejandro Lopez-Lira, Chaewoon Kim, Minjae Kim, Juneha Hwang, Jaeseon Ha, Hojun Choi, Suyeol Yun, Yongjin Kim, Yongjae Lee

机构 * University of Florida(佛罗里达大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01903 2025-10-06 cs.CL cs.LG cs.PL 79%

Understanding How CodeLLMs (Mis)Predict Types with Activation Steering

Francesca Lucchetti, Arjun Guha

机构 * Khoury College of Computer Sciences(科里学院计算机科学系) Northeastern University(东北大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

Comments 40 pages, 67 figures. To be published at BlackBoxNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02909 2025-10-06 cs.CV 78%

Training-Free Out-Of-Distribution Segmentation With Foundation Models

Laith Nayal, Hadi Salloum, Ahmad Taha, Yaroslav Kholodov, Alexander Gasnikov

机构 * Laboratory of Multimodal Research In Industry, AI Institute, Innopolis University(工业多模态研究实验室,人工智能研究所,因诺普利斯大学) Phystech School of Applied Mathematics and Computer Science, Moscow Institute of Physics and Technology(物理与技术莫斯科应用数学与计算机科学学院,莫斯科物理技术学院) Research Center for Artificial Intelligence, Innopolis University(人工智能研究中心,因诺普利斯大学) Q Deep, Innopolis(Q深度,因诺普利斯) Machine Learning and Data Representation Lab, Innopolis University(机器学习与数据表示实验室,因诺普利斯大学)

专题命中 评测与基准 :foundation model(title,abstract)

Comments 12 pages, 5 figures, 2 tables, ICOMP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00907 2025-10-06 cs.AI 77%

Grounding Multimodal LLMs to Embodied Agents that Ask for Help with Reinforcement Learning

Ram Ramrakhya, Matthew Chang, Xavier Puig, Ruta Desai, Zsolt Kira, Roozbeh Mottaghi

机构 * Georgia Institute of Technology(佐治亚理工学院) Meta FAIR

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02352 2025-10-06 cs.CL cs.AI 73%

Evaluating Bias in Spoken Dialogue LLMs for Real-World Decisions and Recommendations

Yihao Wu, Tianrui Wang, Yizhou Peng, Yi-Wen Chao, Xuyi Zhuang, Xinsheng Wang, Shunshun Yin, Ziyang Ma

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Soul AI Lab, China(灵魂AI实验室,中国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03154 2025-10-06 cs.CL 70%

EditLens: Quantifying the Extent of AI Editing in Text

Katherine Thai, Bradley Emi, Elyas Masrour, Mohit Iyyer

机构 * Pangram Labs(Pangram实验室) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02742 2025-10-06 cs.CL 70%

IndiCASA: A Dataset and Bias Evaluation Framework in LLMs Using Contrastive Embedding Similarity in the Indian Context

Santhosh G S, Akshay Govind S, Gokul S Krishnan, Balaraman Ravindran, Sriraam Natarajan

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted at 8th AAAI/ACM Conference on AI, Ethics, and Society (AIES) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02374 2025-10-06 cs.CR cs.AI 70%

A Hybrid CAPTCHA Combining Generative AI with Keystroke Dynamics for Enhanced Bot Detection

Ayda Aghaei Nia

机构 * Institute for Artificial Intelligence University of Technology(人工智能研究所 技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23263 2025-10-06 cs.AI 70%

GUI-PRA: Process Reward Agent for GUI Tasks

Tao Xiong, Xavier Hu, Yurun Chen, Yuhang Liu, Changqiao Wu, Pengzhi Gao, Wei Liu, Jian Luan, Shengyu Zhang

机构 * Zhejiang University(浙江大学) MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02790 2025-10-06 cs.CV cs.CL 70%

From Long Videos to Engaging Clips: A Human-Inspired Video Editing Framework with Multimodal Narrative Understanding

Xiangfeng Wang, Xiao Li, Yadong Wei, Xueyu Song, Yang Song, Xiaoqiang Xia, Fangrui Zeng, Zaiyi Chen, Liu Liu, Gu Xu, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学) ByteDance China(字节跳动中国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11400 2025-10-06 cs.CL 70%

On the Diminishing Returns of Complex Robust RAG Training in the Era of Powerful LLMs

Hanxing Ding, Shuchang Tao, Liang Pang, Zihao Wei, Liwei Chen, Kun Xu, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Institute of Computing Technology(计算技术研究所)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.CL

Comments Accepted at SIGIR-AP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15676 2025-10-06 cs.SE cs.AI 70%

Inferring Pluggable Types with Machine Learning

Kazi Amanul Islam Siddiqui, Martin Kellogg

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02337 2025-10-06 cs.CL cs.AI cs.LG 67%

CRACQ: A Multi-Dimensional Approach To Automated Document Assessment

Ishak Soltani, Francisco Belo, Bernardo Tavares

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02677 2025-10-06 cs.AI cs.LG 62%

ARMs: Adaptive Red-Teaming Agent against Multimodal Models with Plug-and-Play Attacks

Zhaorun Chen, Xun Liu, Mintong Kang, Jiawei Zhang, Minzhou Pan, Shuang Yang, Bo Li

机构 * University of Chicago(芝加哥大学) University of Illinois(伊利诺伊大学) Virtue AI Meta

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

Comments 60 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02417 2025-10-06 cs.ET cs.AI cs.LG 62%

NEURODNAAI: Neural pipeline approaches for the advancing dna-based information storage as a sustainable digital medium using deep learning framework

Rakesh Thakur, Lavanya Singh, Yashika, Manomay Bundawala, Aruna Kumar

机构 * Amity Centre for Artificial Intelligence, Amity University, India(阿米蒂大学人工智能中心,阿米蒂大学,印度) Amity School of Engineering and Technology, Amity University, India(阿米蒂工程与技术学院,阿米蒂大学,印度) Amity Institute of Biotechnology, Amity University, India(阿米蒂生物技术学院,阿米蒂大学,印度)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04793 2025-10-06 cs.CL cs.AI 62%

A Survey of Pun Generation: Datasets, Evaluations and Methodologies

Yuchen Su, Yonghua Zhu, Ruofan Wang, Zijian Huang, Diana Benavides-Prado, Michael Witbrock

机构 * School of Computer Science, University of Auckland(奥克兰大学计算机科学学院) Singapore University of Technology and Design(新加坡科技设计大学) School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦女王学院电子工程与计算机科学学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02653 2025-10-06 cs.AI cs.IR 57%

Geolog-IA: Conversational System for Academic Theses

Micaela Fuel Pozo, Andrea Guatumillo Saltos, Yeseña Tipan Llumiquinga, Kelly Lascano Aguirre, Marilyn Castillo Jara, Christian Mejia-Escobar

专题命中 评测与基准 :language model(abstract);分类 cs.AI

Comments 17 pages, in Spanish language

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02322 2025-10-06 eess.AS cs.CL 57%

SpeechCT-CLIP: Distilling Text-Image Knowledge to Speech for Voice-Native Multimodal CT Analysis

Lukas Buess, Jan Geier, David Bani-Harouni, Chantal Pellegrini, Matthias Keicher, Paula Andrea Perez-Toro, Nassir Navab, Andreas Maier, Tomas Arias-Vergara

机构 * Computer Aided Medical Procedures, Technical University of Munich(慕尼黑技术大学计算机辅助医学程序)

专题命中 评测与基准 :pretraining(abstract);分类 cs.CL

Comments Submitted to ICASSP 2026; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03114 2025-10-06 physics.chem-ph 50%

Electrochemical insights into manganese-cobalt doped $α-Fe_2O_3$ nanomaterial for cholesterol detection: A comparative approach

Sushmitha S, Subhasmita Ray, Lavanya Rao, Mahesha P Nayak, Karel Carva, Badekai Ramachandra Bhat

专题命中 评测与基准 :prompting(abstract)

Journal ref RSC Adv., 2025, 15, 34176-34190

详情

展开后加载摘要…

URL PDF HTML 收藏