arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-28 至 2025-10-28 共收录 412 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 88 篇

2305.10361 2025-10-28 cs.LG cs.AI cs.GT 79%

Human Choice Prediction in Language-based Persuasion Games: Simulation-based Off-Policy Evaluation

Eilam Shapira, Omer Madmon, Reut Apel, Moshe Tennenholtz, Roi Reichart

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted for publication in Transactions of the Association for Computational Linguistics (TACL), 2025. Pre-MIT Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22935 2025-10-28 cs.CL cs.AI 79%

Trusted Knowledge Extraction for Operations and Maintenance Intelligence

Kathleen P. Mealey, Jonathan A. Karr, Priscila Saboia Moreira, Paul R. Brenner, Charles F. Vardeman

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22964 2025-10-28 cs.CV 78%

Survey of Multimodal Geospatial Foundation Models: Techniques, Applications, and Challenges

Liling Yang, Ning Chen, Jun Yue, Yidan Liu, Jiayi Ma, Pedram Ghamisi, Antonio Plaza, Leyuan Fang

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) Institute of Remote Sensing and Geographic Information System, Peking University(北京大学遥感与地理信息系统研究所) School of Automation, Central South University(中南大学自动化学院) Electronic Information School, Wuhan University(武汉大学电子信息学院) Helmholtz-Zentrum Dresden-Rossendorf(德累斯顿-罗斯托克亥姆霍尔茨中心) Lancaster Environment Centre, Lancaster University(兰卡斯特大学环境研究中心) Hyperspectral Computing Laboratory, Department of Technology of Computers and Communications, Escuela Politécnica, University of Extremadura(埃斯特雷马杜拉大学技术计算机与通讯系超光谱计算实验室)

专题命中 评测与基准 :foundation model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22581 2025-10-28 cs.CL 77%

Pedagogy-driven Evaluation of Generative AI-powered Intelligent Tutoring Systems

Kaushal Kumar Maurya, Ekaterina Kochmar

机构 * EduNLP Lab(EduNLP实验室) Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments AIED 2025 (BlueSky). International Conference on Artificial Intelligence in Education. Cham: Springer Nature Switzerland, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22395 2025-10-28 cs.CL 77%

Confabulations from ACL Publications (CAP): A Dataset for Scientific Hallucination Detection

Federica Gamba, Aman Sinha, Timothee Mickus, Raul Vazquez, Patanjali Bhamidipati, Claudio Savelli, Ahana Chattopadhyay, Laura A. Zanella, Yash Kankanampati, Binesh Arakkal Remesh, Aryan Ashok Chandramania, Rohit Agarwal, Chuyuan Li, Ioana Buhnila, Radhika Mamidi

机构 * Charles University, Prague(查尔斯大学,布拉格) Independent Researcher(独立研究者) University of Helsinki, Finland(赫尔辛基大学) University of British Columbia, Vancouver, Canada(不列颠哥伦比亚大学,温哥华,加拿大) Chosun University, South Korea(成均馆大学,韩国)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16720 2025-10-28 cs.AI 77%

Beyond Pipelines: A Survey of the Paradigm Shift toward Model-Native Agentic AI

Jitao Sang, Jinlin Xiao, Jiarun Han, Jilin Chen, Xiaoyi Chen, Shuyu Wei, Yongjie Sun, Yuhang Wang

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家信息与自动化所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室) Beijing Jiaotong University(北京交通大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14917 2025-10-28 cs.CL 77%

ConspEmoLLM-v2: A robust and stable model to detect sentiment-transformed conspiracy theories

Zhiwei Liu, Paul Thompson, Jiaqi Rong, Sophia Ananiadou

机构 * The University of Manchester(曼彻斯特大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12116 2025-10-28 cs.CL 77%

A Multi-Task Benchmark for Abusive Language Detection in Low-Resource Settings

Fitsum Gaim, Hoyun Song, Huije Lee, Changgeon Ko, Eui Jun Hwang, Jong C. Park

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10898 2025-10-28 cs.LG cs.AI 76%

AI for Water Sustainability: Global Water Quality Assessment and Prediction with Explainable AI with LLM Chatbot for Insights

Biplov Paneru, Bishwash Paneru

专题命中 评测与基准 :LLM(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23068 2025-10-28 cs.SE 75%

Checkstyle+: Reducing Technical Debt Through The Use of Linters with LLMs

Ella Dodor, Cristina V. Lopes

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 11 pages, 9 figures, tool link: https://github.com/ellacodee/CheckstylePlus

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22670 2025-10-28 cs.IR 75%

Tools are under-documented: Simple Document Expansion Boosts Tool Retrieval

Xuan Lu, Haohang Huang, Rui Meng, Yaohui Jin, Wenjun Zeng, Xiaoyu Shen

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22286 2025-10-28 cs.CY 75%

Hybrid Instructor Ai Assessment In Academic Projects: Efficiency, Equity, And Methodological Lessons

Hugo Roger Paz

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 12 pages, in Spanish language, 0 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09947 2025-10-28 cs.CL cs.AI cs.LG 75%

Beyond Fertility: Analyzing STRR as a Metric for Multilingual Tokenization Evaluation

Mir Tafseer Nayeem, Sawsan Alqahtani, Md Tahmid Rahman Laskar, Tasnim Mohiuddin, M Saiful Bari

机构 * University of Alberta(阿尔伯塔大学) Princess Nourah Bint Abdulrahman University(努拉·阿卜杜勒拉赫曼王后大学) Dialpad Qatar Computing Research Institute(阿联酋迪拜计算研究所) Amazon AGI(亚马逊人工智能研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23395 2025-10-28 cs.CL cs.AI 73%

Detecting Religious Language in Climate Discourse

Evy Beijen, Pien Pieterse, Yusuf Çelik, Willem Th. van Peursen, Sandjai Bhulai, Meike Morren

机构 * Eep Talstra Centre for Bible and Computer(埃普塔尔斯特圣经与计算机研究中心) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Department of Mathematics(数学系) Department of Marketing, School of Business and Economics(市场营销系,商学院与经济学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17234 2025-10-28 cs.CL cs.AI 73%

ClaimGen-CN: A Large-scale Chinese Dataset for Legal Claim Generation

Siying Zhou, Yiquan Wu, Hui Chen, Xavier Hu, Kun Kuang, Adam Jatowt, Ming Hu, Chunyan Zheng, Fei Wu

机构 * Zhejiang University(浙江大学) University of Innsbruck(因斯布鲁克大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00830 2025-10-28 cs.CE cs.AI cs.LG 73%

BikeBench: A Bicycle Design Benchmark for Generative Models with Objectives and Constraints

Lyle Regenwetter, Yazan Abu Obaideh, Fabien Chiotti, Ioanna Lykourentzou, Faez Ahmed

机构 * MIT(麻省理工学院) ProgressSoft Utrecht University(乌特雷赫大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08338 2025-10-28 cs.AI 70%

LLMs Reproduce Human Purchase Intent via Semantic Similarity Elicitation of Likert Ratings

Benjamin F. Maier, Ulf Aslak, Luca Fiaschi, Nina Rismal, Kemble Fletcher, Christian C. Luhmann, Robbie Dow, Kli Pappas, Thomas V. Wiecki

机构 * PyMC Labs(PyMC实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 28 pages, 35 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22898 2025-10-28 cs.AI cs.SE 70%

On Generalization in Agentic Tool Calling: CoreThink Agentic Reasoner and MAVEN Dataset

Vishvesh Bhat, Omkar Ghugarkar, Julian McAuley

机构 * CoreThink AI University of California, San Diego(加州大学圣地亚哥分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22332 2025-10-28 cs.LG stat.ML 70%

Transformer Key-Value Memories Are Nearly as Interpretable as Sparse Autoencoders

Mengyu Ye, Jun Suzuki, Tatsuro Inaba, Tatsuki Kuribayashi

机构 * Tohoku University(东大大学) RIKEN(理化学研究所) MBZUAI(马克斯·普朗克人工智能研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20414 2025-10-28 cs.GR cs.CV cs.LG cs.RO 70%

SceneWeaver: All-in-One 3D Scene Synthesis with an Extensible and Self-Reflective Agent

Yandan Yang, Baoxiong Jia, Shujie Zhang, Siyuan Huang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(1 通用人工智能国家重点实验室、BIGAI) Tsinghua University(2 清华大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.LG

Comments Accepted by NeurIPS 2025, 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04055 2025-10-28 cs.CR cs.AI cs.SE 70%

Rethinking and Exploring String-Based Malware Family Classification in the Era of LLMs and RAG

Yufan Chen, Daoyuan Wu, Juantao Zhong, Zicheng Zhang, Debin Gao, Shuai Wang, Yingjiu Li, Ning Liu, Jiachi Chen, Rocky K. C. Chang

机构 * University of Oregon(俄勒冈大学) City University of Hong Kong(香港城市大学) Sun Yat-sen University(中山大学) Calvin University(加州学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments This is a technical report from Lingnan University, Hong Kong. Code is available at https://github.com/AIS2Lab/MalwareGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12925 2025-10-28 cs.SE cs.AI cs.IR 70%

CPRet: A Dataset, Benchmark, and Model for Retrieval in Competitive Programming

Han Deng, Yuan Meng, Shixiang Tang, Wanli Ouyang, Xinzhu Ma

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Beihang University(北航) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted by NeurIPS 2025 Dataset and Benchmark Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21966 2025-10-28 cs.SE cs.AI 70%

ArchISMiner: A Framework for Automatic Mining of Architectural Issue-Solution Pairs from Online Developer Communities

Musengamana Jean de Dieu, Ruiyin Li, Peng Liang, Mojtaba Shahin, Muhammad Waseem, Arif Ali Khan, Bangchao Wang, Mst Shamima Aktar

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院) Faculty of Information Technology and Communication Sciences, Tampere University(塔尔库大学信息科技与通信科学学院) School of Computer Science, Central China Normal University(中央师范大学计算机学院) School of Computer Science and Artificial Intelligence, Wuhan Textile University(武汉纺织大学计算机科学与人工智能学院) M3S Empirical Software Engineering Research Unit, University of Oulu(奥卢大学M3S经验软件工程研究组)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 42 pages, 14 images, 6 tables, Manuscript submitted to a Journal (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21933 2025-10-28 cs.SE cs.AI 70%

A Comparison of Conversational Models and Humans in Answering Technical Questions: the Firefox Case

Joao Correia, Daniel Coutinho, Marco Castelluccio, Caio Barbosa, Rafael de Mello, Anita Sarma, Alessandro Garcia, Marco Gerosa, Igor Steinmacher

机构 * Pontifical Catholic University(天主教大学) Mozilla Corporation(Mozilla公司) Federal University of Rio de Janeiro(里约热内卢联邦大学) Oregon State University(俄勒冈州立大学) Northern Arizona University(北亚利桑那大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21795 2025-10-28 cs.CV cs.AI 70%

Xihe: Scalable Zero-Shot Time Series Learner Via Hierarchical Interleaved Block Attention

Yinbo Sun, Yuchen Fang, Zhibo Zhu, Jia Li, Yu Liu, Qiwen Deng, Jun Zhou, Hang Yu, Xingyu Lu, Lintao Ma

机构 * Ant Group(蚂蚁集团)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24063 2025-10-28 cs.CL cs.DB 70%

TCM-Ladder: A Benchmark for Multimodal Question Answering on Traditional Chinese Medicine

Jiacheng Xie, Yang Yu, Ziyang Zhang, Shuai Zeng, Jiaxuan He, Ayush Vasireddy, Xiaoting Tang, Congyu Guo, Lening Zhao, Congcong Jing, Guanghui An, Dong Xu

机构 * Department of Electrical Engineering and Computer Science, University of Missouri(密苏里大学电气工程与计算机科学系) Christopher S. Bond Life Sciences Center, University of Missouri(密苏里大学克里斯托弗·S·邦德生命科学中心) Department of Computer Science, Northwestern University(西北大学计算机科学系) Department of Computer Science and Mathematics, Truman State University(特拉华州立大学计算机科学与数学系) Marquette High School(马基特高中) Community Health Service Center, Shanghai Pudong New Area(上海浦东新区社区卫生服务中心) School of Engineering and Applied Science, University of Pennsylvania(宾夕法尼亚大学工程与应用科学学院) Department of Endocrinology, Seventh People’s Hospital of Shanghai University of Traditional Chinese Medicine(上海中医药大学第七人民医院内分泌科) School of Acupuncture-Moxibustion and Tuina, Shanghai University of Traditional Chinese Medicine(上海中医药大学针灸推拿学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23190 2025-10-28 cs.CV 67%

Evaluation of Vision-LLMs in Surveillance Video

Pascal Benschop, Cristian Meo, Justin Dauwels, Jelte P. Mense

机构 * Department of Computer Science(计算机科学系) Delft University of Technology(代尔夫特理工大学) LatentWorlds AI National Policelab AI & Model-Driven Decisions Lab(国家警务实验室AI与模型驱动决策实验室)

专题命中 评测与基准 :language model(abstract);prompting(abstract)

Comments Accepted as poster in the NeurIPS 2025 Workshop on Space in Vision, Language, and Embodied AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22697 2025-10-28 cs.CV 67%

WaveMAE: Wavelet decomposition Masked Auto-Encoder for Remote Sensing

Vittorio Bernuzzi, Leonardo Rossi, Tomaso Fontanini, Massimo Bertozzi, Andrea Prati

机构 * Dipartimento di Ingegneria e Architettura of the Università di Parma(帕尔马大学工程与建筑系)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17442 2025-10-28 cs.IR 67%

WildClaims: Information Access Conversations in the Wild(Chat)

Hideaki Joko, Shakiba Amirshahi, Charles L. A. Clarke, Faegheh Hasibi

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21733 2025-10-28 cs.IR 67%

Augmenting Researchy Questions with Sub-question Judgments

Jia-Huei Ju, Eugene Yang, Trevor Adriaanse, Andrew Yates

专题命中 评测与基准 :LLM(abstract);prompting(abstract)

Comments 3 pages

详情

展开后加载摘要…

URL PDF HTML 收藏