arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-30 至 2025-10-30 共收录 164 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 37 篇

2510.24937 2025-10-30 cs.HC 50%

OrchVis: Hierarchical Multi-Agent Orchestration for Human Oversight

Jieyu Zhou

专题命中 推理与问题求解 :LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 43 篇

2510.25014 2025-10-30 cs.AI 92%

Aligning Large Language Models with Procedural Rules: An Autoregressive State-Tracking Prompting for In-Game Trading

Minkyung Kim, Junsik Kim, Woongcheol Yang, Sangdon Park, Sohee Bae

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

Comments 8 pages main content, 18 pages supplementary material, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02745 2025-10-30 cs.AI cs.CL 90%

CURATRON: Complete and Robust Preference Data for Rigorous Alignment of Large Language Models

Son The Nguyen, Niranjan Uma Naresh, Theja Tulabandhula

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.06818 2025-10-30 cs.CL cs.IR 89%

Large Language Models for Few-Shot Named Entity Recognition

Yufei Zhao, Xiaoshi Zhong, Erik Cambria, Jagath C. Rajapakse

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments 17 pages, 2 figures. Accepted by AI, Computer Science and Robotics Technology (ACRT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19169 2025-10-30 cs.CR cs.CL 89%

OpenGuardrails: A Configurable, Unified, and Scalable Guardrails Platform for Large Language Models

Thomas Wang, Haowen Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15584 2025-10-30 cs.HC 89%

To Rely or Not to Rely? Evaluating Interventions for Appropriate Reliance on Large Language Models

Jessica Y. Bo, Sophia Wan, Ashton Anderson

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Journal ref Proceedings of the 2025 CHI Conference on Human Factors in Computing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25148 2025-10-30 cs.SE 89%

Automated Program Repair Based on REST API Specifications Using Large Language Models

Katsuki Yamagishi, Norihiro Yoshida, Erina Makihara, Katsuro Inoue

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15817 2025-10-30 cs.CE 89%

LaMP-Val: Large Language Models Empower Personalized Valuation in Auction

Jie Sun, Tianyu Zhang, Houcheng Jiang, Kexin Huang, Xiang Shu, Zhibo Zhu, Lintao Ma, Xingyu Lu, Jun Zhou, Junkang Wu, Chi Luo, An Zhang, Junkang Wu, Jiancan Wu, Xiang Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 17 pages, 5 figures, 8tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20249 2025-10-30 cs.CL cs.AI 88%

WXImpactBench: A Disruptive Weather Impact Understanding Benchmark for Evaluating Large Language Models

Yongan Yu, Qingchen Hu, Xianda Du, Jiayin Wang, Fengran Mo, Renee Sieber

机构 * McGill University(麦吉尔大学) University of Waterloo(滑铁卢大学) Tsinghua University(清华大学) University of Montreal(蒙特利尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10844 2025-10-30 cs.AI cs.CL 88%

Creativity or Brute Force? Using Brainteasers as a Window into the Problem-Solving Abilities of Large Language Models

Simeng Han, Howard Dai, Stephen Xia, Grant Zhang, Chen Liu, Lichang Chen, Hoang Huy Nguyen, Hongyuan Mei, Jiayuan Mao, R. Thomas McCoy

机构 * Yale University(耶鲁大学) Meta Superintelligence Labs(Meta超智能实验室) Georgia Institute of Technology(佐治亚理工学院) TTIC Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25517 2025-10-30 cs.AI 88%

Predicate Renaming via Large Language Models

Elisabetta Gentili, Tony Ribeiro, Fabrizio Riguzzi, Katsumi Inoue

机构 * Nantes Université, École Centrale Nantes, CNRS, LS2N(南特大学,中央南特学院,CNRS,LS2N) National Institute of Informatics(日本信息机构)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25007 2025-10-30 cs.AI cs.LG 87%

Taming the Real-world Complexities in CPT E/M Coding with Large Language Models

Islam Nassar, Yang Lin, Yuan Jin, Rongxin Zhu, Chang Wei Tan, Zenan Zhai, Nitika Mathur, Thanh Tien Vu, Xu Zhong, Long Duong, Yuan-Fang Li

机构 * Oracle Health & AI(Oracle健康与人工智能)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

Comments EMNLP 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06658 2025-10-30 cs.IR 85%

Can We Hide Machines in the Crowd? Quantifying Equivalence in LLM-in-the-loop Annotation Tasks

Jiaman He, Zikang Leng, Dana McKay, Damiano Spina, Johanne R. Trippas

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted at SIGIR-AP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13852 2025-10-30 cs.CL cs.AI cs.HC 83%

ConsistencyAI: A Benchmark to Assess LLMs' Factual Consistency When Responding to Different Demographic Groups

Peter Banyas, Shristi Sharma, Alistair Simmons, Atharva Vispute

机构 * Duke University(杜克大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :LLM(abstract,comments);large language model(abstract);language model(abstract);prompting(abstract)

Comments For associated code repository, see http://github.com/banyasp/consistencyAI For user-friendly web app, see http://v0-llm-comparison-webapp.vercel.app/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06497 2025-10-30 cs.CV cs.AI 83%

Evaluation of Safety Cognition Capability in Vision-Language Models for Autonomous Driving

Enming Zhang, Peizhe Gong, Xingyuan Dai, Min Huang, Yisheng Lv, Qinghai Miao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25087 2025-10-30 cs.CL cs.LG 82%

BioCoref: Benchmarking Biomedical Coreference Resolution with LLMs

Nourah M Salem, Elizabeth White, Michael Bada, Lawrence Hunter

机构 * Computational Bioscience Program University of Colorado Anschutz Medical Campus(科学生物学程序,科罗拉多大学安舒茨医学校区) Department of Pediatrics University of Chicago(儿科学系,芝加哥大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25701 2025-10-30 cs.CL 81%

Interpreting LLMs as Credit Risk Classifiers: Do Their Feature Explanations Align with Classical ML?

Saeed AlMarri, Kristof Juhasz, Mathieu Ravaut, Gautier Marti, Hamdan Al Ahbabi, Ibrahim Elfadel

机构 * Khalifa University(卡利法大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 8 pages, 6 figures, 3 tables, CIKM 2025 FinFAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24670 2025-10-30 cs.LG q-bio.QM 79%

Pearl: A Foundation Model for Placing Every Atom in the Right Location

Genesis Research Team, Alejandro Dobles, Nina Jovic, Kenneth Leidal, Pranav Murugan, David C. Williams, Drausin Wulsin, Nate Gruver, Christina X. Ji, Korrawat Pruegsanusak, Gianluca Scarpellini, Ansh Sharma, Wojciech Swiderski, Andrea Bootsma, Richard Strong Bowen, Charlotte Chen, Jamin Chen, Marc André Dämgen, Benjamin DiFrancesco, J. D. Fishman, Alla Ivanova, Zach Kagin, David Li-Bland, Zuli Liu, Igor Morozov, Jeffrey Ouyang-Zhang, Frank C. Pickard, Kushal S. Shah, Ben Shor, Gabriel Monteiro da Silva, Roy Tal, Maxx Tessmer, Carl Tilbury, Cyr Vetcher, Daniel Zeng, Maruan Al-Shedivat, Aleksandra Faust, Evan N. Feinberg, Michael V. LeVine, Matteus Pan

机构 * Genesis Molecular AI(基因分子AI)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19311 2025-10-30 cs.CV cs.AI 79%

DGTRSD & DGTRS-CLIP: A Dual-Granularity Remote Sensing Image-Text Dataset and Vision Language Foundation Model for Alignment

Weizhi Chen, Yupeng Deng, Jin Wei, Jingbo Chen, Jiansheng Chen, Yuman Feng, Zhihao Xi, Diyou Liu, Kai Li, Yu Meng

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院 aerospace information research institute) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) School of Information Network Security, People’s Public Security University of China(中国人民公安大学信息网络安全学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24721 2025-10-30 cs.CY cs.AI cs.CL cs.HC 79%

The Epistemic Suite: A Post-Foundational Diagnostic Methodology for Assessing AI Knowledge Claims

Matthew Kelly

专题命中 评测与基准 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI

Comments 65 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22967 2025-10-30 cs.CL cs.AI 79%

MAD-Fact: A Multi-Agent Debate Framework for Long-Form Factuality Evaluation in LLMs

Yucheng Ning, Xixun Lin, Fang Fang, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing 100085, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing 100049, China(中国科学院大学网络安全学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-025-51369-x}

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11832 2025-10-30 cs.CL cs.AI 79%

OpenFactCheck: A Unified Framework for Factuality Evaluation of LLMs

Hasan Iqbal, Yuxia Wang, Minghan Wang, Georgi Georgiev, Jiahui Geng, Iryna Gurevych, Preslav Nakov

机构 * MBZUAI Monash University(墨尔本大学) Sofia University(索菲亚大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 11 pages, 4 Figures, 3 Tables, Published In Proceedings of The 2024 Conference on Empirical Methods in Natural Language Processing

Journal ref In Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing: System Demonstrations, pages 219-229, Miami, Florida, USA. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05493 2025-10-30 cs.IR cs.CL 77%

Can LLMs Outshine Conventional Recommenders? A Comparative Evaluation

Qijiong Liu, Jieming Zhu, Lu Fan, Kun Wang, Hengchang Hu, Wei Guo, Yong Liu, Xiao-Ming Wu

机构 * PolyU Hong Kong(香港 PolyU) Huawei Noah’s Ark Lab(华为诺亚实验室) NTU Singapore(新加坡国立大学) NUS Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments NeurIPS 2025 DB Track Accepted Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25621 2025-10-30 cs.CL cs.AI cs.IR 76%

FARSIQA: Faithful and Advanced RAG System for Islamic Question Answering

Mohammad Aghajani Asl, Behrooz Minaei Bidgoli

专题命中 评测与基准 :large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI

Comments 37 pages, 5 figures, 10 tables. Keywords: Retrieval-Augmented Generation (RAG), Question Answering (QA), Islamic Knowledge Base, Faithful AI, Persian NLP, Multi-hop Reasoning, Large Language Models (LLMs)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25694 2025-10-30 cs.SE cs.AI cs.CL 73%

Process-Level Trajectory Evaluation for Environment Configuration in Software Engineering Agents

Jiayi Kuang, Yinghui Li, Xin Zhang, Yangning Li, Di Yin, Xing Sun, Ying Shen, Philip S. Yu

机构 * Youtu-LLM Team, Tencent Youtu Lab(腾讯优设实验室) Sun Yat-sen University(中山大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21614 2025-10-30 cs.AI 70%

Huxley-Gödel Machine: Human-Level Coding Agent Development by an Approximation of the Optimal Self-Improving Machine

Wenyi Wang, Piotr Piękos, Li Nanbo, Firas Laakom, Yimeng Chen, Mateusz Ostaszewski, Mingchen Zhuge, Jürgen Schmidhuber

机构 * King Abdullah University of Science and Technology (KAUST)(国王 Abdullah 科学与技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25428 2025-10-30 cs.IR cs.AI 70%

Alibaba International E-commerce Product Search Competition DcuRAGONs Team Technical Report

Thang-Long Nguyen-Ho, Minh-Khoi Pham, Hoang-Bao Le

机构 * School of Computing, Dublin City University, Dublin, Ireland(计算学院,都柏林城市大学,都柏林,爱尔兰)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Alibaba International E-commerce Product Search Competition @ CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24932 2025-10-30 cs.CL 70%

RiddleBench: A New Generative Reasoning Benchmark for LLMs

Deepon Halder, Alan Saji, Thanmay Jayakumar, Ratish Puduppully, Anoop Kunchukuttan, Raj Dabre

机构 * Nilekani Centre at AI4Bharat(AI4Bharat的Nilekani中心) Indian Institute of Technology Madras(印度理工学院马德拉斯分校) IT University of Copenhagen(哥本哈根技术大学) Microsoft(微软) Indian Institute of Engineering, Science and Technology, Shibpur(Shibpur印度工程科学技术学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24774 2025-10-30 cs.CY cs.CL 70%

PANORAMA: A Dataset and Benchmarks Capturing Decision Trails and Rationales in Patent Examination

Hyunseung Lim, Sooyohn Nam, Sungmin Na, Ji Yong Cho, June Yong Yang, Hyungyu Shin, Yoonjoo Lee, Juho Kim, Moontae Lee, Hwajung Hong

机构 * KAIST(韩国科学技术院) LG AI Research(LG人工智能研究) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10266 2025-10-30 cs.CV cs.AI 70%

SignMouth: Leveraging Mouthing Cues for Sign Language Translation by Multimodal Contrastive Fusion

Wenfang Wu, Tingting Yuan, Yupeng Li, Daling Wang, Xiaoming Fu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏