arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-24 至 2025-10-24 共收录 194 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 41 篇

2506.09601 2025-10-24 cs.SE 75%

How Far Have LLMs Come Toward Automated SATD Taxonomy Construction?

Sota Nakashima, Yuta Ishimoto, Masanari Kondo, Tao Xiao, Yasutaka Kamei

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 5 pages, APSEC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17716 2025-10-24 cs.CL 74%

A New Benchmark Dataset and Mixture-of-Experts Language Models for Adversarial Natural Language Inference in Vietnamese

Tin Van Huynh, Kiet Van Nguyen, Ngan Luu-Thuy Nguyen

机构 * Faculty of Information Science and Engineering, University of Information Technology(信息科学与工程学院,信息技术大学) Vietnam National University(越南国家大学)

专题命中 评测与基准 :language model(title);分类 cs.CL

Comments Accepted by Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19667 2025-10-24 cs.CL cs.AI 73%

LeCoDe: A Benchmark Dataset for Interactive Legal Consultation Dialogue Evaluation

Weikang Yuan, Kaisong Song, Zhuoren Jiang, Junjie Cao, Yujie Zhang, Jun Lin, Kun Kuang, Ji Zhang, Xiaozhong Liu

机构 * Zhejiang University(浙江大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Worcester Polytechnic Institute(沃斯通理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13938 2025-10-24 cs.LG cs.AI cs.LO cs.PL cs.SE 73%

CLEVER: A Curated Benchmark for Formally Verified Code Generation

Amitayush Thakur, Jasper Lee, George Tsoukalas, Meghana Sistla, Matthew Zhao, Stefan Zetzsche, Greg Durrett, Yisong Yue, Swarat Chaudhuri

机构 * UT Austin(得克萨斯大学) Amazon(亚马逊) Caltech(加州理工学院)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19866 2025-10-24 cs.CL cs.AI 73%

An Evaluation of the Pedagogical Soundness and Usability of AI-Generated Lesson Plans Across Different Models and Prompt Frameworks in High-School Physics

Xincheng Liu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 20 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19886 2025-10-24 cs.CL 70%

An Expert-grounded benchmark of General Purpose LLMs in LCA

Artur Donaldson, Bharathan Balaji, Cajetan Oriekezie, Manish Kumar, Laure Patouillard

机构 * PRé Sustainability B.V.(PRé可持续性公司) Amazon(亚马逊)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20210 2025-10-24 cs.SD 67%

Vox-Evaluator: Enhancing Stability and Fidelity for Zero-shot TTS with A Multi-Level Evaluator

Hualei Wang, Na Li, Chuke Wang, Shu Wu, Zhifeng Li, Dong Yu

专题命中 评测与基准 :language model(abstract);preference optimization(abstract)

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20700 2025-10-24 cs.CL 57%

Structure-Conditional Minimum Bayes Risk Decoding

Bryan Eikema, Anna Rutkiewicz, Mario Giulianelli

机构 * University of Amsterdam(阿姆斯特丹大学) University of Zurich(苏黎世大学) UCL(伦敦大学学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

Comments EMNLP 2025 Camera-Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02464 2025-10-24 cs.CL 57%

SpecEval: Evaluating Model Adherence to Behavior Specifications

Ahmed Ahmed, Kevin Klyman, Yi Zeng, Sanmi Koyejo, Percy Liang

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学) The Bradley Department of Electrical and Computer Engineering, Virginia Tech(电气与计算机工程系,弗吉尼亚理工学院)

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20703 2025-10-24 cs.NI 50%

Trust, But Verify: An Empirical Evaluation of AI-Generated Code for SDN Controllers

Felipe Avencourt Soares, Muriel F. Franco, Eder J. Scheid, Lisandro Z. Granville

专题命中 评测与基准 :prompting(abstract)

Comments Submitted to IEEE/IFIP Network Operations and Management Symposium (NOMS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20661 2025-10-24 cs.CV 50%

UltraHR-100K: Enhancing UHR Image Synthesis with A Large-Scale High-Quality Dataset

Chen Zhao, En Ci, Yunzhe Xu, Tiehan Fan, Shanyan Guan, Yanhao Ge, Jian Yang, Ying Tai

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) vivo Mobile Communication Co., Ltd., China(vivo移动通信有限公司)

专题命中 评测与基准 :post-training(abstract)

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11520 2025-10-24 cs.CV 50%

mmWalk: Towards Multi-modal Multi-view Walking Assistance

Kedi Ying, Ruiping Liu, Chongyan Chen, Mingzhe Tao, Hao Shi, Kailun Yang, Jiaming Zhang, Rainer Stiefelhagen

机构 * CV:HCI, KIT(KIT计算机视觉与人机交互中心) Hunan University(湖南大学) ETH Zurich(苏黎世联邦理工学院) University of Texas at Austin(德克萨斯大学奥斯汀分校) Zhejiang University(浙江大学)

专题命中 评测与基准 :language model(abstract)

Comments Accepted by NeurIPS 2025 Datasets and Benchmarks Track. Data and Code: https://github.com/KediYing/mmWalk

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09122 2025-10-24 cs.CV 50%

SnapMoGen: Human Motion Generation from Expressive Texts

Chuan Guo, Inwoo Hwang, Jian Wang, Bing Zhou

机构 * Snap Inc.(Snap公司) Seoul National University(首尔国立大学)

专题命中 评测与基准 :LLM(abstract)

Comments Project Webpage: https://snap-research.github.io/SnapMoGen/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 21 篇

2510.20428 2025-10-24 cs.LG 89%

An Empirical Study of Sample Selection Strategies for Large Language Model Repair

Xuran Li, Jingyi Wang

机构 * Zhejiang University(浙江大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19979 2025-10-24 cs.CR cs.LG cs.SE 88%

SecureInfer: Heterogeneous TEE-GPU Architecture for Privacy-Critical Tensors for Large Language Model Deployment

Tushar Nayan, Ziqi Zhang, Ruimin Sun

机构 * Florida International University(佛罗里达国际大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

Comments Accepted at IEEE Intelligent Computing and Systems at the Edge (ICEdge) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20800 2025-10-24 cs.LG cs.AI cs.CL cs.CV 85%

Compress to Impress: Efficient LLM Adaptation Using a Single Gradient Step on 100 Samples

Shiva Sreeram, Alaa Maalouf, Pratyusha Sharma, Daniela Rus

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) University of Haifa(海法大学)

专题命中 效率与部署 :LLM(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20653 2025-10-24 stat.ML cs.AI cs.LG 84%

Finding the Sweet Spot: Trading Quality, Cost, and Speed During Inference-Time LLM Reflection

Jack Butler, Nikita Kozodoi, Zainab Afolabi, Brian Tyacke, Gaiar Baimuratov

机构 * Amazon Web Services(亚马逊网络服务) Zalando

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Journal ref Neural Information Processing Systems (NeurIPS 2025) Workshop: Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15235 2025-10-24 cs.CV cs.CL 83%

ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding

Jialiang Kang, Han Shu, Wenshuo Li, Yingjie Zhai, Xinghao Chen

机构 * Peking University(北京大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11843 2025-10-24 cs.CL cs.AI 82%

Bi-Mamba: Towards Accurate 1-Bit State Space Models

Shengkun Tang, Liqun Ma, Haonan Li, Mingjie Sun, Zhiqiang Shen

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments Accepted in TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11261 2025-10-24 cs.AI cs.CL 81%

Sycophancy in Vision-Language Models: A Systematic Analysis and an Inference-Time Mitigation Framework

Yunpu Zhao, Rui Zhang, Junbin Xiao, Changxin Ke, Ruibo Hou, Yifan Hao, Ling Li

机构 * School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学) State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(处理器国家重点实验室,中国科学院计算技术研究所) Department of Computer Science, National University of Singapore(计算机科学系,新加坡国立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Intelligent Software Research Center, Institute of Software, Chinese Academy of Sciences(软件智能研究中心,中国科学院软件研究所)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

Journal ref Neurocomputing, Volume 659, 2026, 131217

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20111 2025-10-24 cs.DC cs.LG 79%

AsyncHZP: Hierarchical ZeRO Parallelism with Asynchronous Scheduling for Scalable LLM Training

Huawei Bai, Yifan Huang, Wenqi Shi, Ansheng You, Feifan Shao, Tengfei Han, Minghui Yu

机构 * ByteDance Seed(字节跳动种子)

专题命中 效率与部署 :LLM(title);language model(abstract);分类 cs.LG

Comments 14 pages, 5 figures, tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22038 2025-10-24 cs.CV cs.AI 79%

Balanced Token Pruning: Accelerating Vision Language Models Beyond Local Optimization

Kaiyuan Li, Xiaoyue Chen, Chen Gao, Yong Li, Xinlei Chen

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) BNRist, Tsinghua University(清华大学北京研究院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

Comments Accepted by Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19507 2025-10-24 cs.LG 77%

Teaming LLMs to Detect and Mitigate Hallucinations

Demian Till, John Smeaton, Peter Haubrick, Gouse Saheb, Florian Graef, David Berman

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Accepted to NeurIPS 2025 workshop on Reliable ML from Unreliable Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20113 2025-10-24 eess.SY cs.SD cs.SY 75%

SpeechAgent: An End-to-End Mobile Infrastructure for Speech Impairment Assistance

Haowei Lou, Chengkai Huang, Hye-young Paik, Yongquan Hu, Aaron Quigley, Wen Hu, Lina Yao

机构 * University of New South Wales(新南威尔士大学) Macquarie University(麦考瑞大学) National University of Singapore(国立新加坡大学) CSIRO's Data61(澳大利亚联邦科学与工业研究组织Data61部门)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08396 2025-10-24 cs.LG cs.AI cs.CL 75%

FlyLoRA: Boosting Task Decoupling and Parameter Efficiency via Implicit Rank-Wise Mixture-of-Experts

Heming Zou, Yunliang Zang, Wutong Xu, Yao Zhu, Xiangyang Ji

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Academy of Medical Engineering and Translational Medicine, Tianjin University(医学工程与转化医学学院,天津大学)

专题命中 效率与部署 :foundation model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19201 2025-10-24 cs.CL 70%

DREAM: Drafting with Refined Target Features and Entropy-Adaptive Cross-Attention Fusion for Multimodal Speculative Decoding

Yunhai Hu, Tianhua Xia, Zining Liu, Rahul Raman, Xingyu Liu, Bo Bao, Eric Sather, Vithursan Thangarasa, Sai Qian Zhang

机构 * Courant Institute of Mathematical Sciences, New York University(纽约大学数学科学学院) Tandon School of Engineering, New York University(纽约大学工程学院) Cerebras Systems Inc.(Cerebras Systems公司) University of Pennsylvania(宾夕法尼亚大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20013 2025-10-24 math.PR cs.CC cs.IT math.CO math.IT 67%

Counterexample to majority optimality in NICD with erasures

Paata Ivanisvili, Xinyuan Xie

专题命中 效率与部署 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04462 2025-10-24 cs.CL cs.AI 62%

Benchmarking GPT-5 for biomedical natural language processing

Yu Hou, Zaifu Zhan, Min Zeng, Yifan Wu, Shuang Zhou, Rui Zhang

专题命中 效率与部署 :prompting(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10297 2025-10-24 cs.LG cs.CL cs.FL 62%

DeltaProduct: Improving State-Tracking in Linear RNNs via Householder Products

Julien Siems, Timur Carstensen, Arber Zela, Frank Hutter, Massimiliano Pontil, Riccardo Grazzi

机构 * University of Freiburg(弗赖堡大学) ELLIS Institute Tübingen(图宾根ELLIS研究所) Microsoft Research(微软研究院) Prior Labs(先驱实验室) CSML, Istituto Italiano di Tecnologia(CSML,意大利技术研究所) AI Centre, University College London(伦敦大学学院人工智能中心)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG

Comments v5: Characterization of DeltaProduct's state-tracking ability. Analysis of hidden state's effective rank. Improved scaling analysis. v6: Added analysis for products of RWKV-7 matrices, v6: Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20291 2025-10-24 cs.CV cs.AI 57%

A Parameter-Efficient Mixture-of-Experts Framework for Cross-Modal Geo-Localization

LinFeng Li, Jian Zhao, Zepeng Yang, Yuhang Song, Bojun Lin, Tianle Zhang, Yuchen Yuan, Chi Zhang, Xuelong Li

机构 * The Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) East China Normal University(东华师范大学) National Tsing Hua University(国立清华大学)

专题命中 效率与部署 :LLM(abstract);分类 cs.AI

Journal ref IROS 2025 Robosense Cross-Modal Drone Navigation Challenge first place

详情

展开后加载摘要…

URL PDF HTML 收藏