arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-01 至 2025-10-01 共收录 274 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 57 篇

2509.25192 2025-10-01 cs.SE 75%

WARP -- Web-Augmented Real-time Program Repairer: A Real-Time Compilation Error Resolution using LLMs and Web-Augmented Synthesis

Anderson de Lima Luiz

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25539 2025-10-01 cs.CY cs.AI cs.CL cs.HC cs.SI 73%

Toxicity in Online Platforms and AI Systems: A Survey of Needs, Challenges, Mitigations, and Future Directions

Smita Khapre, Melkamu Abay Mersha, Hassan Shakil, Jonali Baruah, Jugal Kalita

机构 * organization= College of Engineering Applied Science, University of Colorado Colorado Springs , postcode= 80918 , state= CO , country= USA organization= Tarleton State University, A Member of The Texas A \& M University System , city= Stephenville , postcode= 76401 , state= TX , country= USA

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26167 2025-10-01 cs.AI 70%

'Too much alignment; not enough culture': Re-balancing cultural alignment practices in LLMs

Eric J. W. Orlowski, Hakim Norhashim, Tristan Koh Ly Wey

机构 * AI Singapore, National University of Singapore(AI新加坡,国立新加坡大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 8 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26038 2025-10-01 cs.CL 70%

RE$^2$: Improving Chinese Grammatical Error Correction via Retrieving Appropriate Examples with Explanation

Baoxin Wang, Yumeng Luo, Yixuan Wang, Dayong Wu, Wanxiang Che, Shijin Wang

机构 * Research Center for SCIR, Harbin Institute of Technology(SCIR研究中心,哈尔滨工业大学) State Key Laboratory of Cognitive Intelligence, iFLYTEK Research(认知智能国家重点实验室,iFLYTEK研究院) Artificial Intelligence and Human Language Lab, Beijing Foreign Studies University(人工智能与语言实验室,北京外国语大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25242 2025-10-01 cs.SE cs.AI 70%

A Benchmark for Localizing Code and Non-Code Issues in Software Projects

Zejun Zhang, Jian Wang, Qingyun Yang, Yifan Pan, Yi Tang, Yi Li, Zhenchang Xing, Tian Zhang, Xuandong Li, Guoan Zhang

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04909 2025-10-01 cs.CV cs.AI 70%

HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding

Yuxuan Cai, Jiangning Zhang, Zhenye Gan, Qingdong He, Xiaobin Hu, Junwei Zhu, Yabiao Wang, Chengjie Wang, Zhucun Xue, Chaoyou Fu, Xinwei He, Xiang Bai

机构 * Fantasyele

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15772 2025-10-01 cs.SD cs.CL eess.AS 70%

MIKU-PAL: An Automated and Standardized Multi-Modal Method for Speech Paralinguistic and Affect Labeling

Yifan Cheng, Ruoyi Zhang, Jiatong Shi

机构 * Santa Clara, CA, USA(美国圣克拉拉) Carnegie Mellon University(卡内基梅隆大学) Huazhong University of Science and Technology(华中科技大学) Nanjing University of Information Science and Technology(南京信息工程大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by Interspeech

Journal ref Proc. of Interspeech2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15420 2025-10-01 cs.CR cs.AI 70%

Silent Leaks: Implicit Knowledge Extraction Attack on RAG Systems through Benign Queries

Yuhao Wang, Wenjie Qu, Shengfang Zhai, Yanze Jiang, Zichen Liu, Yue Liu, Yinpeng Dong, Jiaheng Zhang

机构 * National University of Singapore(新加坡国立大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02329 2025-10-01 cs.HC cs.CL 70%

ReSpark: Leveraging Previous Data Reports as References to Generate New Reports with LLMs

Yuan Tian, Chuhan Zhang, Xiaotong Wang, Sitong Pan, Weiwei Cui, Haidong Zhang, Dazhen Deng, Yingcai Wu

机构 * Zhejiang University(浙江大学) Microsoft(微软)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26550 2025-10-01 math.DS 67%

Can LLMs Write Mathematics Papers? A Case Study in Reservoir Computing

Allen G Hart

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments 10 Pages, 0 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26014 2025-10-01 cs.SE cs.IR 67%

Using GPT to build a Project Management assistant for Jira environments

Joel Garcia-Escribano, Arkaitz Carbajo, Mikel Egaña Aranguren, Unai Lopez-Novoa

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15463 2025-10-01 cs.HC cs.AI cs.CL 62%

Mind the Value-Action Gap: Do LLMs Act in Alignment with Their Values?

Hua Shen, Nicholas Clark, Tanushree Mitra

机构 * University of Washington(华盛顿大学) NYU Shanghai(纽约大学上海校区) New York University(纽约大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 Main Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05288 2025-10-01 cs.LG cs.AI cs.CE cs.CV 62%

The impact of internal variability on benchmarking deep learning climate emulators

Björn Lütjens, Raffaele Ferrari, Duncan Watson-Parris, Noelle Selin

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

Journal ref (2025) Journal of Advances in Modeling Earth Systems, 17

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26126 2025-10-01 cs.CL 57%

The Hunger Game Debate: On the Emergence of Over-Competition in Multi-Agent Systems

Xinbei Ma, Ruotian Ma, Xingyu Chen, Zhengliang Shi, Mengru Wang, Jen-tse Huang, Qu Yang, Wenxuan Wang, Fanghua Ye, Qingxuan Jiang, Mengfei Zhou, Zhuosheng Zhang, Rui Wang, Hai Zhao, Zhaopeng Tu, Xiaolong Li, Linus

机构 * Tencent(腾讯)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25961 2025-10-01 cs.CL 57%

Reliability Crisis of Reference-free Metrics for Grammatical Error Correction

Takumi Goto, Yusuke Sakai, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技術研究所)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25716 2025-10-01 cs.SE cs.AI cs.IR 57%

DeepCodeSeek: Real-Time API Retrieval for Context-Aware Code Generation

Esakkivel Esakkiraja, Denis Akhiyarov, Aditya Shanmugham, Chitra Ganapathy

机构 * ServiceNow, Inc.(ServiceNow公司)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

Comments Retrieval-Augmented Generation, API Prediction, Context-Aware Code Generation, Enterprise Code Completion, Reinforcement Learning, ServiceNow, Real-Time Code Search, Query Enhancement, Fine-Tuning, Embedding, Reranker

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25229 2025-10-01 cs.AI 57%

Blueprint-Bench: Comparing spatial intelligence of LLMs, agents and image models

Lukas Petersson, Axel Backlund, Axel Wennstöm, Hanna Petersson, Callum Sharrock, Arash Dabiri

机构 * Andon Labs(安登实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

Comments 9 pages, 8 figures, submitted for ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00613 2025-10-01 cs.RO cs.AI 57%

WorldGym: World Model as An Environment for Policy Evaluation

Julian Quevedo, Ansh Kumar Sharma, Yixiang Sun, Varad Suryavanshi, Percy Liang, Sherry Yang

机构 * Stanford University(斯坦福大学) NYU(纽约大学) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

Comments https://world-model-eval.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14446 2025-10-01 cs.CV cs.CY cs.LG 57%

Neglected Risks: The Disturbing Reality of Children's Images in Datasets and the Urgent Call for Accountability

Carlos Caetano, Gabriel O. dos Santos, Caio Petrucci, Artur Barros, Camila Laranjeira, Leo S. F. Ribeiro, Júlia F. de Mendonça, Jefersson A. dos Santos, Sandra Avila

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

Comments ACM Conference on Fairness, Accountability, and Transparency (FAccT 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26555 2025-10-01 cs.CV 50%

Stable Cinemetrics : Structured Taxonomy and Evaluation for Professional Video Generation

Agneet Chatterjee, Rahim Entezari, Maksym Zhuravinskyi, Maksim Lapin, Reshinth Adithyan, Amit Raj, Chitta Baral, Yezhou Yang, Varun Jampani

机构 * Stability AI Arizona State University(亚利桑那州立大学) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :language model(abstract)

Comments NeurIPS 2025. Project Page : https://stable-cinemetrics.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26208 2025-10-01 cs.CV 50%

TSalV360: A Method and Dataset for Text-driven Saliency Detection in 360-Degrees Videos

Ioannis Kontostathis, Evlampios Apostolidis, Vasileios Mezaris

机构 * IEEE CBMI 2025

专题命中 评测与基准 :language model(abstract)

Comments IEEE CBMI 2025. This is the authors' accepted version. The final publication is available at https://ieeexplore.ieee.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25894 2025-10-01 cs.SE 50%

Red Teaming Program Repair Agents: When Correct Patches can Hide Vulnerabilities

Simin Chen, Yixin He, Suman Jana, Baishakhi Ray

专题命中 评测与基准 :LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23519 2025-10-01 cs.CV 50%

BoundMatch: Boundary detection applied to semi-supervised segmentation

Haruya Ishikawa, Yoshimitsu Aoki

专题命中 评测与基准 :foundation model(abstract)

Comments 24 pages, 23 figures, to be published to IEEE Access

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 52 篇

2509.26497 2025-10-01 cs.CV 92%

Revealing the Power of Post-Training for Small Language Models via Knowledge Distillation

Miao Rang, Zhenni Bi, Hang Zhou, Hanting Chen, An Xiao, Tianyu Guo, Kai Han, Xinghao Chen, Yunhe Wang

专题命中 效率与部署 :language model(title,abstract);post-training(title,abstract);small language model(title);large language model(abstract)

Comments 7

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14017 2025-10-01 cs.CL cs.LG 90%

Efficient Temporal Tokenization for Mobility Prediction with Large Language Models

Haoyu He, Haozheng Luo, Yan Chen, Qi R. Wang

机构 * Northeastern University, Boston, MA(东北大学) Northwestern University, Evanston, IL(西北大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Journal ref Proceedings of the 3rd Workshop on Efficient Systems for Foundation Models (ES-FoMo III) at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25996 2025-10-01 cs.LG cs.CL 90%

CAST: Continuous and Differentiable Semi-Structured Sparsity-Aware Training for Large Language Models

Weiyu Huang, Yuezhou Hu, Jun Zhu, Jianfei Chen

机构 * Department of Computer Science and Technology, Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系、人工智能研究院、BNRist中心、THBI实验室、清华大学-博世联合机器学习中心、清华大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments Submitted to IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24218 2025-10-01 cs.LG cs.AI 90%

Conda: Column-Normalized Adam for Training Large Language Models Faster

Junjie Wang, Pan Zhou, Yiming Dong, Huan Li, Jia Li, Xun Zhou, Qicheng Lao, Cong Fang, Zhouchen Lin

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室,智能科学与技术学院,北京大学) Singapore Management University(新加坡国立大学) Nankai University(南开大学) Beijing Normal University(北京师范大学) ByteDance Seed(字节跳动种子) Beijing University of Posts and Telecommunications(北京邮电大学) Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) Pazhou Laboratory (Huangpu), Guangzhou, Guangdong, China(黄埔实验室(广州),广东,中国)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17391 2025-10-01 cs.CV cs.AI cs.CL 90%

LFTR: Learning-Free Token Reduction for Multimodal Large Language Models

Zihui Zhao, Yingxin Li, Yang Li

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26593 2025-10-01 cs.HC 89%

Exploring Large Language Model as an Interactive Sports Coach: Lessons from a Single-Subject Half Marathon Preparation

Kichang Lee

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 23 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04203 2025-10-01 cs.DC 89%

Cascadia: An Efficient Cascade Serving System for Large Language Models

Youhe Jiang, Fangcheng Fu, Wanru Zhao, Stephan Rabanser, Jintao Zhang, Nicholas D. Lane, Binhang Yuan

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏