arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-21 至 2025-10-21 共收录 356 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 75 篇

2510.16374 2025-10-21 cs.AI 61%

Before you <think>, monitor: Implementing Flavell's metacognitive framework in LLMs

Nick Oh

机构 * socius labs(socius实验室)

专题命中 推理与问题求解 :LLM(abstract,comments);分类 cs.AI

Comments Presented at the Workshop on the Application of LLM Explainability to Reasoning and Planning at COLM 2025 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16772 2025-10-21 cs.CV cs.AI 57%

Region in Context: Text-condition Image editing with Human-like semantic reasoning

Thuy Phuong Vu, Dinh-Cuong Hoang, Minhhuy Le, Phan Xuan Tan

机构 * Greenwich Vietnam FPT University(越南格林威治FPT大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14605 2025-10-21 cs.CV cs.AI 57%

Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering

Yuyang Hong, Jiaqi Gu, Qi Yang, Lubin Fan, Yue Wu, Ying Wang, Kun Ding, Shiming Xiang, Jieping Ye

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Alibaba Cloud Computing(阿里巴巴云计算)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16540 2025-10-21 cs.CV cs.AI 57%

Enhancing Compositional Reasoning in CLIP via Reconstruction and Alignment of Text Descriptions

Jihoon Kwon, Kyle Min, Jy-yong Sohn

机构 * Seoul National University(首尔国立大学) Oracle(Oracle公司) Yonsei University(延世大学) Intel Labs(英特尔实验室)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

Comments Accepted at NeurIPS 2025 (poster). This is the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16259 2025-10-21 cs.AI 57%

Distractor Injection Attacks on Large Reasoning Models: Characterization and Defense

Zhehao Zhang, Weijie Xu, Shixian Cui, Chandan K. Reddy

机构 * Amazon(亚马逊)

专题命中 推理与问题求解 :SFT(abstract);分类 cs.AI

Comments 29 pages, 9 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15948 2025-10-21 cs.AI cs.CR 57%

VisuoAlign: Safety Alignment of LVLMs with Multimodal Tree Search

MingSheng Li, Guangze Zhao, Sichen Liu

机构 * Independent Researcher(独立研究者) Harbin Institute of Technology(哈尔滨工业大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15895 2025-10-21 cs.HC cs.AI cs.SD 57%

BREATH: A Bio-Radar Embodied Agent for Tonal and Human-Aware Diffusion Music Generation

Yunzhe Wang, Xinyu Tang, Zhixun Huang, Xiaolong Yue, Yuxin Zeng

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

Comments Accepted by LLM4Music @ ISMIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17158 2025-10-21 cs.DC cs.PF cs.SE 50%

Integrating Performance Tools in Model Reasoning for GPU Kernel Optimization

Daniel Nichols, Konstantinos Parasyris, Charles Jekel, Abhinav Bhatele, Harshitha Menon

专题命中 推理与问题求解 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17034 2025-10-21 cs.CV 50%

Where, Not What: Compelling Video LLMs to Learn Geometric Causality for 3D-Grounding

Yutong Zhong

机构 * New York University(纽约大学)

专题命中 推理与问题求解 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02736 2025-10-21 cs.OS cs.SE 50%

AgentSight: System-Level Observability for AI Agents Using eBPF

Yusheng Zheng, Yanpeng Hu, Tong Yu, Andi Quinn

专题命中 推理与问题求解 :LLM(abstract)

Journal ref PACMI'2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 74 篇

2510.15899 2025-10-21 cs.AR cs.LG 91%

LLM-VeriPPA: Power, Performance, and Area Optimization aware Verilog Code Generation with Large Language Models

Kiran Thorat, Jiahui Zhao, Yaotian Liu, Amit Hasan, Hongwu Peng, Xi Xie, Bin Lei, Caiwen Ding

机构 * Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13472 2025-10-21 cs.SE cs.AI cs.CL cs.LG 90%

CodeVisionary: An Agent-based Framework for Evaluating Large Language Models in Code Generation

Xinchen Wang, Pengfei Gao, Chao Peng, Ruida Hu, Cuiyun Gao

机构 * Harbin Institute of Technology(哈尔滨工业大学) ByteDance(字节跳动)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16579 2025-10-21 cs.SE 90%

Human-Aligned Code Readability Assessment with Large Language Models

Wendkûuni C. Ouédraogo, Yinghua Li, Xueqi Dang, Pawel Borsukiewicz, Xin Zhou, Anil Koyuncu, Jacques Klein, David Lo, Tegawendé F. Bissyandé

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09702 2025-10-21 cs.CL cs.AI cs.HC 90%

Creativity Benchmark: A benchmark for marketing creativity for large language models

Ninad Bhat, Kieran Browne, Pip Bingemann

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 30 Pages, 14 figures. Fixed typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21148 2025-10-21 cs.CL cs.AI 90%

A Survey of Scientific Large Language Models: From Data Foundations to Agent Frontiers

Ming Hu, Chenglong Ma, Wei Li, Wanghan Xu, Jiamin Wu, Jucheng Hu, Tianbin Li, Guohang Zhuang, Jiaqi Liu, Yingzhou Lu, Ying Chen, Chaoyang Zhang, Cheng Tan, Jie Ying, Guocheng Wu, Shujian Gao, Pengcheng Chen, Jiashi Lin, Haitao Wu, Lulu Chen, Fengxiang Wang, Yuanyuan Zhang, Xiangyu Zhao, Feilong Tang, Encheng Su, Junzhi Ning, Xinyao Liu, Ye Du, Changkai Ji, Pengfei Jiang, Cheng Tang, Ziyan Huang, Jiyao Liu, Jiaqi Wei, Yuejin Yang, Xiang Zhang, Guangshuai Wang, Yue Yang, Huihui Xu, Ziyang Chen, Yizhou Wang, Chen Tang, Jianyu Wu, Yuchen Ren, Siyuan Yan, Zhonghua Wang, Zhongxing Xu, Shiyan Su, Shangquan Sun, Runkai Zhao, Zhisheng Zhang, Dingkang Yang, Jinjie Wei, Jiaqi Wang, Jiahao Xu, Jiangtao Yan, Wenhao Tang, Hongze Zhu, Yu Liu, Fudi Wang, Yiqing Shen, Yuanfeng Ji, Yanzhou Su, Tong Xie, Hongming Shan, Chun-Mei Feng, Zhi Hou, Diping Song, Lihao Liu, Yanyan Huang, Lequan Yu, Bin Fu, Shujun Wang, Xiaomeng Li, Xiaowei Hu, Yun Gu, Ben Fei, Benyou Wang, Yuewen Cao, Minjie Shen, Jie Xu, Haodong Duan, Fang Yan, Hongxia Hao, Jielan Li, Jiajun Du, Yanbo Wang, Imran Razzak, Zhongying Deng, Chi Zhang, Lijun Wu, Conghui He, Zhaohui Lu, Jinhai Huang, Wenqi Shao, Yihao Liu, Siqi Luo, Yi Xin, Xiaohong Liu, Fenghua Ling, Yuqiang Li, Aoran Wang, Siqi Sun, Qihao Zheng, Nanqing Dong, Tianfan Fu, Dongzhan Zhou, Yan Lu, Wenlong Zhang, Jin Ye, Jianfei Cai, Yirong Chen, Wanli Ouyang, Yu Qiao, Zongyuan Ge, Shixiang Tang, Junjun He, Chunfeng Song, Lei Bai, Bowen Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17146 2025-10-21 cs.AI cs.CE 89%

Physics-Informed Large Language Models for HVAC Anomaly Detection with Autonomous Rule Generation

Subin Lin, Chuanbo Hua

机构 * Department of the Built Environment(环境学院) National University of Singapore(新加坡国立大学) InnoCore PRISM-AI KAIST(韩国科学技术院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments NeurIPS 2025 Workshop of UrbanAI (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05289 2025-10-21 cs.SE 89%

Measuring how changes in code readability attributes affect code quality evaluation by Large Language Models

Igor Regis da Silva Simoes, Elaine Venson

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Journal ref 2025: Proceedings of the XXXIX Brazilian Symposium on Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12325 2025-10-21 cs.CL cs.AI cs.SI 88%

LLMTaxo: Leveraging Large Language Models for Constructing Taxonomy of Factual Claims from Social Media

Haiqi Zhang, Zhengyuan Zhu, Zeyu Zhang, Chengkai Li

机构 * University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16057 2025-10-21 cs.CL cs.AI 88%

Fusion-Augmented Large Language Models: Boosting Diagnostic Trustworthiness via Model Consensus

Md Kamrul Siam, Md Jobair Hossain Faruk, Jerry Q. Cheng, Huanying Gu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 7 pages (Accepted to IEEE BHI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16943 2025-10-21 cs.LG cs.AI cs.CL 88%

Peering Inside the Black Box: Uncovering LLM Errors in Optimization Modelling through Component-Level Evaluation

Dania Refai, Moataz Ahmed

机构 * Computer Science Department, KFUPM, Dhahran 31261, Saudi Arabia SDAIA-KFUPM Joint Research Center for Artificial Intelligence, King Fahd University of Petroleum \& Minerals, Dhahran, 31261, Saudi Arabia

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17460 2025-10-21 cs.CL 88%

Evaluating Large Language Models on Urdu Idiom Translation

Muhammad Farmal Khan, Mousumi Akter

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17301 2025-10-21 cs.DB cs.AI 88%

Comprehending Spatio-temporal Data via Cinematic Storytelling using Large Language Models

Panos Kalnis. Shuo Shang, Christian S. Jensen

机构 * King Abdullah University of Science and Technology (KAUST)(卡塔尔国王 Abdullah 科学与技术大学) University of Electronic Science and Technology of China (UESTC)(中国电子科学与技术大学) Aalborg University(奥尔堡大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 5 pages

Journal ref SSTD '25: Proceedings of the 19th International Symposium on Spatial and Temporal Data, Pages 12,26, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15973 2025-10-21 cs.CR cs.AI cs.CY 88%

Safeguarding Efficacy in Large Language Models: Evaluating Resistance to Human-Written and Algorithmic Adversarial Prompts

Tiarnaigh Downey-Webb, Olamide Jogunola, Oluwaseun Ajao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 10 pages, 4 pages manuscript submitted to the Language Resources and Evaluation Conference (LREC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16779 2025-10-21 cs.SE 88%

QuanBench: Benchmarking Quantum Code Generation with Large Language Models

Xiaoyu Guo, Minggu Wang, Jianjun Zhao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments This paper was accepted by ASE2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00003 2025-10-21 cs.CV 88%

Large Language Model-Guided Semantic Alignment for Human Activity Recognition

Hua Yan, Heng Tan, Yi Ding, Pengfei Zhou, Vinod Namboodiri, Yu Yang

机构 * Lehigh University(莱维理工大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Pittsburgh(匹兹堡大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15594 2025-10-21 cs.CL cs.AI 87%

A Survey on LLM-as-a-Judge

Jiawei Gu, Xuhui Jiang, Zhichao Shi, Hexiang Tan, Xuehao Zhai, Chengjin Xu, Wei Li, Yinghan Shen, Shengjie Ma, Honghao Liu, Saizhuo Wang, Kun Zhang, Yuanzhuo Wang, Wen Gao, Lionel Ni, Jian Guo

机构 * IDEA Research, International Digital Economy Academy(IDEA研究机构,国际数字经济学院) Sun Yat-sen University(孙中山大学) DataArc Tech Ltd(DataArc技术有限公司) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Department of Civil and Environmental Engineering, Imperial College London(伦敦帝国理工学院土木与环境工程系) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学硅谷人工智能学院) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Department of Computer Science and Technology, Peking University(北京大学计算机科学与技术系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Project Page: https://awesome-llm-as-a-judge.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13499 2025-10-21 cs.CL cs.AI 86%

ConsintBench: Evaluating Language Models on Real-World Consumer Intent Understanding

Xiaozhe Li, TianYi Lyu, Siyi Yang, Yuxi Gong, Yizhao Yang, Jinxuan Huang, Ligao Zhang, Zhuoyi Huang, Qingwen Liu

机构 * Tongji University(同济大学) Stanford University(斯坦福大学) Currents AI

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05909 2025-10-21 cs.AI 86%

Optimizing for Persuasion Improves LLM Generalization: Evidence from Quality-Diversity Evolution of Debate Strategies

Aksel Joonas Reedi, Corentin Léger, Julien Pourcel, Loris Gaven, Perrine Charriau, Guillaume Pourcel

机构 * University of Groningen(格罗宁根大学) Inria, Flowers team(法国国家信息与自动化研究所,Flowers团队)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Open-source code available at https://github.com/flowersteam/llm_persuasion

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17698 2025-10-21 cs.CL 85%

Towards Mining Effective Pedagogical Strategies from Learner-LLM Educational Dialogues

Liqun He, Manolis Mavrikis, Mutlu Cukurova

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17491 2025-10-21 cs.CL 85%

Empowering Real-World: A Survey on the Technology, Practice, and Evaluation of LLM-driven Industry Agents

Yihong Tang, Kehai Chen, Liang Yue, Jinxin Fan, Caishen Zhou, Xiaoguang Li, Yuyang Zhang, Mingming Zhao, Shixiong Kai, Kaiyang Guo, Xingshan Zeng, Wenjing Cun, Lifeng Shang, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen, China(计算机科学与技术学院,哈尔滨工业大学,深圳,中国) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏