arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-30 至 2025-09-30 共收录 512 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 95 篇

2509.24269 2025-09-30 cs.AI cs.CL 62%

AdvChain: Adversarial Chain-of-Thought Tuning for Robust Safety Alignment of Large Reasoning Models

Zihao Zhu, Xinyu Wu, Gehan Hu, Siwei Lyu, Ke Xu, Baoyuan Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) State University of New York at Buffalo(纽约州立大学布法罗分校) Huawei International, Singapore(新加坡华为国际)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24238 2025-09-30 cs.AI cs.CL 62%

Learning to Ponder: Adaptive Reasoning in Latent Space

Yixin He, Lumingyuan Tang

机构 * University of Southern California(南加州大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04695 2025-09-30 cs.LG cs.AI stat.ML 62%

Reshaping Reasoning in LLMs: A Theoretical Analysis of RL Training Dynamics through Pattern Selection

Xingwu Chen, Tianle Li, Difan Zou

机构 * School of Computing & Data Science(计算与数据科学学院) Institute of Data Science(数据科学研究院) The University of Hong Kong(香港大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

Comments 28 pages, 5 figures, 2 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15895 2025-09-30 cs.CL cs.AI 62%

Dynamic Early Exit in Reasoning Models

Chenxu Yang, Qingyi Si, Yongjie Duan, Zheliang Zhu, Chenyu Zhu, Qiaowei Li, Minghui Chen, Zheng Lin, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

Comments 41 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24884 2025-09-30 cs.CL 57%

Expanding Computation Spaces of LLMs at Inference Time

Yoonna Jang, Kisu Yang, Isabelle Augenstein

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24127 2025-09-30 cs.AI cs.DB 57%

Transparent, Evaluable, and Accessible Data Agents: A Proof-of-Concept Framework

Nooshin Bahador

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23789 2025-09-30 cs.LG cs.CR 57%

Visual CoT Makes VLMs Smarter but More Fragile

Chunxue Xu, Yiwei Wang, Yujun Cai, Bryan Hooi, Songze Li

机构 * Southeast University, China(东南大学) University of California, Merced, USA(加州大学梅德福分校) The University of Queensland, Australia(昆士兰大学) National University of Singapore, Singapore(新加坡国立大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23746 2025-09-30 cs.CV cs.AI 57%

Poivre: Self-Refining Visual Pointing with Reinforcement Learning

Wenjie Yang, Zengfeng Huang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24786 2025-09-30 cs.CV 50%

LOVE-R1: Advancing Long Video Understanding with an Adaptive Zoom-in Mechanism via Multi-Step Reasoning

Shenghao Fu, Qize Yang, Yuan-Ming Li, Xihan Wei, Xiaohua Xie, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) Tongyi Lab, Alibaba Group(阿里巴巴集团 Tongyi 实验室) Peng Cheng Laboratory, China(鹏城实验室) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部机器智能与先进计算重点实验室) Guangdong Province Key Laboratory of Information Security Technology, China(广东省信息安全技术重点实验室) Pazhou Laboratory (Huangpu), China(琶洲实验室(黄埔))

专题命中 推理与问题求解 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24321 2025-09-30 cs.RO 50%

SONAR: Semantic-Object Navigation with Aggregated Reasoning through a Cross-Modal Inference Paradigm

Yao Wang, Zhirui Sun, Wenzheng Chi, Baozhi Jia, Wenjun Xu, Jiankun Wang

机构 * Shenzhen Key Laboratory of Robotics Perception and Intelligence(机器人感知与智能深圳重点实验室) Department of Electronic and Electrical Engineering(电子与电气工程系) Southern University of Science and Technology(南方科技大学) Research Institute of Multiple Agents and Embodied Intelligence(多智能体与具身智能研究院) Peng Cheng Laboratory(鹏城实验室) Robotics and Microsystems Center(机器人与微系统中心) School of Mechanical and Electric Engineering(机械与电子工程学院) Soochow University(苏州大学) Xiamen Key Laboratory of Visual Perception Technology and Application(视觉感知技术与应用厦门重点实验室) Reconova Information Technology Co., Ltd.(Reconova信息技术有限公司)

专题命中 推理与问题求解 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08052 2025-09-30 cs.CV cs.RO 50%

ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving

Yongkang Li, Kaixin Xiong, Xiangyu Guo, Fang Li, Sixu Yan, Gangwei Xu, Lijun Zhou, Long Chen, Haiyang Sun, Bing Wang, Kun Ma, Guang Chen, Hangjun Ye, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米电动车)

专题命中 推理与问题求解 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13888 2025-09-30 cs.RO 50%

InSpire: Vision-Language-Action Models with Intrinsic Spatial Reasoning

Ji Zhang, Shihan Wu, Xu Luo, Hao Wu, Lianli Gao, Heng Tao Shen, Jingkuan Song

机构 * Southwest Jiaotong University(西南交通大学) University of Electronic Science and Technology of China(电子科技大学) Tongji University(同济大学)

专题命中 推理与问题求解 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01563 2025-09-30 cs.RO 50%

Hierarchical Intention-Aware Expressive Motion Generation for Humanoid Robots

Lingfan Bao, Yan Pan, Tianhu Peng, Dimitrios Kanoulas, Chengxu Zhou

机构 * Department of Computer Science, University College London(计算机科学系,伦敦大学学院)

专题命中 推理与问题求解 :prompting(abstract)

Comments 7 pages, 2 figures, IEEE conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 114 篇

2508.19475 2025-09-30 cs.CL cs.AI 90%

Automatic Question & Answer Generation Using Generative Large Language Model (LLM)

Md. Alvee Ehsan, A. S. M Mehedi Hasan, Kefaya Benta Shahnoor, Syeda Sumaiya Tasneem

专题命中 评测与基准 :LLM(title,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13958 2025-09-30 cs.CL cs.AI cs.IR 90%

A Survey of Graph Retrieval-Augmented Generation for Customized Large Language Models

Qinggang Zhang, Shengyuan Chen, Yuanchen Bei, Zheng Yuan, Huachi Zhou, Zijin Hong, Hao Chen, Yilin Xiao, Chuang Zhou, Junnan Dong, Yi Chang, Xiao Huang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05601 2025-09-30 cs.CL cs.LG cs.SE 90%

Exploring Large Language Models for Translating Romanian Computational Problems into English

Adrian Marius Dumitran, Adrian-Catalin Badea, Stefan-Gabriel Muscalu, Angela-Liliana Dumitran, Stefan-Cosmin Dascalescu, Radu-Sebastian Amarie

机构 * University of Bucharest(布加勒斯特大学) Softbinator UiPath It Just Works Inc. QPillars

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23350 2025-09-30 cs.SD cs.AI 89%

ABC-Eval: Benchmarking Large Language Models on Symbolic Music Understanding and Instruction Following

Jiahao Zhao, Yunjia Li, Wei Li, Kazuyoshi Yoshii

机构 * Graduate School of Informatics, Kyoto University, Japan(京都大学信息科学研究生院) College of Computer Science and Artificial Intelligence, Fudan University, China(复旦大学计算机科学与人工智能学院) Graduate School of Engineering, Kyoto University, Japan(京都大学工学研究科)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23061 2025-09-30 cs.PL cs.AI 89%

Local Success Does Not Compose: Benchmarking Large Language Models for Compositional Formal Verification

Xu Xu, Xin Li, Xingwei Qu, Jie Fu, Binhang Yuan

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23970 2025-09-30 cs.CR 89%

Binary Diff Summarization using Large Language Models

Meet Udeshi, Venkata Sai Charan Putrevu, Prashanth Krishnamurthy, Prashant Anantharaman, Sean Carrick, Ramesh Karri, Farshad Khorrami

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22703 2025-09-30 cs.CL cs.AI cs.CY 88%

AccessEval: Benchmarking Disability Bias in Large Language Models

Srikant Panda, Amit Agarwal, Hitesh Laxmichand Patel

机构 * Oracle AI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24888 2025-09-30 cs.CV cs.CL 88%

MMRQA: Signal-Enhanced Multimodal Large Language Models for MRI Quality Assessment

Fankai Jia, Daisong Gan, Zhe Zhang, Zhaochi Wen, Chenchen Dan, Dong Liang, Haifeng Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) ShanghaiTech University(上海理工大学) Southern University of Science and Technology(南方科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23579 2025-09-30 cs.CL 88%

Jackal: A Real-World Execution-Based Benchmark Evaluating Large Language Models on Text-to-JQL Tasks

Kevin Frank, Anmol Gulati, Elias Lumer, Sindy Campagna, Vamse Kumar Subbiah

机构 * PricewaterhouseCoopers(普华永道)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02648 2025-09-30 cs.AI 88%

Truly Assessing Fluid Intelligence of Large Language Models through Dynamic Reasoning Evaluation

Yue Yang, MingKang Chen, Qihua Liu, Mengkang Hu, Qiguang Chen, Gengrui Zhang, Shuyue Hu, Guangtao Zhai, Yu Qiao, Yu Wang, Wenqi Shao, Ping Luo

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) The University of Hong Kong(香港大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24782 2025-09-30 cs.SE 88%

Large language models for behavioral modeling: A literature survey

Muhammad Laiq

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22376 2025-09-30 cs.LG cs.AI cs.CL cs.CV 87%

Rare-to-Frequent: Unlocking Compositional Generation Power of Diffusion Models on Rare Concepts with LLM Guidance

Dongmin Park, Sebin Kim, Taehong Moon, Minkyu Kim, Kangwook Lee, Jaewoong Cho

机构 * KRAFTON Seoul National University(首尔国立大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2025 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16594 2025-09-30 cs.AI cs.CL 86%

From Generation to Judgment: Opportunities and Challenges of LLM-as-a-judge

Dawei Li, Bohan Jiang, Liangjie Huang, Alimohammad Beigi, Chengshuai Zhao, Zhen Tan, Amrita Bhattacharjee, Yuxuan Jiang, Canyu Chen, Tianhao Wu, Kai Shu, Lu Cheng, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Northwestern University(西北大学) University of California, Berkeley(加州大学伯克利分校) Emory University(埃默里大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23515 2025-09-30 cs.CL cs.AI 86%

From Human Annotation to Automation: LLM-in-the-Loop Active Learning for Arabic Sentiment Analysis

Dania Refai, Alaa Dalaq, Doaa Dalaq, Irfan Ahmad

机构 * Information and Computer Science Department, KFUPM, Dhahran 31261, Saudi Arabia(信息与计算机科学系,KFUPM,沙特阿拉伯达哈兰)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22715 2025-09-30 cs.CL cs.AI 86%

TRUEBench: Can LLM Response Meet Real-world Constraints as Productivity Assistant?

Jiho Park, Jongyoon Song, Minjin Choi, Kyuho Heo, Taehun Huh, Ji Won Kim

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25154 2025-09-30 cs.AI 85%

Who's Your Judge? On the Detectability of LLM-Generated Judgments

Dawei Li, Zhen Tan, Chengshuai Zhao, Bohan Jiang, Baixiang Huang, Pingchuan Ma, Abdullah Alnaibari, Kai Shu, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) Emory University(埃默里大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04952 2025-09-30 cs.CL cs.SE 85%

ArtifactsBench: Bridging the Visual-Interactive Gap in LLM Code Generation Evaluation

Chenchen Zhang, Yuhang Li, Can Xu, Jiaheng Liu, Ao Liu, Changzhi Zhou, Ken Deng, Dengpeng Wu, Guanhua Huang, Kejiao Li, Qi Yi, Ruibin Xiong, Shihui Hu, Yue Zhang, Yuhao Jiang, Zenan Xu, Yuanxing Zhang, Wiggin Zhou, Chayse Zhou, Fengzong Lian

机构 * Tencent Hunyuan Team(腾讯文脉团队)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏