arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-28 至 2025-10-28 共收录 412 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 71 篇

2507.00971 2025-10-28 cs.LG cs.AI 73%

Reasoning as an Adaptive Defense for Safety

Taeyoun Kim, Fahim Tajwar, Aditi Raghunathan, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(abstract);SFT(abstract);分类 cs.AI、cs.LG

Comments 44 pages, 10 Figures, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22371 2025-10-28 cs.AI cs.CL 73%

Reasoning Models Reason Well, Until They Don't

Revanth Rameshkumar, Jimson Huang, Yunxin Sun, Fei Xia, Abulhair Saparov

机构 * University of Washington(华盛顿大学) Purdue University(普渡大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07830 2025-10-28 cs.CL cs.AI cs.SI 73%

MOSAIC: Modeling Social AI for Content Dissemination and Regulation in Multi-Agent Simulations

Genglin Liu, Vivian Le, Salman Rahman, Elisa Kreiss, Marzyeh Ghassemi, Saadia Gabriel

机构 * University of California, Los Angeles(加州大学洛杉矶分校) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 推理与问题求解 :LLM(abstract);language agent(abstract);分类 cs.CL、cs.AI

Comments Accepted into EMNLP 2025 Main Conference, Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23393 2025-10-28 cs.LG 70%

The Best of N Worlds: Aligning Reinforcement Learning with Best-of-N Sampling via max@k Optimisation

Farid Bagirov, Mikhail Arkhipov, Ksenia Sycheva, Evgeniy Glukhov, Egor Bogomolov

机构 * JetBrains Research(JetBrains研究)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22728 2025-10-28 cs.LG cs.CV 70%

S-Chain: Structured Visual Chain-of-Thought For Medicine

Khai Le-Duc, Duy M. H. Nguyen, Phuong T. H. Trinh, Tien-Phat Nguyen, Nghiem T. Diep, An Ngo, Tung Vu, Trinh Vuong, Anh-Tien Nguyen, Mau Nguyen, Van Trung Hoang, Khai-Nguyen Nguyen, Hy Nguyen, Chris Ngo, Anji Liu, Nhat Ho, Anne-Christin Hauschild, Khanh Xuan Nguyen, Thanh Nguyen-Tang, Pengtao Xie, Daniel Sonntag, James Zou, Mathias Niepert, Anh Totti Nguyen

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.LG

Comments First version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15566 2025-10-28 cs.CV cs.AI 70%

BTL-UI: Blink-Think-Link Reasoning Model for GUI Agent

Shaojie Zhang, Ruoceng Zhang, Pei Fu, Shaokang Wang, Jiahui Yang, Xin Du, Shiqi Cui, Bin Qin, Ying Huang, Zhenbo Luo, Jian Luan

机构 * Xiaomi Inc(小米公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06937 2025-10-28 cs.CV cs.AI 70%

CannyEdit: Selective Canny Control and Dual-Prompt Guidance for Training-Free Image Editing

Weiyan Xie, Han Gao, Didan Deng, Kaican Li, April Hua Liu, Yongxiang Huang, Nevin L. Zhang

专题命中 推理与问题求解 :language model(abstract);foundation model(abstract);分类 cs.AI

Comments Project Page: vaynexie.github.io/CannyEdit/; MindSpore Code: github.com/mindspore-lab/mindone/tree/master/examples/canny_edit; PyTorch Code: github.com/vaynexie/CannyEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22132 2025-10-28 cs.AI 70%

Controllable Mathematical Reasoning via Self-Optimizing Thought Vectors

Xuying LI

机构 * Kepler(开普勒)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21853 2025-10-28 cs.CL 70%

Policy Optimization Prefers The Path of Least Resistance

Debdeep Sanyal, Aakash Sen Sharma, Dhruv Kumar, Saurabh Deshpande, Murari Mandal

机构 * Birla AI Labs(Birla人工智能实验室) InvideoAI BITS Pilani(比斯·皮尔尼学院) Kalinga Institute of Industrial Technology(卡林加工业技术学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 21 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21807 2025-10-28 cs.CV cs.AI 70%

Activating Visual Context and Commonsense Reasoning through Masked Prediction in VLMs

Jiaao Yu, Shenwei Li, Mingjie Han, Yifei Yin, Wenzheng Song, Chenghao Jia, Man Lan

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12712 2025-10-28 cs.CV cs.AI 70%

Beyond Seeing: Evaluating Multimodal LLMs on Tool-Enabled Image Perception, Transformation, and Reasoning

Xingang Guo, Utkarsh Tyagi, Advait Gosai, Paula Vergara, Jayeon Park, Ernesto Gabriel Hernández Montoya, Chen Bo Calvin Zhang, Bin Hu, Yunzhong He, Bing Liu, Rakshith Sharma Srinivasa

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07458 2025-10-28 cs.CL 70%

Populism Meets AI: Advancing Populism Research with LLMs

Yujin J. Jung, Eduardo Ryô Tamaki, Julia Chatterley, Grant Mitchell, Semir Dzebo, Cristóbal Sandoval, Levente Littvay, Kirk A. Hawkins

机构 * Mount St. Mary’s University(圣玛丽大学) German Institute for Global and Area Studies(全球与区域研究所) Princeton University(普林斯顿大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Oxford(牛津大学) Diego Portales University(迪埃戈·波尔塔尔大学) ELTE Centre for Social Sciences(埃尔泰社会科学中心) Brigham Young University(Brigham Young 大学)

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.CL

Comments 27 pages, 3 figures. Preprint version under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17124 2025-10-28 cs.AI 70%

When Can Model-Free Reinforcement Learning be Enough for Thinking?

Josiah P. Hanna, Nicholas E. Corrado

机构 * Computer Sciences Department University of Wisconsin – Madison(威斯康星大学麦迪逊分校计算机科学系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 26 pages, 4 figures, Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05795 2025-10-28 physics.ed-ph 67%

Creating a customisable Socratic AI physics tutor

Eugenio Tufino, Bor Gregorcic

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

Comments 7 pages, 3 figures

Journal ref Phys. Educ. 60 065037 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23449 2025-10-28 cs.MM cs.CV cs.IR 67%

CMIE: Combining MLLM Insights with External Evidence for Explainable Out-of-Context Misinformation Detection

Fanxiao Li, Jiaying Wu, Canyuan He, Wei Zhou

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院) National University of Singapore(新加坡国立大学) Engineering Research Center of Cyberspace, Yunnan University(云南大学网络空间研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19549 2025-10-28 cs.CV 67%

DEEMO: De-identity Multimodal Emotion Recognition and Reasoning

Deng Li, Bohao Xing, Xin Liu, Baiqiang Xia, Bihan Wen, Heikki Kälviäinen

机构 * Lappeenranta-Lahti University of Technology LUT(拉普兰塔-拉赫蒂技术大学) Nanyang Technological University(南洋理工大学) Brno University of Technology(布拉格技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

Comments Accepted by ACMMM 2025

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22729 2025-10-28 cs.AI cs.CL 62%

Critical Insights into Leading Conversational AI Models

Urja Kohli, Aditi Singh, Arun Sharma

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

Comments 21 pages, 7 tables, 3 figures. Open-access preprint intended for journal or conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10635 2025-10-28 cs.CV cs.AI cs.LG 62%

A Frustratingly Simple Yet Highly Effective Attack Baseline: Over 90% Success Rate Against the Strong Black-box Models of GPT-4.5/4o/o1

Zhaoyi Li, Xiaohan Zhao, Dong-Dong Wu, Jiacheng Cui, Zhiqiang Shen

机构 * VILA Lab, Department of Machine Learning, MBZUAI(VILA实验室,机器学习系,MBZUAI)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025. Code at: https://github.com/VILA-Lab/M-Attack

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23482 2025-10-28 cs.CV cs.AI 57%

On the Faithfulness of Visual Thinking: Measurement and Enhancement

Zujing Liu, Junwen Pan, Qi She, Yuan Gao, Guisong Xia

机构 * Wuhan University(武汉大学) ByteDance(字节跳动)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15510 2025-10-28 cs.CV cs.CL 57%

Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought

Zihui Cheng, Qiguang Chen, Xiao Xu, Jiaqi Wang, Weiyun Wang, Hao Fei, Yidong Wang, Alex Jinpeng Wang, Zhi Chen, Wanxiang Che, Libo Qin

机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Research Center for Social Computing and Interactive Robotics, Harbin Institute of Technology(哈尔滨工业大学社会计算与交互机器人研究中心) Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院计算与智能研究所) Text Computing and Cognitive Intelligence Ministry of Education Engineering Research Center, Guizhou University(贵州大学文字计算与认知智能教育部工程研究中心) Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) Peking University(北京大学) ByteDance Seed (China)(字节跳动种子(中国))

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

Comments Accepted at NeurIPS 2025;

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 88 篇

2402.04678 2025-10-28 cs.CL cs.AI cs.LG 90%

FaithLM: Towards Faithful Explanations for Large Language Models

Yu-Neng Chuang, Guanchu Wang, Chia-Yuan Chang, Ruixiang Tang, Shaochen Zhong, Fan Yang, Mengnan Du, Xuanting Cai, Vladimir Braverman, Xia Hu

机构 * Rice University(里士大学) Texas A&M University(德克萨斯农工大学) Wake Forest University(沃杰森林大学) New Jersey Institute of Technology(新泽西理工学院) John Hopkins University(约翰霍普金斯大学) Google Research(谷歌研究) Meta Platforms, Inc.(元宇宙平台公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22085 2025-10-28 cs.CR cs.AI cs.CL cs.LG 90%

Jailbreak Mimicry: Automated Discovery of Narrative-Based Jailbreaks for Large Language Models

Pavlos Ntais

机构 * University of Athens(雅典大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00515 2025-10-28 cs.CL cs.AI cs.SE 90%

A Survey on Large Language Models for Code Generation

Juyong Jiang, Fan Wang, Jiasi Shen, Sungju Kim, Sunghun Kim

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18936 2025-10-28 cs.IR cs.SE 89%

SBAN: A Framework & Multi-Dimensional Dataset for Large Language Model Pre-Training and Software Code Mining

Hamed Jelodar, Mohammad Meymani, Samita Bai, Roozbeh Razavi-Far, Ali A. Ghorbani

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23011 2025-10-28 cs.CL cs.CY 88%

LangLingual: A Personalised, Exercise-oriented English Language Learning Tool Leveraging Large Language Models

Sammriddh Gupta, Sonit Singh, Aditya Joshi, Mira Kim

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22614 2025-10-28 cs.SE cs.AI 88%

Does In-IDE Calibration of Large Language Models work at Scale?

Roham Koohestani, Agnia Sergeyuk, David Gros, Claudio Spiess, Sergey Titov, Prem Devanbu, Maliheh Izadi

机构 * Delft University of Technology(代尔夫特理工大学) JetBrains Research(JetBrains研究) University of California, Davis(加州大学戴维斯分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09424 2025-10-28 cs.CL 88%

DATE-LM: Benchmarking Data Attribution Evaluation for Large Language Models

Cathy Jiao, Yijun Pan, Emily Xiao, Daisy Sheng, Niket Jain, Hanzhang Zhao, Ishita Dasgupta, Jiaqi W. Ma, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) UIUC(伊利诺伊大学香槟分校)

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.CL

Comments NeurIPS 2025 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07246 2025-10-28 cs.LG cs.CV 88%

ChemVLM: Exploring the Power of Multimodal Large Language Models in Chemistry Area

Junxian Li, Di Zhang, Xunzhi Wang, Zeying Hao, Jingdi Lei, Qian Tan, Cai Zhou, Wei Liu, Yaotian Yang, Xinrui Xiong, Weiyun Wang, Zhe Chen, Wenhai Wang, Wei Li, Shufei Zhang, Mao Su, Wanli Ouyang, Yuqiang Li, Dongzhan Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

Comments 11 pages, updated version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23055 2025-10-28 cs.SE 88%

From Online User Feedback to Requirements: Evaluating Large Language Models for Classification and Specification Tasks

Manjeshwar Aniruddh Mallya, Alessio Ferrari, Mohammad Amin Zadenoori, Jacek Dąbrowski

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21076 2025-10-28 cs.CV 88%

DynamicVL: Benchmarking Multimodal Large Language Models for Dynamic City Understanding

Weihao Xuan, Junjue Wang, Heli Qi, Zihang Chen, Zhuo Zheng, Yanfei Zhong, Junshi Xia, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Waseda University(早稻田大学) Wuhan University(武汉大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏