arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-22 至 2025-09-22 共收录 202 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 31 篇

2410.11900 2025-09-22 cs.AI cs.CL cs.LG cs.LO 83%

FLARE: Faithful Logic-Aided Reasoning and Exploration

Erik Arakelyan, Pasquale Minervini, Pat Verga, Patrick Lewis, Isabelle Augenstein

机构 * University of Copenhagen(哥本哈根大学) University of Edinburgh(爱丁堡大学) Cohere NVIDIA

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Published at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14815 2025-09-22 cs.CL 79%

Language Mixing in Reasoning Language Models: Patterns, Impact, and Internal Causes

Mingyang Wang, Lukas Lange, Heike Adel, Yunpu Ma, Jannik Strötgen, Hinrich Schütze

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20587 2025-09-22 cs.LG 79%

Cache-of-Thought: Master-Apprentice Framework for Cost-Effective Vision Language Model Reasoning

Mingyuan Wu, Jize Jiang, Haozhen Zheng, Meitang Li, Zhaoheng Li, Beitong Tian, Bo Chen, Yongjoo Park, Minjia Zhang, Chengxiang Zhai, Klara Nahrstedt

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan Ann Arbor(密歇根大学安娜堡分校)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.LG

Comments EMNLP 2025 Main Conference. Mingyuan, Jize, and Haozhen contributed equally, while Minjia, Chengxiang, and Klara advised equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11759 2025-09-22 cs.RO cs.AI cs.CL 79%

Using Natural Language for Human-Robot Collaboration in the Real World

Peter Lindes, Kaoutar Skiker

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 34 pages, 11 figures, 5 tables. Submitted for publication (2026) in W.F. Lawless, Ranjeev Mittu, Shannon P. McGrarry, & Marco Brambilla (Eds.), Generative AI Risks and Benefits within Human-Machine Teams, Elsevier, Chapter 6

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11277 2025-09-22 cs.CL cs.AI 79%

Search and Refine During Think: Facilitating Knowledge Refinement for Improved Retrieval-Augmented Reasoning

Yaorui Shi, Sihang Li, Chang Wu, Zhiyuan Liu, Junfeng Fang, Hengxing Cai, An Zhang, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) DP Technology(DP技术)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15772 2025-09-22 cs.CV 78%

Vision-Language Models as Differentiable Semantic and Spatial Rewards for Text-to-3D Generation

Weimin Bai, Yubo Li, Weijian Luo, Wenzheng Chen, He Sun

机构 * Peking University(北京大学) Xiaohongshu Inc(小红书公司)

专题命中 推理与问题求解 :language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15739 2025-09-22 cs.CL 77%

Can LLMs Judge Debates? Evaluating Non-Linear Reasoning via Argumentation Theory Semantics

Reza Sanayei, Srdjan Vesic, Eduardo Blanco, Mihai Surdeanu

机构 * Department of Computer Science, University of Arizona(亚利桑那大学计算机科学系) CRIL CNRS & University of Artois(CNRS CRIL与阿维尼昂大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11426 2025-09-22 cs.GT econ.GN q-fin.EC 75%

Can AI with High Reasoning Ability Replicate Human-like Decision Making in Economic Experiments?

Ayato Kitadai, Sinndy Dayana Rico Lugo, Yudai Tsurusaki, Yusuke Fukasawa, Nariaki Nishino

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract)

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15279 2025-09-22 cs.LG cs.CL 73%

Fleming-R1: Toward Expert-Level Medical Reasoning via Reinforcement Learning

Chi Liu, Derek Li, Yan Shu, Robin Chen, Derek Duan, Teng Fang, Bryan Dai

机构 * Ubiquant

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23781 2025-09-22 cs.AI 70%

DebFlow: Automating Agent Creation via Agent Debate

Jinwei Su, Yinghui Xia, Yiqun Duan, Jun Du, Jianuo Huang, Tianyu Shi, Lewei He

机构 * School of Artificial Intelligence, South China Normal University(人工智能学院,华南师范大学) University of Toronto(多伦多大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15249 2025-09-22 cs.GR cs.AI 70%

Causal Reasoning Elicits Controllable 3D Scene Generation

Shen Chen, Ruiyu Zhao, Jiale Zhou, Zongkai Wu, Jenq-Neng Hwang, Lei Li

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16006 2025-09-22 cs.RO cs.HC 67%

Defining and Monitoring Complex Robot Activities via LLMs and Symbolic Reasoning

Francesco Argenziano, Elena Umili, Francesco Leotta, Daniele Nardi

机构 * Department of Computer, Automation and Management Engineering(计算机、自动化与管理工程系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15546 2025-09-22 cs.CV 67%

Enhancing Sa2VA for Referent Video Object Segmentation: 2nd Solution for 7th LSVOS RVOS Track

Ran Hong, Feng Lu, Leilei Cao, An Yan, Youhai Jiang, Fengjie Zhu

机构 * TEX AI, Transsion Holdings(TEX AI,Transsion Holdings) Nanchang University(南昌大学) ShanghaiTech University(上海科技大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15738 2025-09-22 cs.LG 57%

GUI-ReWalk: Massive Data Generation for GUI Agent via Stochastic Exploration and Intent-Aware Reasoning

Musen Lin, Minghao Liu, Taoran Lu, Lichen Yuan, Yiwei Liu, Haonan Xu, Yu Miao, Yuhao Chao, Zhaojian Li

机构 * ByteDance(字节跳动) UCAS(北京大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15572 2025-09-22 cs.CR 50%

Cuckoo Attack: Stealthy and Persistent Attacks Against AI-IDE

Xinpeng Liu, Junming Liu, Peiyu Liu, Han Zheng, Qinying Wang, Mathias Payer, Shouling Ji, Wenhai Wang

专题命中 推理与问题求解 :LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14967 2025-09-22 cs.RO cs.HC 50%

Affordance-Based Disambiguation of Surgical Instructions for Collaborative Robot-Assisted Surgery

Ana Davila, Jacinto Colan, Yasuhisa Hasegawa

机构 * Nagoya University, Japan(名古屋大学)

专题命中 推理与问题求解 :language model(abstract)

Comments To be presented at the 1st Workshop on Intelligent Cobodied Assistance and Robotic Empowerment (iCARE). 2025 Conference on Robot Learning (CoRL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13200 2025-09-22 cs.RO 50%

StageACT: Stage-Conditioned Imitation for Robust Humanoid Door Opening

Moonyoung Lee, Dong Ki Kim, Jai Krishna Bandi, Max Smith, Aileen Liao, Ali-akbar Agha-mohammadi, Shayegan Omidshafiei

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理与问题求解 :prompting(abstract)

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 37 篇

2509.15957 2025-09-22 cs.AI cs.CL cs.HC cs.IR 90%

EHR-MCP: Real-world Evaluation of Clinical Information Retrieval by Large Language Models via Model Context Protocol

Kanato Masayoshi, Masahiro Hashimoto, Ryoichi Yokoyama, Naoki Toda, Yoshifumi Uwamino, Shogo Fukuda, Ho Namkoong, Masahiro Jinzaki

机构 * Department of Radiology, Keio University Hospital, Tokyo, Japan(Keio大学医院放射科) Division of Infectious Diseases and Infection Control, Keio University Hospital, Tokyo, Japan(Keio大学医院感染病学与感染控制科)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18475 2025-09-22 cs.LG cs.AI 90%

A Survey of Large Language Models for Data Challenges in Graphs

Mengran Li, Pengyu Zhang, Wenbin Xing, Yijia Zheng, Klim Zaporojets, Junzhou Chen, Ronghui Zhang, Yong Zhang, Siyuan Gong, Jia Hu, Xiaolei Ma, Zhiyuan Liu, Paul Groth, Marcel Worring

机构 * Guangdong Key Laboratory of Intelligent Transportation System, School of Intelligent Systems Engineering, Shenzhen Campus of Sun Yat-sen University(广东智能交通系统重点实验室,智能系统工程学院,中山大学深圳校区) University of Amsterdam(阿姆斯特丹大学) Aarhus University(阿arhus大学) Beijing Institute of Artificial Intelligence, Beijing University of Technology(北京人工智能研究院,北京工业大学) School of Information and Engineering, Chang’an University(信息工程学院,长安大学) Key Laboratory of Road and Traffic Engineering of the Ministry of Education, Tongji University(交通工程教育部长实验室,同济大学) Key Laboratory of Intelligent Transportation Technology and System, School of Transportation Science and Engineering, Beihang University(智能交通技术与系统重点实验室,交通运输科学与工程学院,北航) Jiangsu Key Laboratory of Urban ITS, Jiangsu Province Collaborative Innovation Center of Modern Urban Traffic Technologies, School of Transportation, Southeast University(江苏城市ITS重点实验室,江苏省现代城市交通技术协同创新中心,交通学院,东南大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

Comments Accepted by Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07973 2025-09-22 cs.CR 89%

Unique Security and Privacy Threats of Large Language Models: A Comprehensive Survey

Shang Wang, Tianqing Zhu, Bo Liu, Ming Ding, Dayong Ye, Wanlei Zhou, Philip S. Yu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 35 pages, 9 tables, 12 figures. To appear in ACM Computing Surveys (CSUR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07584 2025-09-22 cs.CR 88%

SecReEvalBench: A Multi-turned Security Resilience Evaluation Benchmark for Large Language Models

Huining Cui, Wei Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments Major rework on the paper that changes the title, content, experiments, story, and etc. All authors agree to withdraw

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12158 2025-09-22 cs.CL 87%

A Rigorous Evaluation of LLM Data Generation Strategies for Low-Resource Languages

Tatiana Anikina, Jan Cegin, Jakub Simko, Simon Ostermann

机构 * German Research Institute for Artificial Intelligence (DFKI)(德国人工智能研究所) Faculty of Information Technology, Brno University of Technology(信息科技学院,布拉格技术大学) Kempelen Institute of Intelligent Technologies(智能技术研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted to EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10179 2025-09-22 cs.CL cs.AI 86%

Benchmark of stylistic variation in LLM-generated texts

Jiří Milička, Anna Marklová, Václav Cvrček

机构 * Department of Linguistics, Faculty of Arts, Charles University(语言学系,艺术学院,查尔斯大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Data and scripts: https://osf.io/hs7xt/. Interactive charts: https://www.korpus.cz/stylisticbenchmark/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00032 2025-09-22 cs.CL cs.AI 86%

KatFishNet: Detecting LLM-Generated Korean Text through Linguistic Feature Analysis

Shinwoo Park, Shubin Kim, Do-Kyung Kim, Yo-Sub Han

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15356 2025-09-22 cs.LG 86%

Predicting Language Models' Success at Zero-Shot Probabilistic Prediction

Kevin Ren, Santiago Cortes-Gomez, Carlos Miguel Patiño, Ananya Joshi, Ruiqi Lyu, Jingjing Tang, Alistair Turcan, Khurram Yamin, Steven Wu, Bryan Wilder

机构 * Cornell Tech(康奈尔科技) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,comments);large language model(abstract);分类 cs.LG

Comments EMNLP Findings 2025. We release our code at: camera-ready" target="_blank" rel="noopener">https://github.com/kkr36/llm-eval/tree/camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09407 2025-09-22 cs.CL cs.HC 85%

UXAgent: A System for Simulating Usability Testing of Web Design with LLM Agents

Yuxuan Lu, Bingsheng Yao, Hansu Gu, Jing Huang, Jessie Wang, Yang Li, Jiri Gesi, Qi He, Toby Jia-Jun Li, Dakuo Wang

机构 * Northeastern University(东北大学) Amazon(亚马逊) University of Notre Dame(诺特尔大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13638 2025-09-22 cs.CV cs.AI 83%

DualEdit: Dual Editing for Knowledge Updating in Vision-Language Models

Zhiyi Shi, Binjie Wang, Chongjie Si, Yichen Wu, Junsik Kim, Hanspeter Pfister

机构 * Harvard University(哈佛大学) City University of Hong Kong(香港城市大学) Amazon(亚马逊) Fudan University(复旦大学) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能关键实验室,上海交通大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.AI

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16107 2025-09-22 cs.CL 81%

It Depends: Resolving Referential Ambiguity in Minimal Contexts with Commonsense Knowledge

Lukas Ellinger, Georg Groh

机构 * School for Computation, Information and Technology(计算、信息与技术学院) Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments Accepted by UncertaiNLP workshop @ EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15239 2025-09-22 cs.CL 81%

WangchanThaiInstruct: An instruction-following Dataset for Culture-Aware, Multitask, and Multi-domain Evaluation in Thai

Peerat Limkonchotiwat, Pume Tuchinda, Lalita Lowphansirikul, Surapon Nonesung, Panuthep Tasawong, Alham Fikri Aji, Can Udomcharoenchaikit, Sarana Nutanong

机构 * AI Singapore(AI新加坡) VISTEC MBZUAI

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments Accepted to EMNLP 2025 (Main). Model and Dataset: https://huggingface.co/collections/airesearch/wangchan-thai-instruction-6835722a30b98e01598984fd

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16025 2025-09-22 cs.CL cs.AI 81%

Session-Level Spoken Language Assessment with a Multimodal Foundation Model via Multi-Target Learning

Hong-Yun Lin, Jhen-Ke Lin, Chung-Chun Wang, Hao-Chien Lu, Berlin Chen

机构 * Department of Computer Science(计算机科学系) Information Engineering, National Taiwan Normal University(信息工程,台湾正常大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI

Comments Copyright 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏