arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-20 至 2025-10-20 共收录 160 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 6 篇

2510.15261 2025-10-20 cs.AI 74%

AUGUSTUS: An LLM-Driven Multimodal Agent System with Contextualized User Memory

Jitesh Jain, Shubham Maheshwari, Ning Yu, Wen-mei Hwu, Humphrey Shi

机构 * Adobe(Adobe公司) Netflix Eyeline Studios(Netflix Eyeline工作室) UIUC(伊利诺伊大学香槟分校)

专题命中 长上下文与记忆 :LLM(title);分类 cs.AI

Comments LAW 2025 Workshop at NeurIPS 2025. Work done from late 2023 to early 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15830 2025-10-20 cs.LG cs.AI 73%

SNOO: Step-K Nesterov Outer Optimizer - The Surprising Effectiveness of Nesterov Momentum Applied to Pseudo-Gradients

Dominik Kallusky, Vinay Rao, Vishal Nandavanam, Hao-Jun Michael Shi

机构 * Meta Platforms, Inc.(Meta平台公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15386 2025-10-20 cs.CV 50%

PFGS: Pose-Fused 3D Gaussian Splatting for Complete Multi-Pose Object Reconstruction

Ting-Yu Yen, Yu-Sheng Chiu, Shih-Hsuan Hung, Peter Wonka, Hung-Kuo Chu

机构 * National Tsing Hua University(清华大学)

专题命中 长上下文与记忆 :foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理与问题求解 26 篇

2510.15106 2025-10-20 cs.CR cs.LG 90%

PoTS: Proof-of-Training-Steps for Backdoor Detection in Large Language Models

Issam Seddik, Sami Souihi, Mohamed Tamaazousti, Sara Tucci Piergiovanni

机构 * Université Paris-Saclay(巴黎-萨克雷大学) CEA LIST(法国原子能委员会列表中心) Palaiseau, France(法国Palaiseau)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

Comments 10 pages, 6 figures, 1 table. Accepted for presentation at FLLM 2025 (Vienna, Nov 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15444 2025-10-20 cs.LG cs.AI 84%

A Theoretical Study on Bridging Internal Probability and Self-Consistency for LLM Reasoning

Zhi Zhou, Yuhao Tan, Zenan Li, Yuan Yao, Lan-Zhe Guo, Yu-Feng Li, Xiaoxing Ma

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) Department of Computer Science, ETH Zurich, Switzerland(苏黎世联邦理工学院计算机科学系,瑞士) School of Intelligence Science and Technology, Nanjing University, China(智能科学与技术学院,南京大学,中国) School of Artifical Intelligence, Nanjing University, China(人工智能学院,南京大学,中国)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15191 2025-10-20 cs.CL cs.AI cs.IR 84%

Structure-R1: Dynamically Leveraging Structural Knowledge in LLM Reasoning through Reinforcement Learning

Junlin Wu, Xianrui Zhong, Jiashuo Sun, Bolian Li, Bowen Jin, Jiawei Han, Qingkai Zeng

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Purdue University(普渡大学) University of Notre Dame(诺特丹大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13031 2025-10-20 cs.CV cs.AI 83%

Perception Before Reasoning: Two-Stage Reinforcement Learning for Visual Reasoning in Vision-Language Models

Yan Chen, Long Li, Teng Xi, Long Zeng, Jingdong Wang

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15700 2025-10-20 cs.LG cs.AI cs.PL 81%

ProofOptimizer: Training Language Models to Simplify Proofs without Human Demonstrations

Alex Gu, Bartosz Piotrowski, Fabian Gloeckle, Kaiyu Yang, Aram H. Markosyan

机构 * Meta FAIR & MIT CSAIL(Meta FAIR 与 MIT CSAIL) Meta FAIR Meta FAIR & École des Ponts Paris(Meta FAIR 与 巴黎École des Ponts)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI、cs.LG

Comments 52 pages, 16 figures, website: http://proof-optimizer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18492 2025-10-20 cs.CR cs.AI cs.LG 81%

GuardReasoner: Towards Reasoning-based LLM Safeguards

Yue Liu, Hongcheng Gao, Shengfang Zhai, Yufei He, Jun Xia, Zhengyu Hu, Yulin Chen, Xihong Yang, Jiaheng Zhang, Stan Z. Li, Hui Xiong, Bryan Hooi

机构 * NUS(新加坡国立大学) HKUST (Guangzhou)(香港科技大学(广州)) Westlake University(西湖大学)

专题命中 推理与问题求解 :LLM(title);SFT(abstract);分类 cs.AI、cs.LG

Comments 22 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14321 2025-10-20 cs.IR 80%

Large Reasoning Embedding Models: Towards Next-Generation Dense Retrieval Paradigm

Jianting Tang, Dongshuai Li, Tao Wen, Fuyu Lv, Dan Ou, Linli Xu

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00784 2025-10-20 cs.IR cs.AI cs.CL cs.LG 80%

FIRE: Fact-checking with Iterative Retrieval and Verification

Zhuohan Xie, Rui Xing, Yuxia Wang, Jiahui Geng, Hasan Iqbal, Dhruv Sahnan, Iryna Gurevych, Preslav Nakov

机构 * MBZUAI The University of Melbourne(墨尔本大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 4 figures, 8 tables, accepted to Findings of NAACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15674 2025-10-20 cs.LG cs.AI 79%

CarBoN: Calibrated Best-of-N Sampling Improves Test-time Reasoning

Yung-Chen Tang, Pin-Yu Chen, Andrea Cavallaro

机构 * EPFL(瑞士联邦理工学院) Idiap Research Institute(Idiap研究所) IBM Research(IBM研究院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09080 2025-10-20 cs.LG cs.AI q-fin.CP 79%

FinHEAR: Human Expertise and Adaptive Risk-Aware Temporal Reasoning for Financial Decision-Making

Jiaxiang Chen, Mingxi Zou, Zhuo Wang, Qifan Wang, Dongning Sun, Chi Zhang, Zenglin Xu

机构 * Fudan University(复旦大学) Tensorpacific Peng Cheng Laboratory(鹏城实验室) Meta AI Shanghai Academy of AI for Science (SAIS)(上海人工智能科学研究院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15560 2025-10-20 cs.AI cs.DB 77%

JudgeSQL: Reasoning over SQL Candidates with Weighted Consensus Tournament

Jiayuan Bai, Xuan-guang Pan, Chongyang Tao, Shuai Ma

机构 * SKLSDE Lab, Beihang University(北航SKLSDE实验室) School of Software, Beihang University(北航软件学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15455 2025-10-20 cs.CL 77%

CORE: Reducing UI Exposure in Mobile Agents via Collaboration Between Cloud and Local LLMs

Gucongcong Fan, Chaoyue Niu, Chengfei Lyu, Fan Wu, Guihai Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11620 2025-10-20 cs.CL 77%

Enhancing Long Chain-of-Thought Reasoning through Multi-Path Plan Aggregation

Siheng Xiong, Ali Payani, Faramarz Fekri

机构 * Georgia Institute of Technology(佐治亚理工学院) Cisco Research(思科研究)

专题命中 推理与问题求解 :language model(abstract);SFT(abstract);preference optimization(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07581 2025-10-20 cs.LG 77%

Expanding the Action Space of LLMs to Reason Beyond Language

Zhongqi Yue, Weishi Wang, Yundaichuan Zhan, Juncheng Li, Daniel Dahlmeier, Fredrik D. Johansson

机构 * Chalmers University of Technology and University of Gothenburg(查尔姆斯理工大学和哥德堡大学) SAP(SAP公司) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04886 2025-10-20 cs.AI cs.MA 77%

Where Did It All Go Wrong? A Hierarchical Look into Multi-Agent Error Attribution

Adi Banerjee, Anirudh Nair, Tarik Borogovac

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15502 2025-10-20 cs.LG cs.AI 73%

The Road Less Traveled: Enhancing Exploration in LLMs via Sequential Sampling

Shijia Kang, Muhan Zhang

机构 * Institute for Artificial Intelligence(人工智能研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15211 2025-10-20 cs.LG cs.AI 73%

ReasonIF: Large Reasoning Models Fail to Follow Instructions During Reasoning

Yongchan Kwon, Shang Zhu, Federico Bianchi, Kaitlyn Zhou, James Zou

机构 * Together AI Stanford University(斯坦福大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15513 2025-10-20 cs.CL 70%

Temporal Referential Consistency: Do LLMs Favor Sequences Over Absolute Time References?

Ashutosh Bajpai, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度理工学院德里分校) MongoDB, Inc.(MongoDB公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP Main Long Paper 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15440 2025-10-20 cs.CV cs.AI 70%

Select Less, Reason More: Prioritizing Evidence Purity for Video Reasoning

Xuchen Li, Xuzhao Li, Shiyu Hu, Kaiqi Huang

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学院自动化研究所) ZGCA(中钢集团自动化研究所) NTU(国立台湾大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15421 2025-10-20 cs.CL 70%

When Seeing Is not Enough: Revealing the Limits of Active Reasoning in MLLMs

Hongcheng Liu, Pingjie Wang, Yuhao Wang, Siqu Ou, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12167 2025-10-20 cs.CL 70%

Towards Inference-time Scaling for Continuous Space Reasoning

Minghan Wang, Thuy-Trang Vu, Ehsan Shareghi, Gholamreza Haffari

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Submitted to AAAI 2026 on July 25, 2025. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07176 2025-10-20 cs.MA cs.AI 70%

Internet of Agents: Fundamentals, Applications, and Challenges

Yuntao Wang, Shaolong Guo, Yanghe Pan, Zhou Su, Fahao Chen, Tom H. Luan, Peng Li, Jiawen Kang, Dusit Niyato

机构 * School of Cyber Science and Engineering, Xi'an Jiaotong University(网络安全科学与工程学院,西安交通大学) School of Artificial Intelligence, Shandong University(人工智能学院,山东大学) School of Automation, Guangdong University of Technology(自动化学院,广东技术大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 25 pages,10 figures, 10 tables. Accepted by IEEE TCCN in Oct. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00010 2025-10-20 cs.LG cs.GR cs.MA 70%

LayerCraft: Enhancing Text-to-Image Generation with CoT Reasoning and Layered Object Integration

Yuyao Zhang, Jinghao Li, Yu-Wing Tai

机构 * Dartmouth College(达特茅斯学院) CUHK(香港大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01055 2025-10-20 cs.AI cs.CL cs.CV 62%

VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use

Dongfu Jiang, Yi Lu, Zhuofeng Li, Zhiheng Lyu, Ping Nie, Haozhe Wang, Alex Su, Hui Chen, Kai Zou, Chao Du, Tianyu Pang, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) Sea AI Lab(Sea AI 实验室) University of Toronto(多伦多大学) Shanghai University(上海大学) HKUST(香港科技大学) M-A-P National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI

Comments 32 pages, 5 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19983 2025-10-20 cs.RO cs.AI 57%

CLASP: General-Purpose Clothes Manipulation with Semantic Keypoints

Yuhong Deng, Chao Tang, Cunjun Yu, Linfeng Li, David Hsu

机构 * School of Computing, Smart System Institute, National University of Singapore, Singapore(计算学院、智能系统研究所、新加坡国立大学,新加坡) Department of Electronic and Electrical Engineering, Southern University of Science and Technology, China(电子与电气工程系、南方科技大学,中国)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15841 2025-10-20 cs.CV 50%

Neuro-Symbolic Spatial Reasoning in Segmentation

Jiayi Lin, Jiabo Huang, Shaogang Gong

专题命中 推理与问题求解 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 评测与基准 37 篇

2510.15558 2025-10-20 cs.CL cs.AI 90%

KITE: A Benchmark for Evaluating Korean Instruction-Following Abilities in Large Language Models

Dongjun Kim, Chanhee Park, Chanjun Park, Heuiseok Lim

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 13 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏