arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-19 至 2025-08-19 共收录 229 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 9 篇

2506.00845 2025-08-19 cs.LG cs.CL 87%

Generalizable LLM Learning of Graph Synthetic Data with Post-training Alignment

Yizhuo Zhang, Heng Wang, Shangbin Feng, Zhaoxuan Tan, Xinyun Liu, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) Xi’an Jiaotong University(西安交通大学) University of Notre Dame(圣母大学) Google(谷歌)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);分类 cs.CL、cs.LG

Comments 8 pages, 1 figures, 2 tables. Experimental code and results are publicly available at https://anonymous.4open.science/r/Graph_RL-BF08/readme.md

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12790 2025-08-19 cs.AI cs.CL cs.LG 80%

Reinforcement Learning with Rubric Anchors

Zenan Huang, Yihong Zhuang, Guoshan Lu, Zeyu Qin, Haokai Xu, Tianyu Zhao, Ru Peng, Jiaqi Hu, Zhanming Shen, Xiaomeng Hu, Xijun Gu, Peiyi Tu, Jiaxin Liu, Wenyu Chen, Yuzhuo Fu, Zhiting Fan, Yanmei Gu, Yuanyuan Wang, Zhengkai Yang, Jianguo Li, Junbo Zhao

机构 * Inclusion AI Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12165 2025-08-19 cs.AI 77%

RLNVR: Reinforcement Learning from Non-Verified Real-World Rewards

Rohit Krishnan, Jon Evans

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);RLHF(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11737 2025-08-19 cs.CV cs.AI cs.CL cs.LG 75%

Ovis2.5 Technical Report

Shiyin Lu, Yang Li, Yu Xia, Yuwei Hu, Shanshan Zhao, Yanqing Ma, Zhichao Wei, Yinglun Li, Lunhao Duan, Jianshan Zhao, Yuxuan Han, Haijun Li, Wanying Chen, Junke Tang, Chengkun Hou, Zhixing Du, Tianli Zhou, Wenjie Zhang, Huping Ding, Jiahe Li, Wen Li, Gui Hu, Yiliang Gu, Siran Yang, Jiamang Wang, Hailong Sun, Yibo Wang, Hui Sun, Jinlong Huang, Yuping He, Shengze Shi, Weihong Zhang, Guodong Zheng, Junpeng Jiang, Sensen Gao, Yi-Feng Wu, Sijia Chen, Yuhui Chen, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :instruction tuning(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13023 2025-08-19 cs.AI 70%

G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance

Yongxin Guo, Wenbo Deng, Zhenglin Cheng, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen, Guangdong(科学与工程学院,香港中文大学(深圳)) Alibaba Group(阿里巴巴集团) School of Engineering, Westlake University(工程学院,西湖大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12338 2025-08-19 cs.AI 70%

Wisdom of the Crowd: Reinforcement Learning from Coevolutionary Collective Feedback

Wenzhen Yuan, Shengji Tang, Weihao Lin, Jiacheng Ruan, Ganqu Cui, Bo Zhang, Tao Chen, Ting Liu, Yuzhuo Fu, Peng Ye, Lei Bai

机构 * Shanghai AI Lab(上海AI实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11800 2025-08-19 cs.LG cs.AI 62%

Uncalibrated Reasoning: GRPO Induces Overconfidence for Stochastic Outcomes

Michael Bereket, Jure Leskovec

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11904 2025-08-19 cs.CV 50%

SafeCtrl: Region-Based Safety Control for Text-to-Image Diffusion via Detect-Then-Suppress

Lingyun Zhang, Yu Xie, Yanwei Fu, Ping Chen

专题命中 后训练与偏好优化 :preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 6 篇

2508.12854 2025-08-19 cs.AI cs.CL cs.CV cs.HC cs.MM 88%

E3RG: Building Explicit Emotion-driven Empathetic Response Generation System with Multimodal Large Language Model

Ronghao Lin, Shuai Shen, Weipeng Hu, Qiaolin He, Aolin Xiong, Li Huang, Haifeng Hu, Yap-peng Tan

机构 * Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学) Desay SV Automotive Co., Ltd(德赛西威汽车有限公司) Pazhou Laboratory(琶洲实验室)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted at ACM MM 2025 Grand Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12175 2025-08-19 cs.CR 78%

Invitation Is All You Need! Promptware Attacks Against LLM-Powered Assistants in Production Are Practical and Dangerous

Ben Nassi, Stav Cohen, Or Yair

专题命中 长上下文与记忆 :LLM(title,abstract)

Comments https://sites.google.com/view/invitation-is-all-you-need/home

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11661 2025-08-19 cs.LG cs.CL 73%

Sparse Attention across Multiple-context KV Cache

Ziyi Cao, Qingyi Si, Jingbin Zhang, Bingquan Liu

机构 * Huawei(华为)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12630 2025-08-19 cs.CL 70%

Semantic Anchoring in Agentic Memory: Leveraging Linguistic Structures for Persistent Conversational Context

Maitreyi Chatterjee, Devansh Agarwal

机构 * Cornell University(康奈尔大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Paper is currently in peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12916 2025-08-19 cs.RO 67%

RoboRetriever: Single-Camera Robot Object Retrieval via Active and Interactive Perception with Dynamic Scene Graph

Hecheng Wang, Jiankun Ren, Jia Yu, Lizhe Qi, Yunquan Sun

专题命中 长上下文与记忆 :language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12636 2025-08-19 cs.AR 67%

MemorySim: An RTL-level, timing accurate simulator model for the Chisel ecosystem

Ansh Chaurasia

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理与问题求解 38 篇

2508.12728 2025-08-19 eess.SP 91%

LLM-RIMSA: Large Language Models driven Reconfigurable Intelligent Metasurface Antenna Systems

Yunsong Huang, Hui-Ming Wang, Qingli Yan, Zhaowei Wang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12387 2025-08-19 cs.CL 90%

ReaLM: Reflection-Enhanced Autonomous Reasoning with Small Language Models

Yuanfeng Xu, Zehui Dai, Jian Liang, Jiapeng Guan, Guangrun Wang, Liang Lin, Xiaohui Lv

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)

Comments 16pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12396 2025-08-19 cs.CV 90%

DeCoT: Decomposing Complex Instructions for Enhanced Text-to-Image Generation with Large Language Models

Xiaochuan Lin, Xiangyong Chen, Xuan Li, Yichen Su

机构 * Henan Polytechnic University(河南理工大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12725 2025-08-19 cs.AI 89%

GTool: Graph Enhanced Tool Planning with Large Language Model

Wenjie Chen, Wenbin Li, Di Yao, Xuying Meng, Chang Gong, Jingping Bi

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12669 2025-08-19 cs.CL cs.CY 89%

Leveraging Large Language Models for Predictive Analysis of Human Misery

Bishanka Seal, Rahul Seetharaman, Aman Bansal, Abhilash Nandy

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments 14 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12473 2025-08-19 cs.CV cs.AI 88%

Standardization of Neuromuscular Reflex Analysis -- Role of Fine-Tuned Vision-Language Model Consortium and OpenAI gpt-oss Reasoning LLM Enabled Decision Support System

Eranga Bandara, Ross Gore, Sachin Shetty, Ravi Mukkamala, Christopher Rhea, Atmaram Yarlagadda, Shaifali Kaushik, L. H. M. P. De Silva, Andriy Maznychenko, Inna Sokolowska, Amin Hass, Kasun De Zoysa

机构 * Old Dominion University(旧 Dominion 大学) AnaletIQ McDonald Army Health Center(麦克唐纳陆军医疗中心) University of Sri Jayewardenepura(Sri Jayewardenepura 大学) University of Gdańsk(盖尔范大学) University of Colombo(科伦坡大学)

专题命中 推理与问题求解 :LLM(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10265 2025-08-19 cs.AI cs.LO 88%

Why Cannot Large Language Models Ever Make True Correct Reasoning?

Jingde Cheng

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 8 pages. arXiv admin note: substantial text overlap with arXiv:2412.12408

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12604 2025-08-19 cs.LG cs.AI 88%

SSPO: Self-traced Step-wise Preference Optimization for Process Supervision and Reasoning Compression

Yuyang Xu, Yi Cheng, Haochao Ying, Zhuoyun Du, Renjun Hu, Xing Shi, Wei Lin, Jian Wu

专题命中 推理与问题求解 :preference optimization(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02083 2025-08-19 cs.CL cs.AI cs.CE cs.LG 87%

Regress, Don't Guess -- A Regression-like Loss on Number Tokens for Language Models

Jonas Zausinger, Lars Pennig, Anamarija Kozina, Sean Sdahl, Julian Sikora, Adrian Dendorfer, Timofey Kuznetsov, Mohamad Hagog, Nina Wiedemann, Kacper Chlodny, Vincent Limbach, Anna Ketteler, Thorben Prein, Vishwa Mohan Singh, Michael Morris Danziger, Jannis Born

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML)) IBM Research Europe(IBM欧洲研究院) ETH Zurich(苏黎世联邦理工学院)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11247 2025-08-19 cs.AI cs.LG cs.RO 86%

LD-Scene: LLM-Guided Diffusion for Controllable Generation of Adversarial Safety-Critical Driving Scenarios

Mingxing Peng, Yuting Xie, Xusen Guo, Ruoyu Yao, Hai Yang, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07534 2025-08-19 cs.CL 83%

From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR

Jia Deng, Jie Chen, Zhipeng Chen, Daixuan Cheng, Fei Bai, Beichen Zhang, Yinqian Min, Yanzipeng Gao, Wayne Xin Zhao, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(北京理工大学人工智能学院)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

Comments 27pages,25figures. arXiv admin note: text overlap with arXiv:2508.02260

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12455 2025-08-19 cs.CV 82%

X-Ray-CoT: Interpretable Chest X-ray Diagnosis with Vision-Language Models via Chain-of-Thought Reasoning

Chee Ng, Liliang Sun, Shaoqing Tang

机构 * Universiti Teknologi Malaysia(马来西亚技术大学)

专题命中 推理与问题求解 :language model(title);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15466 2025-08-19 cs.AI cs.CL 81%

Learning Adaptive Parallel Reasoning with Language Models

Jiayi Pan, Xiuyu Li, Long Lian, Charlie Snell, Yifei Zhou, Adam Yala, Trevor Darrell, Kurt Keutzer, Alane Suhr

机构 * UC Berkeley(加州大学伯克利分校) UCSF(旧金山大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted at COLM 2025. Code, model, and data are available at https://github.com/Parallel-Reasoning/APR. The first three authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12086 2025-08-19 cs.CL cs.AI cs.LG 80%

J6: Jacobian-Driven Role Attribution for Multi-Objective Prompt Optimization in LLMs

Yao Wu

机构 * School of Engineering(工程学院) Westlake University(西湖大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 9 pages, 3 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01911 2025-08-19 cs.AI cs.CL cs.HC physics.comp-ph 79%

Advancing AI-Scientist Understanding: Multi-Agent LLMs with Interpretable Physics Reasoning

Yinggan Xu, Hana Kimlee, Yijia Xiao, Di Luo

机构 * NSF Center for Quantum Network(NSF量子网络中心) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments ICML 2025 Workshop on MAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11860 2025-08-19 cs.AI cs.CL 79%

LARC: Towards Human-level Constrained Retrosynthesis Planning through an Agentic Framework

Frazier N. Baker, Daniel Adu-Ampratwum, Reza Averly, Botao Yu, Huan Sun, Xia Ning

机构 * Department of Computer Science and Engineering, 2 Division of Medicinal Chemistry & Pharmacognosy, 3 Department of Biomedical Informatics, 4 Translational Data Analytics Institute(1 计算机科学与工程系,2 药物化学与药理学系,3 生物医学信息学系,4 转化数据分析研究所)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏