arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-15 至 2026-01-15 共收录 173 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 13 篇

2309.06135 2026-01-15 cs.CL cs.CV 57%

Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts

Prompting4Debugging: 通过寻找问题性提示对文本到图像扩散模型进行红队测试

Zhi-Yi Chin, Chieh-Ming Jiang, Ching-Chun Huang, Pin-Yu Chen, Wei-Chen Chiu

机构 * Department of Computer Science, National Yang Ming Chiao Tung University, Hsinchu, Taiwan(国家阳明交通大学计算机科学系) IBM Research, NY 10598, USA(IBM研究院)

专题命中 指令微调 :prompting(abstract);分类 cs.CL

AI总结 Prompting4Debugging通过寻找问题性提示揭示文本到图像扩散模型的安全漏洞,表明现有安全机制存在重大缺陷。

Comments ICML 2024 main conference paper. The source code is available at https://github.com/zhiyichin/P4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09108 2026-01-15 cs.CV 50%

Small but Mighty: Dynamic Wavelet Expert-Guided Fine-Tuning of Large-Scale Models for Optical Remote Sensing Object Segmentation

小而强大:动态小波专家引导的大型模型微调用于光学遥感目标分割

Yanguang Sun, Chao Wang, Jian Yang, Lei Luo

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出WEFT方法,通过动态小波专家引导微调,提升光学遥感图像目标分割性能,优于21种SOTA方法。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 4 篇

2601.09555 2026-01-15 cs.CL cs.AI 92%

Benchmarking Post-Training Quantization of Large Language Models under Microscaling Floating Point Formats

在微缩浮点格式下对大语言模型进行后训练量化评估

Manyi Zhang, Ji-Fu Li, Zhongao Sun, Haoli Bai, Hui-Ling Zhen, Zhenhua Dong, Xianzhi Yu

机构 * Huawei Technologies(华为技术)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract)

AI总结 本文研究了在微缩浮点格式下大语言模型后训练量化的效果,发现MXFP8性能接近无损,而MXFP4存在显著精度损失,且格式兼容性对PTQ效果影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08842 2026-01-15 cs.CL cs.AI 88%

Resisting Correction: How RLHF Makes Language Models Ignore External Safety Signals in Natural Conversation

对抗修正:RLHF如何使语言模型在自然对话中忽视外部安全信号

Felipe Biava Cataneo

机构 * Felipe Biava Cataneo(独立研究者)

专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(title,abstract);分类 cs.CL、cs.AI

AI总结 RLHF使语言模型在自然对话中忽视外部安全信号,影响安全纠正的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08884 2026-01-15 cs.SE cs.AI cs.DC 87%

Bridging the Gap: Empowering Small Models in Reliable OpenACC-based Parallelization via GEPA-Optimized Prompting

弥合差距:通过GEPA优化提示赋能小型模型在可靠OpenACC并行化中的应用

Samyak Jhaveri, Cristina V. Lopes

机构 * School of Information and Computer Science(信息与计算机科学学院) University of California, Irvine(加州大学伊文斯顿分校)

专题命中 后训练与偏好优化 :prompting(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 通过GEPA优化提示提升小型模型在OpenACC并行化中的性能与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17217 2026-01-15 cs.CL cs.AI cs.CY 79%

Mitigating Gender Bias via Fostering Exploratory Thinking in LLMs

通过促进大语言模型的探索性思维来缓解性别偏见

Kangda Wei, Hasnat Md Abdullah, Ruihong Huang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 通过生成性别中性故事对并利用直接偏好优化,该研究旨在减少大语言模型中的性别偏见,同时保持模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 7 篇

2508.19828 2026-01-15 cs.CL cs.MA 88%

Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning

Memory-R1: 通过强化学习增强大语言模型代理以管理并利用记忆

Sikuan Yan, Xiufeng Yang, Zuchao Huang, Ercong Nie, Zifeng Ding, Zonggen Li, Xiaowen Ma, Jinhe Bi, Kristian Kersting, Jeff Z. Pan, Hinrich Schütze, Volker Tresp, Yunpu Ma

机构 * Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Technical University of Munich(慕尼黑技术大学) University of Cambridge(剑桥大学) University of Hong Kong(香港大学) Technical University of Darmstadt(达姆施塔特技术大学) University of Edinburgh(爱丁堡大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 Memory-R1通过强化学习框架,使大语言模型具备主动管理与利用外部记忆的能力,有效提升长跨度推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09503 2026-01-15 cs.AI 85%

What Do LLM Agents Know About Their World? Task2Quiz: A Paradigm for Studying Environment Understanding

LLM代理对其世界的了解程度如何?Task2Quiz:一种研究环境理解的范式

Siyuan Liu, Hongbang Yuan, Xinze Li, Ziyue Zhu, Yixin Cao, Yu-Gang Jiang

机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Task2Quiz范式,通过评估代理对环境的理解能力,揭示任务成功与环境理解之间的差异,并指出主动探索和细粒度状态表示是提升自主代理泛化能力的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06457 2026-01-15 cs.CR cs.AI cs.CL cs.MA 79%

ScamAgents: How AI Agents Can Simulate Human-Level Scam Calls

ScamAgents: 人工智能代理如何模拟人类水平的诈骗电话

Sanket Badhe

机构 * Rutgers University(罗格斯大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ScamAgent,一种基于LLM的多轮代理,能生成逼真诈骗电话脚本并模拟欺诈场景,揭示现有安全机制对代理威胁的不足,呼吁加强多轮安全审计和检测生成AI驱动的对话欺骗。

Comments Accepted at CAMLIS 25: Conference on Applied Machine Learning for Information Security. 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00056 2026-01-15 cs.LG cs.AI 73%

MISA: Memory-Efficient LLMs Optimization with Module-wise Importance Sampling

MISA: 通过模块级重要性采样实现内存高效的LLM优化

Yuxi Liu, Renjia Deng, Yutong He, Xue Wang, Tao Yao, Kun Yuan

机构 * Peking University(北京大学) Alibaba DAMO Academy(阿里巴巴达摩院) Shanghai Jiao Tong University(上海交通大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MISA通过模块级重要性采样优化LLM,减少内存需求并提高收敛效率。

Comments This paper is accepted to Neural Information Processing Systems (NeurIPS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03285 2026-01-15 cs.AI 70%

Memory Mosaics at scale

大规模记忆马赛克

Jianyu Zhang, Léon Bottou

机构 * New York University, New York(纽约大学) FAIR, Meta Inc.(FAIR、Meta公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究展示了大规模记忆马赛克在扩展到大语言模型规模和真实数据集后,在训练知识学习和新任务执行方面优于transformers。

Comments Oral @ NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09113 2026-01-15 cs.AI 70%

The AI Hippocampus: How Far are We From Human Memory?

人工智能海马体:我们离人类记忆还有多远?

Zixia Jia, Jiaqi Li, Yipeng Kang, Yuxuan Wang, Tong Wu, Quansen Wang, Xiaobo Wang, Shuyi Zhang, Junzhe Shen, Qing Li, Siyuan Qi, Yitao Liang, Di He, Zilong Zheng, Song-Chun Zhu

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文综述了大语言模型和多模态大语言模型中记忆机制的分类与研究进展,探讨了隐性、显性和代理记忆框架,以及多模态场景下的记忆整合与挑战。

Journal ref Transactions on Machine Learning Research (11/2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09663 2026-01-15 cs.CV 50%

Self-Supervised Animal Identification for Long Videos

长时间视频中的自监督动物识别

Xuyang Fang, Sion Hannuna, Edwin Simpson, Neill Campbell

机构 * University of Bristol(布里斯托大学)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本研究提出了一种高效的自监督方法,通过全局聚类任务实现长时间视频中动物个体的高精度识别,准确率超过97%,且内存消耗低,适用于资源受限环境。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理与问题求解 24 篇

2601.08844 2026-01-15 cs.CL cs.AI cs.CY cs.LG 90%

Emissions and Performance Trade-off Between Small and Large Language Models

小型与大型语言模型之间排放与性能的权衡

Anandita Garg, Uma Gaba, Deepan Muthirayan, Anish Roy Chowdhury

机构 * School of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Plaksha University(普拉克斯大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过比较LLMs与微调SLMs在自然语言处理、推理和编程任务中的性能与排放权衡,证明小型模型在减少碳排放的同时能保持相近的性能表现。

Comments 6 pages. Accepted as a full paper to the 3rd International Conference on Foundation and Large Language Models (IEEE FLLM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17200 2026-01-15 cs.AI 89%

Large Language Model-Based Automatic Formulation for Stochastic Optimization Models

基于大语言模型的随机优化模型自动建模

Amirreza Talebi

机构 * Department of Integrated Systems Engineering(集成系统工程系)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型通过结构化提示自动建模随机优化问题,引入软评分度量提升模型质量,展示LLMs在SO建模中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09260 2026-01-15 cs.AI 88%

Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models

高效路径与密集奖励:用于大语言模型的概率流推理

Yan Liu, Feng Zhang, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Han Liu, Yangdong Deng

机构 * Meituan(美团) Tsinghua University(清华大学) Peking University(北京大学) Dalian University of Technology(大连理工大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 CoT-Flow通过概率流框架提升大语言模型的推理效率与性能,采用流引导解码和流强化学习方法实现信息高效推理路径和密集奖励函数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08846 2026-01-15 cs.CL cs.AI cs.LG 87%

Directional Attractors in LLM Reasoning: How Similarity Retrieval Steers Iterative Summarization Based Reasoning

方向性吸引子在LLM推理中的作用:相似性检索如何引导迭代摘要推理

Cagatay Tekin, Charbel Barakat, Luis Joseph Luna Limgenco

机构 * McGill University(麦吉尔大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出InftyThink与跨链记忆,通过语义引理检索提升LLM在结构化领域推理准确性,同时揭示异构领域中的失败模式及方向性偏见影响。

Comments 6 pages, 2 figures. Code available at: github.com/cagopat/InftyThink-with-Cross-Chain-Memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09259 2026-01-15 cs.AI 85%

MAXS: Meta-Adaptive Exploration with LLM Agents

MAXS: 基于LLM代理的元适应性探索

Jian Zhang, Zhiyuan Wang, Zhangqi Wang, Yu He, Haoran Luo, li yuan, Lingling Zhang, Rui Mao, Qika Lin, Jun Liu

机构 * Xi’an Jiaotong University(西安交通大学) Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) South China University of Technology(华南理工大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MAXS通过元适应性探索框架提升LLM代理在多工具推理中的全局有效性和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09129 2026-01-15 cs.CR 85%

KryptoPilot: An Open-World Knowledge-Augmented LLM Agent for Automated Cryptographic Exploitation

KryptoPilot: 一种面向开放世界的知识增强型大语言模型代理用于自动化密码学利用

Xiaonan Liu, Zhihao Li, Xiao Lan, Hao Ren, Haizhou Wang, Xingshu Chen

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 KryptoPilot通过开放世界知识增强和受控推理,提升LLM在密码学CTF挑战中的自动化解决能力。

Comments 14 Pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08848 2026-01-15 cs.CL cs.AI 84%

PediaMind-R1: A Temperament-Aware Language Model for Personalized Early Childhood Care Reasoning via Cognitive Modeling and Preference Alignment

PediaMind-R1: 一种基于气质的个性化婴幼儿护理推理语言模型:通过认知建模与偏好对齐

Zihe Zhang, Can Zhang, Yanheng Xu, Xin Hu, Jichao Leng

机构 * School of Future Information and Innovation, Fudan University(未来信息与创新学院,复旦大学) Corporate Research, Bosch (China) Investment Ltd.(博世(中国)投资有限公司研发部)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI;LLM(comments)

AI总结 PediaMind-R1通过整合认知建模与偏好对齐,实现基于婴幼儿气质的个性化护理推理。

Comments Accepted at EMNLP 2025 PALS Workshop (PALS: EXPLORING ACTIVE AND PASSIVE LLM PERSONALIZATION)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09446 2026-01-15 cs.CL cs.AI 84%

Improving Symbolic Translation of Language Models for Logical Reasoning

提升语言模型的符号翻译以增强逻辑推理

Ramya Keerthy Thatikonda, Jiuzhou Han, Wray Buntine, Ehsan Shareghi

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过微调和增量推理框架,提升小型语言模型在逻辑推理中的符号翻译能力,减少错误率并提高推理性能。

Comments The Third workshop of NeusymBridge @AAAI 2026 (Bridging Neurons and Symbols for NLP and Knowledge Graph Reasoning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09215 2026-01-15 cs.CL 83%

UserLM-R1: Modeling Human Reasoning in User Language Models with Multi-Reward Reinforcement Learning

UserLM-R1: 通过多奖励强化学习建模人类推理在用户语言模型中的应用

Feng Zhang, Shijia Li, Chunmao Zhang, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Jingwen Xu, Han Liu

机构 * Meituan(美团) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Chinese Academy of Sciences(中国科学院大学) Dalian University of Technology(大连理工大学)

专题命中 推理与问题求解 :language model(title,abstract);post-training(abstract);分类 cs.CL

AI总结 UserLM-R1通过多奖励强化学习和动态目标驱动策略,提升用户语言模型在跨领域和对抗性场景中的推理与策略能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09706 2026-01-15 cs.CL cs.AI cs.LG 82%

Value-Aware Numerical Representations for Transformer Language Models

具有价值意识的数值表示用于Transformer语言模型

Andreea Dutulescu, Stefan Ruseti, Mihai Dascalu

机构 * National University of Science and Technology(科学技术大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种价值意识的数值表示方法,通过在Transformer语言模型输入中加入前缀标记以显式编码数值,从而提升模型在算术任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09151 2026-01-15 cs.LG 81%

Interpretable Probability Estimation with LLMs via Shapley Reconstruction

通过Shapley重构实现LLM的可解释概率估计

Yang Nan, Qihao Wen, Jiahao Wang, Pengfei He, Ravi Tandon, Yong Ge, Han Xu

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 PRISM通过Shapley值重构提升LLM概率估计的透明性和准确性,适用于金融、医疗等多个领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08839 2026-01-15 cs.CL 81%

Recursive Knowledge Synthesis for Multi-LLM Systems: Stability Analysis and Tri-Agent Audit Framework

多LLM系统的递归知识合成:稳定性分析与三代理审计框架

Toshiyuki Shigemura

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL;large language model(comments);language model(comments)

AI总结 本文提出三代理框架用于多LLM系统稳定性分析,通过递归知识合成实现安全可靠的知识生成。

Comments 25 pages, 9 figures. Pilot feasibility study using public-access large language models without API-level orchestration

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23311 2026-01-15 cs.CV cs.AI cs.CL 81%

Seeing Symbols, Missing Cultures: Probing Vision-Language Models' Reasoning on Fire Imagery and Cultural Meaning

识别符号,缺失文化:探究视觉-语言模型在火 imagery 和文化意义上的推理

Haorui Yu, Yang Zhao, Yijia Chu, Qiufeng Yi

机构 * Duncan of Jordanstone College of Art & Design (DJCAD), University of Dundee(邓迪大学邓迪艺术与设计学院(DJCAD)) Guangzhou Institute of Science and Technology (GZIST)(广州科学技术研究院) Faculty of Arts, Xiamen University(厦门大学艺术学院) University of Birmingham(伯明翰大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究发现视觉-语言模型在处理火主题文化图像时存在系统性偏见,需通过文化评估确保公平性和可解释性。

Comments 8 pages, 5 figures, 4 tables. Submitted to WiNLP 2025 Workshop at COLING 2025

Journal ref Proceedings of the 9th Widening NLP Workshop (WiNLP 2025), pages 1-8, Suzhou, China. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09459 2026-01-15 cs.IR cs.CL 80%

Dissecting Judicial Reasoning in U.S. Copyright Damage Awards

解析美国版权损害赔偿判决中的司法推理

Pei-Chi Lo, Thomas Y. Lu

机构 * National Sun Yat-sen University(国立中山大学)

专题命中 推理与问题求解 :LLM(abstract,comments);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL

AI总结 本研究提出基于修辞结构理论的LLM方法,用于解析版权损害赔偿判决中的司法推理,揭示各巡回法院因素权重差异,为法律分析提供新方法和实证洞察。

Comments Presented in SIGKDD'25 SciSoc LLM Workshop: Large Language Models for Scientific and Societal Advances

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05755 2026-01-15 cs.CR cs.AI 79%

VIGIL: Defending LLM Agents Against Tool Stream Injection via Verify-Before-Commit

VIGIL: 通过验证后再提交协议保护LLM代理免受工具流注入攻击

Junda Lin, Zhaomeng Zhou, Zhi Zheng, Shuochen Liu, Tong Xu, Yong Chen, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) North Automatic Control Technology Research Institute(北自动控制技术研究所)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 VIGIL通过验证后再提交协议保护LLM代理免受工具流注入攻击,有效提升安全性和效用平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22979 2026-01-15 cs.LG 77%

OptiMind: Teaching LLMs to Think Like Optimization Experts

OptiMind: 教授大语言模型像优化专家一样思考

Xinzhi Zhang, Zeyi Chen, Humishka Zope, Hugo Barbalho, Konstantina Mellou, Marco Molinaro, Janardhan Kulkarni, Ishai Menache, Sirui Li

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 OptiMind通过整合优化专业知识,提升大语言模型在混合整数线性规划中的公式准确性,实现20.7%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09032 2026-01-15 cs.AI 77%

The Hierarchy of Agentic Capabilities: Evaluating Frontier Models on Realistic RL Environments

代理能力的层级:在现实强化学习环境中评估前沿模型

Logan Ritchie, Sushant Mehta, Nick Heiner, Mason Yu, Edwin Chen

机构 * Surge AI

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估了前沿AI模型在现实强化学习环境中的代理能力层级,揭示了模型在工具使用、规划、适应性等任务上的能力差异及改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏