arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-02 至 2026-02-02 共收录 285 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 21 篇

2504.09026 2026-02-02 cs.LG cs.CR 70%

Detecting Instruction Fine-tuning Attacks using Influence Function

利用影响函数检测指令微调攻击

Jiawei Li

机构 * Tsinghua University(清华大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种无需先验知识的检测方法,通过影响函数和语义转换识别污染示例,提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22182 2026-02-02 cs.CR cs.AI 57%

ShellForge: Adversarial Co-Evolution of Webshell Generation and Multi-View Detection for Robust Webshell Defense

ShellForge: 基于对抗性共进化的小壳生成与多视角检测的稳健小壳防御

Yizhong Ding

机构 * Beijing Electronic Science and Technology Institute(北京电子科技研究所) Technology Institute(技术研究所)

专题命中 指令微调 :LLM(abstract);分类 cs.AI

AI总结 ShellForge通过对抗性共进化框架,结合自动化小壳生成与多视角检测,提升Webshell防御的鲁棒性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03370 2026-02-02 q-bio.QM cs.AI cs.CE 57%

InstructPLM-mu: 1-Hour Fine-Tuning of ESM2 Beats ESM3 in Protein Mutation Predictions

InstructPLM-mu:在1小时内微调ESM2在蛋白质突变预测中优于ESM3

Junde Xu, Yapin Shi, Lijun Lang, Taoyong Cui, Zhiming Zhang, Guangyong Chen, Jiezhong Qiu, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Hangzhou Institute of Medicine, CAS(杭州医学研究所,中国科学院) Hangzhou Institute for Advanced Study, UCAS(杭州先进研究 institute,中国科学院大学) University of Chinese Academy of Sciences(中国科学院大学) Tianjin University(天津大学)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 InstructPLM-mu通过1小时微调ESM2在蛋白质突变预测中超越ESM3,揭示了结构输入对模型性能的关键影响。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14133 2026-02-02 cs.RO cs.CV 50%

TwinBrainVLA: Unleashing the Potential of Generalist VLMs for Embodied Tasks via Asymmetric Mixture-of-Transformers

TwinBrainVLA: 通过非对称Transformer混合释放通用视觉语言模型在具身任务中的潜力

Bin Yu, Shijie Lian, Xiaopeng Lin, Yuliang Wei, Zhaolong Shen, Changti Wu, Yuzhuo Miao, Xinming Wang, Bailing Wang, Cong Huang, Kai Chen

机构 * HIT(哈尔滨工业大学) ZGCA(中钢集团人工智能研究院) ZGCI(中钢集团智能计算研究院) HUST(华中科技大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ECNU(华东师范大学) CASIA(中国科学院自动化研究所) DeepCybo

专题命中 指令微调 :language model(abstract)

AI总结 TwinBrainVLA通过非对称Transformer混合机制,利用冻结的通用视觉语言模型和可训练的专家路径,实现机器人任务中的具身智能提升。

Comments GitHub: https://github.com/ZGC-EmbodyAI/TwinBrainVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22547 2026-02-02 cs.IR 50%

PersonaAct: Simulating Short-Video Users with Personalized Agents for Counterfactual Filter Bubble Auditing

PersonaAct: 通过个性化代理模拟短视频用户以进行反事实过滤气泡审计

Shilong Zhao, Qinggang Yang, Zhiyi Yin, Xiaoshi Wang, Zhenxing Chen, Du Su, Xueqi Cheng

专题命中 指令微调 :LLM(abstract)

AI总结 PersonaAct通过个性化代理模拟短视频用户,提升过滤气泡审计的保真度和深度,揭示内容压缩现象并释放首个开源数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 19 篇

2601.22801 2026-02-02 cs.LG 90%

Clipping-Free Policy Optimization for Large Language Models

无需裁剪的策略优化用于大语言模型

Ömer Veysel Çağatan, Barış Akgün, Gözde Gül Şahin, Xuandong Zhao

机构 * KUIS AI Center, Koç University, Istanbul, Türkiye(Koç大学) Koç University, Istanbul, Türkiye(Koç大学) University of California, Berkeley, CA, USA(加州大学伯克利分校)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 CFPO通过凸二次惩罚替代裁剪机制,实现稳定策略优化,适用于大语言模型的训练。

Comments 23 pages, 10 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01458 2026-02-02 cs.LG 87%

How Well Can Preference Optimization Generalize Under Noisy Feedback?

在有噪声反馈下,偏好优化能有多好?

Shawn Im, Sharon Li

机构 * Department of Computer Sciences(计算机科学系) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了在噪声反馈下偏好优化的一般化能力,分析了不同噪声类型和强度对模型性能的影响,并验证了其在实际LLM训练中的有效性。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15172 2026-02-02 cs.AI 86%

Self-Improvement of Language Models by Post-Training on Multi-Agent Debate

通过多智能体辩论进行语言模型的自改进

Ankur Samanta, Akshayaa Magesh, Runzhe Wu, Ayush Jain, Youliang Yu, Daniel Jiang, Boris Vidolov, Paul Sajda, Yonathan Efroni, Kaveh Hassani

机构 * Meta AI Columbia University(哥伦比亚大学) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 后训练与偏好优化 :language model(title);post-training(title);SFT(abstract);分类 cs.AI

AI总结 通过多智能体辩论和强化学习提升语言模型的自我改进能力,实现推理准确性、自洽性和泛化能力的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22385 2026-02-02 cs.CL cs.AI cs.LG 85%

SP^2DPO: An LLM-assisted Semantic Per-Pair DPO Generalization

SP^2DPO: 一种基于大语言模型的语义逐对DPO泛化

Chaoyue He, Xin Zhou, Di Wang, Hong Xu, Wei Liu, Chunyan Miao

机构 * Alibaba--NTU Global e-Sustainability CorpLab (ANGEL), Singapore(阿里-NTU全球可持续性公司实验室(ANGEL),新加坡) Alibaba Group, China(阿里集团,中国)

专题命中 后训练与偏好优化 :LLM(title);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SP^2DPO通过语义逐对DPO泛化提升AlpacaEval 2.0的长度控制胜率,避免每模型beta扫描。

Comments 39 pages, 15 figures, 16 tables, 60 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21282 2026-02-02 cs.LG cs.AI 84%

It's Not You, It's Clipping: A Soft Trust-Region via Probability Smoothing for LLM RL

并非你,而是剪裁:通过概率平滑的软信任区域进行大语言模型强化学习

Madeleine Dwyer, Adam Sobey, Adriane Chapman

机构 * University of Southampton(索姆塞特大学) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PSPO方法,通过概率平滑改进大语言模型强化学习中的信任区域,提升数学推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23129 2026-02-02 cs.CL 83%

Evaluating the Utility of Grounding Documents with Reference-Free LLM-based Metrics

评估基于参考-free LLM的文档接地的效用

Yilun Hua, Giuseppe Castellucci, Peter Schulam, Heba Elfardy, Kevin Small

机构 * Department of Computer Science and Cornell Tech, Cornell University(计算机科学系和Cornell Tech,康奈尔大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(abstract);分类 cs.CL

AI总结 本文提出GroGU,一种无需注释的模型特定指标,用于评估RAG中文档接地的效用,通过优化查询重写器提升了检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16245 2026-02-02 cs.CL 83%

Diverse, not Short: A Length-Controlled Data Selection Strategy for Improving Response Diversity of Language Models

多样而非简短:一种长度控制的数据选择策略以提高语言模型的响应多样性

Vijeta Deshpande, Debasmita Ghose, John D. Patterson, Roger Beaty, Anna Rumshisky

机构 * University of Massachusetts Lowell(马萨诸塞大学洛维尔分校) Yale University(耶鲁大学) Pennsylvania State University(宾夕法尼亚州立大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(abstract);分类 cs.CL

AI总结 Diverse-NS通过长度控制的数据选择策略提升语言模型响应多样性,适用于创造性生成任务,并在不同规模模型间展示出显著效果。

Comments Accepted to EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00665 2026-02-02 cs.CL cs.AI 82%

SAFER: Probing Safety in Reward Models with Sparse Autoencoder

SAFER: 通过稀疏自动编码器探索奖励模型的安全性

Wei Shi, Ziyuan Xie, Sihang Li, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 SAFER通过稀疏自动编码器探索奖励模型的安全性,揭示可解释特征并改进安全性对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22718 2026-02-02 cs.AI cs.LG 82%

A Step Back: Prefix Importance Ratio Stabilizes Policy Optimization

后退一步:前缀重要性比率稳定了策略优化

Shiye Lei, Zhihao Cheng, Dacheng Tao

机构 * The University of Sydney(悉尼大学) ByteDance(字节跳动) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出MinPRO目标,通过使用非累积的最小token级比率替代累积前缀比率,以稳定LLM在非策略性条件下的训练和优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20433 2026-02-02 cs.CV 82%

MARE: Multimodal Alignment and Reinforcement for Explainable Deepfake Detection via Vision-Language Models

MARE: 多模态对齐与强化学习用于通过视觉-语言模型的可解释深度伪造检测

Wenbo Xu, Wei Lu, Xiangyang Luo, Jiantao Zhou

机构 * School of Computer Science and Engineering, MoE Key Laboratory of Information Technology, Guangdong Province Key Laboratory of Information Security Technology, Sun Yat-sen University, Guangzhou 510006, China(计算机科学与工程学院,信息技术MOE实验室,广东省信息安全技术重点实验室,中山大学,广州510006,中国) State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室) Department of Computer and Information Science, University of Macau.(计算机与信息科学系,澳门大学)

专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract)

AI总结 MARE通过多模态对齐和强化学习提升视觉-语言模型在深度伪造检测中的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27410 2026-02-02 cs.AI 74%

Closing the Expression Gap in LLM Instructions via Socratic Questioning

通过苏格拉底提问缩小LLM指令的表达差距

Jianwen Sun, Yukang Feng, Yifan Chang, Chuanhao Li, Zizhen Li, Jiaxin Ai, Fanrui Zhang, Yu Dai, Kaipeng Zhang

机构 * Nankai University(南开大学) Shanghai Innovation Institute(上海创新研究院) Wuhan University(武汉大学) Shanghai AI Laboratory(上海人工智能实验室) Shanda AI Research(上海沙达人AI研究所)

专题命中 后训练与偏好优化 :LLM(title);分类 cs.AI

AI总结 通过苏格拉底提问方法,提出Nous代理以主动探测用户意图,解决人类与AI协作中的意图表达差距问题,提升效率和输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00677 2026-02-02 cs.LG cs.AI 73%

IRPM: Intergroup Relative Preference Modeling for Pointwise Generative Reward Models

IRPM:基于组间相对偏好的点wise生成奖励模型

Haonan Song, Qingchen Xie, Huan Zhu, Feng Xiao, Luxi Xing, Liu Kang, Fuzhen Li, Zhiyong Zheng, Feng Jiang, Ziheng Li, Kun Yan, Qingyi Si, Yanghua Xiao, Hongcheng Guo, Fan Yang

机构 * HUJING Digital Media \& Entertainment Group (XingYun Lab), Beijing, China Department of Automation, Tsinghua University, Beijing, China Fudan University, Shanghai, China Beihang University, Beijing, China Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China

专题命中 后训练与偏好优化 :post-training(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 IRPM通过组间比较扩展Bradley-Terry模型,从成对偏好数据中训练点wise GRMs,实现高效可扩展的奖励建模。

Comments Comments: Updated title for clarity; improved theoretical derivations; added experiments at additional parameter scales and more ablations; added experimental details in the appendix; updated author list (added five co-authors) to reflect contributions to experiments and writing

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23058 2026-02-02 cs.LG 70%

From Absolute to Relative: Rethinking Reward Shaping in Group-Based Reinforcement Learning

从绝对到相对:重新思考基于群体的强化学习中的奖励塑造

Wenzhe Niu, Wei He, Zongxia Xie, Jinpeng Ou, Huichuan Fan, Yuchen Ge, Yanru Sun, Ziyin Wang, Yizhao Sun, Chengshun Shi, Jiuchong Gao, Jinghua Hao, Renqing He

机构 * Tianjin University(天津大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出RLRR框架,通过将奖励塑造从绝对评分转为相对排名,解决群体强化学习中奖励稳定性与监督稀疏性问题,并在推理和生成任务中取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22249 2026-02-02 cs.LG cs.SE 70%

FunPRM: Function-as-Step Process Reward Model with Meta Reward Correction for Code Generation

FunPRM:基于元奖励校正的函数作为步骤过程奖励模型用于代码生成

Ruiyi Zhang, Peijia Qin, Qi Cao, Eric Xue, Pengtao Xie

机构 * University of California, San Diego(加州大学圣迭戈分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 FunPRM通过元学习的奖励校正机制提升代码生成性能,实现更高质量的代码输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25562 2026-02-02 cs.AI cs.CL cs.CV cs.LG 67%

IRIS: Intrinsic Reward Image Synthesis

IRIS:内在奖励图像合成

Yihang Chen, Yuanhao Ban, Yunqi Hong, Cho-Jui Hsieh

机构 * Department of Computer Science, University of California, Los Angeles, USA(计算机科学系,加州大学洛杉矶分校)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 IRIS通过内在奖励提升自回归T2I模型性能,改进图像生成质量并促进细致推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22582 2026-02-02 cs.LG cs.AI 62%

MC-GRPO: Median-Centered Group Relative Policy Optimization for Small-Rollout Reinforcement Learning

MC-GRPO:用于小回滚强化学习的中位数中心组相对策略优化

Youngeun Kim

机构 * Amazon(亚马逊)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

AI总结 MC-GRPO通过使用中位数基线替代平均基线,提高小回滚强化学习的稳定性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22432 2026-02-02 cs.LG cs.CL 62%

ReNCE: Learning to Reason by Noise Contrastive Estimation

ReNCE: 通过噪声对比估计学习推理

Wenzheng Zhang, Karl Stratos

机构 * Rutgers University(罗杰斯大学)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 ReNCE通过噪声对比估计学习提升大语言模型的推理能力,采用显式对比学习方法在数学基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23135 2026-02-02 cs.LG 57%

Why GRPO Needs Normalization: A Local-Curvature Perspective on Adaptive Gradients

为何GRPO需要规范化:从局部曲率角度探讨自适应梯度

Cheng Ge, Caitlyn Heqi Yin, Hao Liang, Jiawei Zhang

机构 * Department of Aeronautics and Astronautics, MIT(麻省理工学院航空与宇航系) Department of Statistics, University of Wisconsin--Madison(威斯康星大学麦迪逊分校统计系) Department of Informatics, King's College London(伦敦国王学院信息学系) Department of Computer Sciences, University of Wisconsin--Madison(威斯康星大学麦迪逊分校计算机科学系)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.LG

AI总结 GRPO中标准差规范化通过局部曲率视角解释了其自适应梯度机制,理论和实验表明规范化能提升收敛速度并优化训练阶段表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23222 2026-02-02 cs.CV 50%

Region-Normalized DPO for Medical Image Segmentation under Noisy Judges

区域归一化的DPO用于在噪声裁判下的医学图像分割

Hamza Kalisch, Constantin Seibold, Jens Kleesiek, Ken Herrmann, Frederic Jonske

机构 * Institute for AI in Medicine (IKIM), University Hospital Essen (AöR), Essen, Germany(人工智能医学研究所(IKIM)、埃森大学医院(AöR)) Department of Nuclear Medicine, University Hospital Essen (AöR), Essen, Germany(核医学系、埃森大学医院(AöR)) Department of Physics, TU Dortmund, Dortmund, Germany(物理系、多特蒙德技术大学) Heidelberg University Hospital, Heidelberg, Germany(海德堡大学医院)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 本文提出区域归一化的DPO方法,用于在噪声裁判下提升医学图像分割的性能和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 12 篇

2601.19895 2026-02-02 cs.LG cs.CL 79%

Post-LayerNorm Is Back: Stable, ExpressivE, and Deep

Post-LayerNorm 是回潮:稳定、富有表现力且深

Chen Chen, Lai Wei

机构 * ByteDance Seed(字节跳动种子)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 Keel通过采用Highway风格连接的Post-LN架构,在极端深度下实现稳定训练,提升LLM的表达能力和扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22974 2026-02-02 cs.ET cs.CL 77%

MiTa: A Hierarchical Multi-Agent Collaboration Framework with Memory-integrated and Task Allocation

MiTa: 一种具有内存集成和任务分配的分层多智能体协作框架

XiaoJie Zhang, JianHan Wu, Xiaoyang Qu, Jianzong Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) Ping An Technology (Shenzhen) Co., Ltd., Shenzhen, China(平安科技(深圳)有限公司,深圳,中国)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MiTa通过分层结构和内存整合提升多智能体协作效率,实现全局任务分配与片段记忆整合。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23188 2026-02-02 cs.CL 70%

Deep Search with Hierarchical Meta-Cognitive Monitoring Inspired by Cognitive Neuroscience

受认知神经科学启发的深度搜索与分层元认知监控

Zhongxiang Sun, Qipeng Wang, Weijie Yu, Jingxuan Yang, Haolang Lu, Jun Xu

机构 * Gaoling School of Artificial Intelligence\ University of China Beijing China School of Information Technology Search Applications Department, Tencent Beijing China Beijing University of Posts Gaoling School of Artificial Intelligence\ University of China Search Applications Department, Tencent

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出DS-MCM框架,通过分层元认知监控机制提升深度搜索的性能和鲁棒性。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22966 2026-02-02 cs.CL 70%

A Unified View of Attention and Residual Sinks: Outlier-Driven Rescaling is Essential for Transformer Training

注意力与残差汇流的统一视角:异常驱动的重缩放对变换器训练至关重要

Zihan Qiu, Zeyu Huang, Kaiyue Wen, Peng Jin, Bo Zheng, Yuxin Zhou, Haofeng Huang, Zekun Wang, Xiao Li, Huaqing Zhang, Yang Xu, Haoran Lian, Siqi Zhang, Rui Men, Jianwei Zhang, Ivan Titov, Dayiheng Liu, Jingren Zhou, Junyang Lin

机构 * Qwen Team(Qwen团队) University of Edinburgh(爱丁堡大学) Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出异常驱动重缩放对变换器训练的重要性,通过统一注意力与残差汇流的起源,展示了异常值在训练稳定性与性能提升中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22570 2026-02-02 cs.CV cs.LG 70%

Leveraging Data to Say No: Memory Augmented Plug-and-Play Selective Prediction

利用数据说不:基于记忆的插拔式选择预测

Aditya Sarkar, Yi Li, Jiacheng Cheng, Shlok Mishra, Nuno Vasconcelos

机构 * University of Maryland, College Park(马里兰大学) University of California, San Diego(加州大学圣地亚哥分校) Qualcomm AI(高通人工智能) Yale University(耶鲁大学) Meta AI

专题命中 长上下文与记忆 :language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 本文提出基于记忆的插拔式选择预测方法,通过增强视觉语言嵌入来减少方差并改进分数校准,提升图像描述、匹配和细粒度分类性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22528 2026-02-02 cs.AI 70%

Darwinian Memory: A Training-Free Self-Regulating Memory System for GUI Agent Evolution

达尔文记忆:一种无训练的自调节记忆系统用于GUI代理进化

Hongze Mi, Yibo Feng, WenJie Lu, Song Cao, Jinyuan Li, Yanming Li, Xuelin Zhang, Haotian Luo, Songyang Peng, He Cui, Tengfei Tian, Jun Fang, Hua Chai, Naiqiang Tan

机构 * Didichuxing Co. Ltd(滴滴出行有限公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tianjin University(天津大学) Sun Yat-sen University(中山大学) Fudan University(复旦大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 达尔文记忆系统通过自进化架构提升GUI代理的执行稳定性与成功率,无需额外训练或架构开销。

详情

展开后加载摘要…

URL PDF HTML 收藏