POINTS-GUI-G: GUI-Grounding Journey
POINTS-GUI-G:GUI接地之旅
机构 * Tencent(腾讯)
专题命中 指令微调 :language model(abstract)
AI总结 POINTS-GUI-G通过精细化数据工程、改进训练策略和强化学习提升GUI接地性能,实现多个基准测试的最优表现。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
POINTS-GUI-G:GUI接地之旅
机构 * Tencent(腾讯)
专题命中 指令微调 :language model(abstract)
AI总结 POINTS-GUI-G通过精细化数据工程、改进训练策略和强化学习提升GUI接地性能,实现多个基准测试的最优表现。
关于后训练大语言模型的可塑性与稳定性
机构 * Institute of Software Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所) ; University of the Chinese Academy of Sciences, Beijing, China(中国科学院大学) ; Wangxuan Institute of Computer Technology, Peking University, Beijing, China(北京大学王轩计算机技术研究所) ; Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州)人工智能研究所) ; Department of Computer Science and Engineering, The Hong Kong University of Science and Technology Hong Kong SAR, China(香港科技大学(香港特别行政区)计算机科学与工程系)
专题命中 后训练与偏好优化 :large language model(title);language model(title);post-training(title);分类 cs.LG
AI总结 本文提出PCR框架,通过概率方法解决GRPO中可塑性与稳定性之间的几何冲突,提升训练稳定性与推理性能。
compar:IA:法国政府的LLM竞技场,用于收集法语人类提示和偏好数据
机构 * The French Government(法国政府)
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);RLHF(abstract)
AI总结 compar:IA由法国政府开发,旨在通过收集法语人类提示和偏好数据,提升非英语语言中LLM的性能和文化契合度,同时推动多语言模型训练和评估的国际发展。
Comments 18 pages, 7 figures, preprint
LLM主动对齐:从纳什均衡视角出发
机构 * College of AI, Tsinghua University, Beijing, China(人工智能学院,清华大学,北京,中国) ; Harvard University, Cambridge, MA, USA(哈佛大学,马萨诸塞州剑桥,美国) ; Department of Electronic Engineering, Tsinghua University, Beijing, China(电子工程系,清华大学,北京,中国)
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)
AI总结 本文提出了一种基于纳什均衡的LLM主动对齐方法,通过建模代理行为以避免文本空间计算难题,并展示其在社交媒体中防止政治排斥的应用潜力。
并非所有层都需要调节:选择性层恢复恢复多样性
机构 * Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系) ; Smart Systems Institute, National University of Singapore, Singapore, Singapore(新加坡国立大学智能系统研究所)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 选择性层恢复通过恢复特定层到预训练权重,提升LLM输出多样性并保持高质量。
Comments 16 pages, 7 figures, 12 tables
DeDPO:用于扩散模型的去偏直接偏好优化
机构 * Cornell University(康奈尔大学) ; Rutgers University(罗格斯大学) ; NYU(纽约大学)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract)
AI总结 DeDPO通过整合因果推理的去偏技术,提升扩散模型在低成本合成监督下的对齐性能,实现与人类标注数据相当的鲁棒性。
重新上下文化著名引语以生成品牌标语
机构 * Brandeis University(布兰迪斯大学) ; Adobe(Adobe公司)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出通过重新上下文化著名引语生成新颖且具人设的标语,采用模块化框架提升标语的多样性与情感影响。
R-Align: 通过以推理为中心的元判断增强生成奖励模型
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL
AI总结 R-Align通过引入黄金判断和明确监督推理对齐,提高生成奖励模型的推理一致性,从而增强RLHF的性能。
Comments Github: https://github.com/lyn22333/R-Align Huggingface: https://huggingface.co/collections/lyn22333/r-align
SeeUPO:具有收敛保证的序列级代理强化学习
机构 * Tongyi Lab(通义实验室) ; Alibaba Group(阿里巴巴集团)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 SeeUPO通过逆向归纳实现多轮交互的单调改进和收敛,显著提升训练稳定性与性能
CoBA-RL:面向大语言模型强化学习的基于能力的预算分配
机构 * Zhejiang University(浙江大学) ; Nanjing University(南京大学) ; National University of Singapore(新加坡国立大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 CoBA-RL通过基于能力的价值函数和堆贪心策略,优化大语言模型强化学习中的预算分配,提升训练效率和泛化能力。
对抗位移的DPO扩展:非凸f-散度
机构 * Faculty of Data and Decision Sciences(数据与决策科学学院) ; Technion - Israel Institute of Technology(技术ion-以色列理工学院) ; Meta ; Qualcomm AI Research(高通人工智能研究)
专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.LG
AI总结 本文提出了一种对抗位移的DPO扩展方法,通过非凸f-散度改进了传统DPO,提供了更强的理论保证和实际表现。
Comments Published as a conference paper at ICLR 2026
ACE-Step 1.5:推动开源音乐生成的边界
机构 * ACE Studio(ACE工作室) ; Step Fun
专题命中 后训练与偏好优化 :language model(abstract);foundation model(abstract)
AI总结 ACE-Step 1.5通过高效开源模型实现商业级音乐生成,结合内在强化学习与混合架构,支持多语言创作与风格控制。
AEGPO:适应性熵引导策略优化用于扩散模型
机构 * Peking University(北京大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; The University of Hong Kong(香港大学) ; Beijing Normal University(北京师范大学)
专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG
AI总结 AEGPO通过双信号双层自适应优化提升扩散模型策略优化效率,实现更高效的收敛和更好的对齐性能。
带约束的群体相对策略优化
机构 * Mila - Quebec AI Institute(魁北克AI研究所) ; CIFAR AI Chair(CIFAR人工智能主席)
专题命中 后训练与偏好优化 :foundation model(abstract);分类 cs.CL、cs.LG
AI总结 本文提出带约束的GRPO,通过拉格朗日松弛解决受约束策略优化问题,实验验证其在网格世界和机器人任务中的有效性。
Comments 16 pages, 6 figures
挖掘未见:内在知识在长上下文语言模型中的隐性影响
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL
AI总结 本文研究了长上下文语言模型中参数知识的影响,提出混合针在 haystack 测试以评估模型的双重能力,发现 Qwen-2.5 模型在结合多种能力方面表现更优。
Comments 17 pages,11figures (accepted to AAAI 2026)
FadeMem: 基于生物机制的高效代理记忆遗忘
机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) ; School of Software and Microelectronics(软件与微电子学院) ; Peking University(北京大学)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 FadeMem通过生物启发的主动遗忘机制,提升代理记忆的效率与存储容量,实现更有效的信息管理与多跳推理能力。
通过实现产生认知收敛:反映四种心灵理论的结构认知循环
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 Agentic Flow通过实现约束产生认知收敛,展现结构认知循环如何在实际需求下形成统一认知形式。
Comments This revised version improves conceptual consistency between Agentic Flow and the Structured Cognitive Loop (SCL; arXiv:2510.05107)
GATSim: 基于生成代理的都市交通模拟
机构 * Key Laboratory of Road and Traffic Engineering of the Ministry of Education, College of Transportation, Tongji University(教育部交通工程重点实验室,交通学院,同济大学)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI
AI总结 GATSim通过生成代理模拟都市交通,结合认知系统与多尺度反思过程,实现对复杂出行行为的高效建模与真实交通模式的生成。
回声状态变换器:对有限记忆的注意力
机构 * Mnemosyne Centre Inria de l'Université de Bordeaux(Mnemosyne研究中心,Inria波尔多大学研究中心)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 回声状态变换器通过结合Transformer注意力机制与共振计算节点,实现线性复杂度的高效时间序列处理,优于现有方法。
大语言模型推理失败
机构 * California Institute of Technology(加州理工学院) ; Stanford University(斯坦福大学) ; Carleton College(卡尔顿学院)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI、cs.LG
AI总结 本文首次系统调查大语言模型推理失败问题,提出分类框架并分析其根本原因,旨在提升模型的推理能力与鲁棒性。
Comments Repository: https://github.com/Peiyang-Song/Awesome-LLM-Reasoning-Failures. Published at TMLR 2026 with Survey Certification
code_transformed: 大型语言模型对代码的影响
机构 * Huazhong University of Science and Technology(华中科技大学) ; École normale supérieure - Université PSL(巴黎高等师范学院-巴黎大学) ; Laboratoire LATTICE(LATTICE实验室) ; International School for Advanced Studies (SISSA)(国际先进研究学院(SISSA))
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了大型语言模型对代码风格的影响,通过分析GitHub仓库中的代码,发现命名规范、复杂性等指标的变化,揭示LLMs对现实编程实践的深远影响。
Comments EACL 2026 Findings
概率聚合与定向嵌入优化用于大语言模型中的集体道德推理
机构 * School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) ; School of Social Sciences and Technology, Technical University of Munich(社会科学与技术学院,慕尼黑技术大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种概率聚合与定向嵌入优化方法,通过融合多个大语言模型的道德判断,提升集体道德推理的一致性和准确性。
Comments Accepted to ACL 2025 (Findings)
评估和增强大型语言模型的漏洞推理能力
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)
AI总结 DAGVul通过建模漏洞推理为有向无环图生成任务,提升大型语言模型在漏洞检测中的推理能力,实验显示其推理F1分数平均提高18.9%。
MAGIC: 一种共进化攻击者-防御者对抗游戏用于鲁棒大语言模型安全
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 MAGIC通过共进化对抗游戏提升大语言模型的安全性,攻击者与防御者智能体在多轮强化学习中相互演化,有效识别并抵御未知攻击模式。
思考增强的功能调用:通过嵌入式推理提高LLM参数准确性
机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) ; School of Software and Microelectronics(软件与微电子学院) ; Peking University(北京大学)
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 TAFC通过嵌入式推理提升LLM参数准确性,实现函数调用的显式推理和细粒度优化,增强多参数函数的生成准确性和可解释性。
利用LLM代理识别恶意软件二进制中的攻击战术与技术
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 TTPDetect通过结合密集检索与LLM神经检索,利用LLM代理识别恶意软件二进制中的TTPs,实现高精度和召回率。
回归基础:通过生成概率重新审视强化学习中LLM推理的探索
机构 * FusionBrain Lab, Russia(融合脑实验室,俄罗斯) ; Institute of Numerical Mathematics, Russia(数值数学研究所,俄罗斯)
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 通过生成概率重新审视强化学习中LLM推理的探索,提出ARM机制平衡置信度,提升生成多样性与准确性。
基于大语言模型的完全自动化混沌工程:实现任何人以低成本构建容错软件系统
机构 * NTT, Inc., Japan(日本NTT公司)
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出ChaosEater系统,利用大语言模型自动化混沌工程周期,使任何人能低成本构建容错软件系统。
Comments Accepted at ASE 2025 NIER Track. The code is available at https://github.com/ntt-dkiku/chaos-eater
Journal ref 2025 40th IEEE/ACM International Conference on Automated Software Engineering (ASE)
超越静态对齐:通过风险感知的思维链实现LLM安全的分层策略控制
机构 * Qiyuan Tech, Beijing, China(奇渊科技,北京,中国)
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 PACT通过分层策略架构和风险感知推理,解决LLM安全与有用性之间的权衡问题,提升动态安全控制和可控性。
Comments 13 pages, 5 tables, 2 figures
回声作为锚点:在大语言模型推理中的概率成本与注意力再聚焦
专题命中 推理与问题求解 :LLM(title);SFT(abstract);prompting(abstract);分类 cs.CL
AI总结 本研究通过回声蒸馏监督微调和回声提示技术,利用大语言模型中自发的回声现象,提升推理准确性与注意力聚焦效果。