Effect of Nonlinear Surface Inflows into Activity Belts on Solar Cycle Modulation
专题命中 指令微调 :SFT(abstract)
Comments 21 pages, 10 figures, Solar Physics Journal, Accepted: 04 April 2025
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 指令微调 :SFT(abstract)
Comments 21 pages, 10 figures, Solar Physics Journal, Accepted: 04 April 2025
奖励塑造以缓解强化学习从人类反馈中的奖励黑客
机构 * Fudan University(复旦大学)
专题命中 后训练与偏好优化 :RLHF(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 PAR通过利用奖励模型中的潜在偏好信号,有效缓解RLHF中的奖励黑客问题,表现出更高的性能和数据效率。
用于人工智能治理的后训练适应技术的六维分类法
专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 本综述构建了后训练适应技术的六维分类法,梳理技术间关系,为AI治理提供术语支持,并指出该领域的开放挑战。
CodeGrep:用于LLM编码智能体的基于强化学习训练的检索智能体
专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.AI
AI总结 该研究针对LLM编码智能体查找文件效率低的问题,提出基于GRPO训练的14B检索智能体CodeGrep,在SWE-Bench Verified上保持解决率的同时,减少了交互轮数和token使用量。
RRC:基于排序的奖励构造解锁LLM强化学习中的生成式奖励模型
机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) ; NiuTrans Research(NiuTrans研究院) ; Institute of Psychology, CAS(中国科学院心理研究所) ; Kunming University of Science and Technology(昆明理工大学)
专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.CL、cs.LG
AI总结 本研究针对生成式奖励模型在LLM强化学习中潜力未充分发挥的问题,提出RRC方法,通过两种互补策略提升RL训练效果,在多基准上取得一致增益。
EvoHarness-RL:为长视野大语言模型智能体学习自进化运行时管控器
机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Meta AI
专题命中 后训练与偏好优化 :LLM(title,summary_cn);分类 cs.CL、cs.LG
AI总结 本研究提出 EvoHarness-RL 方法,通过学习管控器策略解决长视野 LLM 智能体的外部状态管理问题,在 ALFWorld 上达到 96.9% 的任务成功率,验证了可训练管控器策略的有效性。
Comments Accepted to LLA@COLM 2026
通过选择性上下文偏好优化学习何时信任
机构 * Duke University(杜克大学) ; National University of Singapore(新加坡国立大学) ; UC Berkeley(加州大学伯克利分校) ; UC Irvine(加州大学欧文分校) ; Northeastern University(东北大学) ; Nanyang Technological University(南洋理工大学)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究针对语言模型易受误导性外部信号影响的问题,提出SCOPE方法,在含四种条件的MIST基准上优化DPO目标,降低SC2W的同时保持正常上下文下的准确率,主张以选择性信任评判模型。
Comments Project Page at https://worldbench.github.io/scope GitHub Repo at https://github.com/worldbench/SCOPE HF Dataset at https://huggingface.co/datasets/worldbench/MIST-Bench
SAGA:面向低资源北欧语言模型的分数加权自适应生成对齐
机构 * Linköping University(林雪平大学) ; University of Iceland(冰岛大学)
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.LG
AI总结 该研究提出SAGA框架,用依存句法分析器监督取代人类偏好标注,在丹麦语、冰岛语等低资源北欧语言上提升了GPT-SW3-1.3B的语法质量,为相关语言的语法对齐提供了实用替代方案。
Comments 18 pages, 7 figures
面向胸部X射线报告生成的正例-无标签偏好优化
机构 * Columbia University(哥伦比亚大学) ; Stanford University(斯坦福大学) ; Emory University(埃默里大学)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.LG
AI总结 该研究针对放射报告生成VLM的遗漏噪声问题,提出PU-DPO框架,将未提及项视为无标签,通过对比对优化,提升病理检测率与隐藏正例恢复能力,增强对遗漏噪声的鲁棒性。
超越扁平策略:面向机器人操作具身智能体的分层后训练
专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract)
AI总结 针对现有VLA模型扁平策略难以处理长时程操作的问题,提出HiRoC分层后训练框架,通过解耦规划与执行并对齐分布,在机器人操作基准上取得优于强基线的性能。
面向不确定性引导的扩散模型后训练的样本自适应潜在奖励
专题命中 后训练与偏好优化 :post-training(title,abstract)
AI总结 本文提出\textsc{SURE}框架,含\textsc{SURE-LRM}与\textsc{SURE-REFL},通过样本自适应潜在奖励与不确定性引导反馈优化扩散模型,在偏好预测、SOTA性能及VBench指标上表现优异。
自适应边界裁剪GRPO:确保有界比率以实现稳定且可推广的训练
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 ABC-GRPO通过自适应边界裁剪提升GRPO的灵活性和泛化能力,实现更稳定和可推广的训练效果。
Comments 13 pages, 3 figures
MARS:面向奖励建模的边界与语义感知数据增强
机构 * University of Arizona(亚利桑那大学) ; Northeastern University London(伦敦东北大学)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 提出MARS框架,通过优先增强低边界偏好对并利用语义距离细化,提升奖励模型质量和对齐性能。
NormGuard: 流匹配强化学习中保持奖励的范数约束
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Kuaishou Technology(快手科技) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG
AI总结 针对流生成器强化学习后训练中感知质量下降的问题,提出NormGuard方法,通过铰链惩罚约束速度范数,在保持奖励的同时提升图像质量和真实性。
Comments v5: Fixed PDF rendering compatibility issue affecting Apple PDFKit (macOS Preview/iOS PDF viewer). No changes to technical content compared to v4
GrandCode: 通过代理强化学习实现竞技编程的Grandmaster级别
机构 * DeepReinforce Team(DeepReinforce 团队)
专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI
AI总结 本文提出GrandCode,一种用于竞技编程的多代理强化学习系统,通过代理模块协同训练和代理GRPO算法,实现了在竞技编程比赛中超越人类选手的突破。
Comments Tech Report; Pre-print
通过预言强化行动策略
机构 * School of Data Science, Fudan University(复旦大学数据科学学院) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 后训练与偏好优化 :post-training(abstract)
AI总结 ProphRL通过Prophet、FA-GRPO和FlowScale提升VLA后训练的效率与稳定性,实现机器人任务的成功率提升。
TensorCast:大语言模型基础设施中缺失的张量管理层
专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(title);language model(title)
AI总结 该研究针对LLM基础设施中张量管理策略复用受阻的问题,提出TensorCast分布式张量管理层,将张量状态管理与计算逻辑解耦,在保持性能的同时提升多轮智能体工作负载的TTFT达93.2%。
激活引导的神经元干预以在大型语言模型中诱导阿尔茨海默病相关的计算语言表型
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 本研究基于Qwen3-8B构建激活引导干预框架,通过缩放权重调节AD相关神经元,发现放大该神经元会导致多认知域功能损伤,减弱则多保留性能,为AD计算表型提供了概念验证。
Comments 17 pages, 5 figures, 2 tables
在大语言模型时代:在统一框架下的模块化架构与策略
机构 * Huawei Cloud(华为云)
专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文在统一框架下系统比较了多种记忆方法,设计出优于现有方法的新方法,并探讨了未来研究方向。
DREAM:基于大语言模型的事件感知记忆图动态角色扮演
机构 * Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) ; School of Computer Science, Fudan University(复旦大学计算机科学技术学院)
专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 DREAM是一种受ABC认知模型启发的结构化记忆框架,通过EMG提升角色扮演智能体的时间与因果连贯性,在CoSER、LIFECHOICE和TCM上取得最优性能。
Comments Accepted at KDD 2026. Camera-ready version to appear. 16 pages, 5 figures
用于反馈驱动智能体修复的因果情景记忆
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT), VNU-HCM(胡志明市理工大学计算机科学与工程学院(HCMUT,VNU-HCM))
专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL
AI总结 本文提出无需训练的MERIT智能体,通过维护双极性记忆辅助LLM智能体修复,在Spider、BIRD数据集上提升了Text-to-SQL任务的执行准确率,同时明确了因果跨查询记忆的适用场景。
DASH:用于自动化贝叶斯优化的解耦自适应代理-采集调控器
专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 DASH是用于LLM增强AutoBO的解耦自适应调控器,通过分离代理与采集的适配逻辑,在四项化学优化任务中较最佳AutoBO基线实现了12.51%的轨迹级加速因子提升和5.00%的端点增强因子提升。
分层位置偏倚在短上下文语言建模中的表现
机构 * Tehran Institute for Advanced Studies, Khatam University, Iran(德黑兰高级研究院,卡坦大学,伊朗) ; School of Electrical and Computer Engineering, University of Tehran, Iran(德黑兰理工大学电气与计算机工程学院,伊朗)
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出一种基于归因的框架,分析短上下文语言建模中各层的位置偏倚,发现深度增加时近期偏倚增强,首次偏倚减弱,且早期层更倾向内容词。
分形KV缓存存档:用于长上下文语言模型推理的带原地检索的无损符号存储
机构 * Independent Researcher(独立研究者)
专题命中 长上下文与记忆 :LLM(title);分类 cs.LG
AI总结 研究长上下文语言模型推理中KV缓存的存储问题,提出用分形KV缓存存档方法,该方法无损、线性时间运行且支持随机访问与追加,经实验验证能大幅减少存档缓存,还兼具搜索索引功能,发布代码可重现结果。
Comments 10 pages, 3 figures. Code: https://github.com/eighteight/fractal-kv
AI智能体签名工作流的硬件密钥存储:零信任MCP实施架构
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 该研究针对AI智能体私钥易泄露问题,提出基于硬件密钥存储与五层零信任栈的架构,实验显示其攻击成功率降为0%且无误报。
Comments 11 pages, 2 figures. Accompanying code and artifacts available at: https://anonymous.4open.science/r/Hardware-Keystores-for-AI-Agent-Signing-Workflows-Artifact-357C
QEvict:面向注意力漂移鲁棒长上下文解码的可恢复量化键值缓存驱逐机制
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 QEvict是一种三层KV缓存管理方案,通过可恢复量化驱逐解决长上下文解码中的注意力漂移问题,在固定内存预算下提升了长上下文任务的信息保留效果。
Comments 24 pages, 6 figures. The first four authors contributed equally
二次审视:多模态大语言模型中的免训练证据高亮
机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Look Twice框架,通过模型注意力模式识别相关视觉区域和文本证据,提升预训练MLLMs在多模态证据利用中的表现,实验显示在多个VQA基准上效果显著。
Comments Project Page: https://aimagelab.github.io/LoT/
活动帧:面向智能体记忆与回放的确定性屏幕活动编译
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 该研究提出确定性零模型流水线将屏幕活动编译为智能体记忆,可缩小上下文体积、提升问答准确率,还能获取智能体成本模型所需的例程开销比率与重复率等参数,相关资源开源。
Comments 14 pages, 5 figures, 4 tables
仅追踪所需:面向长文档问答的结构感知按需超图记忆
机构 * University of New South Wales(新南威尔士大学) ; CSIRO(澳大利亚联邦科学与工业研究组织) ; University of Wollongong(伍伦贡大学)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出DocTrace,一种多智能体RAG框架,通过查询触发的知识组织、文档结构感知和经验引导推理,解决长文档问答中知识组织成本高、结构利用不足和推理经验无法复用的问题,在三个数据集上取得最佳性能。
ConWriter:基于轻量级神经符号一致性控制的带状态长文本故事生成,受过渡约束
专题命中 长上下文与记忆 :prompting(abstract);分类 cs.CL
AI总结 针对现有长故事生成方法易累积各类错误的问题,提出无训练框架ConWriter,通过维护故事状态、验证叙事过渡并结合风险信号实现一致性控制,在ConStory-Bench上完成多模型多任务评估。