Maximum Entropy Behavior Exploration for Sim2Real Zero-Shot Reinforcement Learning
为实机零样本强化学习的最大熵行为探索
专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 本文提出FB-MEBE算法,通过最大熵行为探索策略和正则化批评者,提升实机四足机器人控制的零样本强化学习性能,实现自然可部署的政策。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
为实机零样本强化学习的最大熵行为探索
专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 本文提出FB-MEBE算法,通过最大熵行为探索策略和正则化批评者,提升实机四足机器人控制的零样本强化学习性能,实现自然可部署的政策。
机构 * Faculty of Computer Science, University of Vienna(维也纳大学计算机科学系) ; UniVie Doctoral School Computer Science, University of Vienna(维也纳大学UniVie计算机科学博士学院) ; Faculty of Philological and Cultural Studies, University of Vienna(维也纳大学文学与文化研究系) ; Khoury College of Computer Sciences, Northeastern University(东北大学Khoury计算机科学学院)
专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG
Comments Added acknowledgments section. 9 pages, Accepted to the BabyLM Workshop at EMNLP 2025
以源为中心的状态演化循环Transformer
专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.LG
AI总结 本文提出以源为中心的状态演化(SCSE)循环Transformer,解决输入条件与共享循环参考的协调问题,在多个文本任务中提升了可控循环质量,验证了其设计的有效性。
Comments 24 pages, 5 figures
错位具有人格特质:对涌现错位的大五人格解释
机构 * Northeastern University(东北大学)
专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出用大五人格向量解释语言模型微调引发的错位,发现错位语料具特定人格特征,该向量可诊断安全现象且能捕捉单一方向无法识别的谄媚特质。
Comments The paper is currently under peer review
具有人口统计学意识的细粒度视觉识别用于儿童手腕病理学
机构 * Department of Computer Science (IDI), Norwegian University of Science \& Technology (NTNU), Gjøvik, 2815, Norway Department of Informatics, Linnaeus University, V\"axj\"o, 351 95, Sweden Department of Computer Science, Sukkur IBA University, Sukkur, 65200, Pakistan
专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种结合患者年龄和性别的混合卷积-Transformer模型,用于细粒度视觉识别儿童手腕病理学,以提高诊断准确性。
CondPSE:一种具有条件调制的多项式滤波结构编码器用于图
机构 * Sungkyunkwan University(成均馆大学)
专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 研究针对消息传递图神经网络局限,提出CondPSE编码器,用多项式图滤波器组和条件调制处理节点探针,预训练后冻结用作下游输入编码。在合成基准上提升结构判别准确率,在分子性质预测中与GPSE相当,探讨了其优势及局限性。
Comments Accepted as a poster at the 2nd Frontiers in Graph Machine Learning for the Large Model Era (GMLLM'26), a KDD 2026 workshop
DocAnnot——利用生成式人工智能驱动的自动注释加速关键信息提取数据集的创建
机构 * Phi Labs, Quantiphi India(印度Quantiphi公司Phi实验室) ; Phi Labs, Quantiphi Canada(加拿大Quantiphi公司Phi实验室)
专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI
AI总结 研究针对关键信息提取中训练数据集创建耗时的问题,提出DocAnnot框架,利用大型视觉语言模型、OCR及SICM算法,在基准测试中自动生成注释有一定F1分数,还能用于微调下游模型,大幅节省时间成本,减少人工依赖但未完全消除人工干预。
Comments 15 pages, 2 figures
Journal ref Proc. ICDAR 2025, Lecture Notes in Computer Science, vol 16025, Part III, pp. 563-576
掩码自动编码器从静息态神经数据中学习与感知相关的表示
专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 研究利用自监督学习,通过在盲人参与者V1区的自发神经活动上预训练掩码自动编码器,测试能否改善感知解码。结果显示该方法有效,表明自发皮层活动有价值,无监督预训练是改善神经解码的好策略。
Comments 6 papers, 4 figures. NeuroAI Workshop, AAAI 2026
Journal ref Proceedings of the First Workshop on NeuroAI Multimodal Intelligence @ AAAI 2026, PMLR 308:93-98, 2026
BHARATI:用于古典印度语言的形态感知分词器及子词丰富度分析
机构 * Centre for Sensors, Instrumentation and Cyber-Physical System Engineering (Centre for SeNSE), Indian Institute of Technology Delhi(印度理工学院德里分校传感器、仪器仪表和网络物理系统工程中心(SeNSE中心)) ; RSL Quantum, FITT, IIT Delhi(印度理工学院德里分校FITT的RSL量子公司)
专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG
AI总结 研究针对古典印度语言分词低效问题,提出BHARATI,它基于多语言语料库训练出三个版本的分词器,经子词丰富度分析和实验验证,v3表现出色,能减少序列长度,增加下游语言模型有效上下文长度,相关模型、脚本和基准已开源。
Comments 33 pages, 6 figures
AdaRoPE:并非所有注意力头都应同等旋转和缩放
专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI
AI总结 研究发现Transformer中不同功能的注意力头需不同频率范围和缩放因子,提出AdaRoPE为各头配备可学习参数,实验表明其性能优于现有变体,能更好地进行上下文扩展并保留短上下文性能,凸显在单头级别优化旋转位置嵌入之重要性。
Comments Accepted at ICML 2026
超球可能并非免费午餐
机构 * IQuest Research(IQuest研究公司) ; Peking University(北京大学) ; Sun Yat-sen University(中山大学) ; Shenzhen University of Advanced Technology(深圳先进技术大学) ; Shanghai University of Finance and Economics(上海财经大学)
专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 研究超球风格优化器优势来源,通过推导角有效学习率等方法分析,发现其优势并非源于更新方向,而是有效步长演变,预训练实验表明学习率衰减策略影响性能,谨慎调度对发挥其潜力至关重要。
Comments 14 pages, 4 figures. Code: https://github.com/mangocrazz/hyperball-may-not-be-a-free-lunch. Equal contribution: Yihao Xiao and Jialong Sun. Corresponding author: Bryan Dai
模型中的讲述者:大语言模型中的叙事模式继承、升级动态和对齐治理
专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI
AI总结 探讨大语言模型训练中是否吸收人类写作叙事模式并致输出漂移,通过文献综述和跨论文分析发现三个关键模式,包括复制训练数据模式、出现潜在特征及微调带来意外变化,指出叙事漂移是未监测的升级途径,需专门监测工具。
Comments 2 figures, 11 pages
使用稀疏自动编码器的可解释嵌入:一种数据分析工具包
机构 * University of California, Berkeley(加州大学伯克利分校) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 预训练与数据 :LLM(abstract);分类 cs.AI、cs.LG
AI总结 研究针对大规模文本语料库分析难题,提出用稀疏自动编码器创建SAE嵌入,经四个任务验证其比大语言模型更具性价比、比密集嵌入更可控,通过案例研究展示其在研究模型行为上的作用,是用于非结构化数据分析的通用工具。
Comments ICML 2026. Project page and code: https://interp-embed.com
生物信息学中的生成式人工智能:模型、应用和方法进展的系统综述
机构 * Department of Computer Science and Engineering, United International University(计算机科学与工程系,国际联合大学) ; Department of Data Science and Artificial Intelligence, Monash University(数据科学与人工智能系,墨尔本大学) ; Department of Software Engineering, Lappeenranta-Lahti University of Technology(软件工程系,拉佩兰塔-拉赫蒂技术大学) ; Department of Computer Science and Engineering, Pennsylvania State University(计算机科学与工程系,宾夕法尼亚州立大学) ; Faculty of Science and Technology, Charles Darwin University(科学与技术学院,查尔斯达尔文大学)
专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI
AI总结 综述围绕六个问题评估GenAI在生物信息学中的策略,发现其支持多种分析,专业架构表现优,在分子分析等方面有益,存在局限,多种数据集助其发展,展现出推进计算生物学的潜力。
Comments Accepted: Archives of Computational Methods in Engineering Journal
Journal ref Arch Computat Methods Eng (2026)
一种用于空间物体行为特征刻画的自监督框架
机构 * Defence AI Research Centre, Defence & National Security, The Alan Turing Institute(国防人工智能研究中心,国防与国家安全,艾伦·图灵研究所) ; Department of Electronic and Electrical Engineering, University of Strathclyde(电子与电气工程系,斯特拉斯克莱德大学) ; GMV ; Aerospace Centre of Excellence, University of Strathclyde(航空航天卓越中心,斯特拉斯克莱德大学)
专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种自监督框架用于空间物体行为分析,通过预训练和微调实现异常检测、运动预测和合成数据生成,提升空间安全与可持续性。
Comments 18 pages, 10 figures
莫比乌斯学习:Transformer中的循环深度折叠
机构 * Zhejiang University(浙江大学)
专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG
AI总结 研究挑战Transformer中块作用与位置绑定的传统观点,提出基于循环深度折叠的莫比乌斯学习,同一组块在不同数据流中有不同应用时机,实现深度角色叠加,实验表明其在分布式训练中有优势,开辟新设计空间。
Orbis 2:一种用于驾驶的分层世界模型
机构 * University of Freiburg(弗莱堡大学)
专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 研究针对当前世界模型不足提出分层驾驶世界模型,跨两层分解预测,结合扩散强制预训练和教师强制微调,在长距离生成保真度等多方面取得领先成果。
Comments Project page: https://lmb-freiburg.github.io/orbis2.github.io/
生长-剪枝-冻结网络:用于嗅觉导航的自适应与持续学习技术
专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG
AI总结 提出生长-剪枝-冻结(GPF)网络框架,通过动态调整策略网络层数实现持续学习,在湍流羽流导航任务中达到94%成功率,并推广到其他机器学习任务。
Comments Accepted as poster to the Reinforcement Learning in Big Worlds Workshop at the 2026 Reinforcement Learning Conference
UTS在2026年ELOQUENT Voight-Kampff中的表现:人工智能写作中的结构转变绕过了最先进的检测器
机构 * University of Technology Sydney, Australia(澳大利亚技术大学)
专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI
AI总结 研究语言模型逃避攻击在对抗性微调中的情况,利用检测器漏洞不对称性,引入新攻击家族,其愚弄率更高且能保持自然度,实验表明现有对策无效,揭示检测器在结构分布外转变下有持续漏洞并助力竞赛表现。
Comments CLEF2026, ELOQUENT2026
优化并非你所需的全部
机构 * Scale AI(Scale人工智能公司) ; University of California, Santa Barbara(加州大学圣巴巴拉分校)
专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI
AI总结 研究指出优化并非全部,以GPT - 2为例,通过追踪其预训练等环节的优化文化,发现优化程序虽能测文本可能性,但无法区分不可能性是错误还是创新,却在五年内获设定语言协议权威。
Comments This essay will be forthcoming in MFS Modern Fiction Studies, published by JHUP (Spring-Summer 2027)
主动离线到在线强化学习
机构 * Virginia Commonwealth University(弗吉尼亚共同体大学) ; University of Virginia(弗吉尼亚大学)
专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 研究离线到在线强化学习中有限交互预算下的主动策略选择问题,提出基于未来性能上置信界主动选策略微调的方法,经实验验证其优于现有基线,能更有效利用预算,推动离线强化学习在现实系统的实际部署。
用于提高农业预测任务中机器学习性能的任务条件合成数据生成
机构 * Osnabrück University(奥斯纳布吕克大学) ; Leibniz Institute for Agricultural Engineering and Bioeconomy (ATB)(莱布尼茨农业工程与生物经济研究所(ATB)) ; German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))
专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 研究针对农业预测任务中训练数据受限影响机器学习性能的问题,提出任务条件合成数据生成算法TCSDG,结合贝叶斯网络生成器与表格基础模型,经实验验证其能有效提升性能,优于基准算法,提供实用框架。
何处切割,多深切割:化学SMILES上的字节对编码(BPE)与一元语法语言模型(Unigram-LM)
机构 * Independent Researcher(独立研究者)
专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG
AI总结 研究对比化学SMILES上的BPE和Unigram-LM,在固定化学基础、小词汇量规模及多种语料类型和预分词边界策略下,发现二者不收敛,构建几乎不相交的子词词汇表,Unigram-LM分词更多,表明子词算法是建模决策。
Transformer收敛到不变的算法核心
专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG
AI总结 研究从Transformer偶然行为转向必然操作,用算法核心提取(ACE)隔离子空间等,发现不同Transformer的功能冗余及语言模型主谓语一致的控制轴,揭示其有简单共享计算结构,针对不变量利于理解和控制机制。
EdgeBench:揭示从真实环境中学习的缩放定律
机构 * ByteDance(字节跳动)
专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.LG
AI总结 本文提出含134项长周期真实任务的EdgeBench平台,通过分析大量智能体交互数据,发现环境学习性能符合对数S型缩放定律,为智能体现实经验学习研究提供支撑。
用于音节切分的说话人解缠块级回归
机构 * JTEKT Corporation(捷太格特公司) ; Institute of Science Tokyo(东京理科大学) ; National Institute of Information and Communications Technology(国立情报通信研究机构)
专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI
AI总结 研究无监督音节切分问题,提出说话人解缠音节切分器,通过在固定长度块内将受说话人干扰的学生表示向干净教师目标回归,取得了音节边界检测和音节段聚类的最优性能。
Comments Accepted by IEEE Open Journal of Signal Processing (OJSP), 10 pages, 4 figures
何时越简单越好:评估中世纪拉丁文手稿的翻译管道
机构 * Eötvös Loránd University(厄特沃什·罗兰大学) ; King Fahd University of Petroleum and Minerals(法赫德国王石油与矿产大学)
专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI
AI总结 针对历史手稿翻译难题,提出评估中世纪拉丁文手稿图像到翻译流程的框架。通过CATMuS数据集对比发现领域特定OCR模型优势,引入新数据集IPC,实验揭示简单管道表现更佳,为低资源历史场景翻译系统部署提供基准与指导。
Comments 17 pages, preprint
GRAFT:用于零样本文本到语音中细粒度发音的嫁接参考音频
机构 * AGIGO ; ETH Zurich(苏黎世联邦理工学院) ; Sapienza University of Rome(罗马大学) ; University of Zurich(苏黎世大学)
专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG
AI总结 研究针对文本到语音神经编解码器语言建模中单词发音问题,提出GRAFT机制,通过短语音样本控制单词发音,经语音转换训练,提升发音效果,在多语言基准测试中表现出色。
低维子空间中的学习:强化学习的正交瓶颈
专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 提出一种在强化学习编码器特征中插入固定正交投影以约束低维子空间的简单先验,证明其在线性可实现性假设下保持表达能力,并在实验中显示价值表示可压缩至极低维度而不损失性能。
Comments Reinforcement Learning Conference (RLC) 2026
透明度作为架构:欧盟AI法案第50条II项中的结构性合规缺口
机构 * Technichal University Berlin XpaliNLP Group(柏林工业大学 XpaliNLP 组) ; Research Center for Artificial Intelligence (DFKI)(人工智能研究中心(DFKI)) ; Center for European Research on Trusted AI (CERTAIN)(欧洲可信人工智能研究中心(CERTAIN))
专题命中 预训练与数据 :LLM(abstract);分类 cs.AI、cs.LG
AI总结 本文探讨了欧盟AI法案第50条II项对AI生成内容的双重透明度要求,指出当前生成式AI系统存在结构性合规缺口,需将透明度视为架构设计需求。
Comments 10 pages, 2 figures