MixTeX: Data-Efficient LaTeX OCR via Synthetic Pretraining and Limited Fine-Tuning
MixTeX: 通过合成预训练和有限微调实现数据高效的LaTeX OCR
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 提出MixTeX,通过合成预训练(无需真实LaTeX源)和少量真实样本微调,实现数据高效的LaTeX OCR,在英中印刷和手写基准上优于依赖大数据集的方法。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
MixTeX: 通过合成预训练和有限微调实现数据高效的LaTeX OCR
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 提出MixTeX,通过合成预训练(无需真实LaTeX源)和少量真实样本微调,实现数据高效的LaTeX OCR,在英中印刷和手写基准上优于依赖大数据集的方法。
保障基础模型鲁棒性的自监督数据筛选
机构 * Queen's University Belfast(贝尔法斯特女王大学) ; University of Trento(特伦托大学)
专题命中 预训练与数据 :foundation model(title,abstract)
AI总结 针对自监督数据筛选面临的数据投毒风险,提出基于ImageBind和传统分类器的主动防御机制PDD,在多种攻击下有效检测中毒数据,SVM-PDD表现最优。
Comments 22 pages
SLAM-AGS:基于滑片标签的多任务预训练方法:利用自适应梯度手术的计算细胞学
机构 * University of Cambridge(剑桥大学)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 SLAM-AGS通过联合优化弱监督相似性和自监督对比性目标,提升下游任务性能,并利用自适应梯度手术解决任务梯度冲突,实现在低见证率下的稳定预训练和更优表现。
Comments 5 pages, 2 figures, Submitted to ISBI2026
Journal ref 2026 IEEE 23rd International Symposium on Biomedical Imaging (ISBI)
ActiveMimic: 基于主动感知的自我中心视频预训练
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Current Robotics ; NeoteAI
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 提出ActiveMimic框架,从自我中心人类视频中恢复同步的相机和手腕轨迹,将相机运动建模为视角动作,联合学习主动感知和操作技能,使预训练模型在机器人任务上达到与机器人数据预训练相当的性能。
Comments Project Page: https://activemimic.github.io/
BRepCLIP: 面向CAD理解的BRep基元对比多模态预训练
机构 * DFKI, Germany(德意志联邦共和国DFKI) ; RPTU Kaiserslautern-Landau, Germany(德国凯撒斯劳滕-兰道大学)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 提出BRepCLIP框架,通过对比预训练对齐CAD边界表示(BRep)几何与语言/图像嵌入,显著提升检索和零样本分类性能。
基于简化模型预训练与模型同伦启发迁移的足式机器人动态策略学习
机构 * Department of Mechanical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(机械工程系,韩国科学技术院(KAIST)) ; School of Interactive Computing, Georgia Institute of Technology(交互计算学院,佐治亚理工学院)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 提出一种延续学习框架,结合简化模型预训练和模型同伦启发迁移,高效生成和优化足式机器人的复杂动态行为,并在真实四足机器人上验证了翻转和墙面辅助等动态任务。
Comments 8 pages
Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 7, pp. 8068-8075, July 2026
结构引导混合掩码预训练与空间连续性正则化用于印刷电路板缺陷检测
机构 * Ahu.edu.cn(安徽大学)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 提出两阶段PCB缺陷检测框架,通过结构引导混合掩码预训练学习PCB结构先验,并在微调阶段引入空间连续性正则化提升细长缺陷定位紧凑性,在DsPCBSD+数据集上达到85.5% mAP0.5。
Comments Preprint. 38 pages, 12 figures, 6 tables
说谎只是一个阶段:语言模型扩展中的隐藏对齐转变
机构 * ZEHEN Labs(ZEHEN实验室)
专题命中 预训练与数据 :language model(title);分类 cs.CL、cs.AI、cs.LG
AI总结 通过分析63个基础模型,发现语言模型在特定规模阈值下,推理能力与真实性从反相关转变为正相关,并揭示了输出投影瓶颈和零竞争注意力头等内部机制。
Comments 15 pages, 8 figures, 2 tables. Companion paper: "The Growing Pains of Frontier Models: When Leaderboards Stop Separating and What to Measure Next." ( https://doi.org/10.48550/arXiv.2605.18840). Code: https://github.com/adilamin89/cape-scaling. Dashboard: https://zehenlabs.com/cape/
通过预训练和数据增强提高声学无人机检测的泛化能力
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 针对声学无人机检测泛化挑战,提出基于预训练和在线数据增强的紧凑型DNN检测器,显著提升跨域检测性能。
Comments Accepted to Quiet Drones 2026
语义引导的多模态掩码自编码器预训练用于3D BEV目标检测
机构 * University of Lincoln, Lincoln Centre for Autonomous Systems(林肯大学,林肯自主系统中心) ; University of Cambridge, Institute for Manufacturing, Department of Engineering(剑桥大学,制造研究所,工程系)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 提出语义引导的多模态掩码自编码器框架,通过语义引导的LiDAR体素掩码和辅助点语义解码分支,在预训练中注入语义信息,提升3D BEV目标检测性能。
Comments Accepted at the ICRA 2026 Workshop on Semantics for Reliable Robot Autonomy (SRRA) as a lightning talk and poster
理解几何基础模型对视觉-语言-动作模型的影响
机构 * Amazon Personal Robotics Group(亚马逊个人机器人小组) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 预训练与数据 :foundation model(title,abstract)
AI总结 本文通过线性探测分析量化了视觉-语言-动作模型(VLA)与几何基础模型(GFM)之间的“几何差距”,比较了三种注入几何信息的架构,并研究了非架构因素对几何VLA性能的影响。
图中标签真的在说些什么?用于视觉语言预训练中组合数据选择的反事实短语干预
机构 * Soongsil University(顺斯尔大学)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 本文研究了在视觉语言预训练中如何通过反事实短语干预来改进组合数据选择,提出了CPI方法以解决现有方法中全局过滤信号失效的问题,从而提升模型在关系识别任务上的表现。
Comments 11 pages, 2 figures, 4 tables. Preprint
对SSL预训练在相同和不同模态分割任务中转移性的基准测试
机构 * Department of Medical Physics, Memorial Sloan Kettering Cancer Center(医学物理系,纪念斯隆凯特勒癌症中心)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 本文通过九种SSL方法在相同和不同模态的分割任务中进行基准测试,评估了预训练模型的迁移能力和效率,发现自蒸馏masked image transformer在分割精度、收敛速度和少量样本到大量样本的性能差距方面表现最佳。
Comments Paper submitted to Medical Physics for review
基于上下文的代码预训练用于代码生成
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 本文提出了一种基于上下文的代码预训练方法,通过整合调用上下文来改进代码生成模型的训练和评估,实验表明该方法在代码生成任务中表现优异。
AdaptSplat: 为前馈3D高斯点划法适应视觉基础模型
机构 * Ke Holdings Inc.(凯控股公司)
专题命中 预训练与数据 :foundation model(title,abstract)
AI总结 本文提出AdaptSplat,通过在通用架构中引入一个仅含1.5M参数的轻量级适配器,有效提升了前馈3D高斯点划法在跨领域泛化和高频几何保真度方面的性能。
动态点云的扩散掩码预训练
机构 * Xi’an Jiaotong University(西安交通大学) ; School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) ; University of Western Australia(西澳大学)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 本文提出DiMP框架,通过引入扩散建模解决动态点云预训练中位置泄露和运动监督问题,提升下游任务性能。
跨尺度预训练:增强低分辨率卫星图像的自监督学习以用于语义分割
机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 本文提出跨尺度预训练方法,利用高分辨率数据提升低分辨率图像的表示学习和分割性能,通过设计空间亲和组件改进自监督学习框架。
LA-Pose:潜在动作预训练与姿态估计
机构 * Wayve ; Simon Fraser University(西蒙弗雷泽大学)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 本文通过自监督预训练视角重新审视相机姿态估计,提出逆动力学预训练作为替代全监督训练的方法。通过逆向和正向动力学模型学习潜在动作表示,将潜在动作特征用于相机姿态估计,实现高精度且可推广的姿态预测。
Comments Project page: https://la-pose.github.io/
对比学习太阳物理图像预训练用于太阳动力学观测记录
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 本文提出SolarCHIP,通过对比学习预训练视觉骨干网络,解决太阳成像中的多模态传感、弱类间分离性和强类内变化性问题,提升跨模态翻译和日冕闪分类性能。
Comments arXiv admin note: This submission has been withdrawn due to violation of arXiv policies for acceptable submissions
CLLAP:基于对比学习的激光雷达增强预训练用于增强雷达-相机融合
机构 * Wuhan University of Technology(武汉理工大学) ; University of North Carolina at Charlotte(北卡罗来纳州立大学) ; Wuhan University(武汉大学) ; Southwest Jiaotong University(西南交通大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 CLLAP通过利用丰富的激光雷达数据生成伪雷达数据,结合双阶段双模态对比学习策略,提升雷达-相机融合模型的特征提取能力,实验证明在NuScenes和Lyft Level 5数据集上显著提升3D目标检测性能。
Comments accepted by 2026 CVPR Findings
方向对齐与人类-大语言模型共写中的叙事自主性
专题命中 预训练与数据 :LLM(title,abstract)
AI总结 研究人类-大语言模型共写中的叙事自主性,探讨谁主导故事发展。通过87个共写故事分析,发现人类引入更多语义新颖性,而大语言模型则扩展人类元素,情感层面也呈现双向互动。
Comments 11 pages, 13 figures
基于机器人基础模型的策略对比解码
机构 * University of Electronic Science and Technology of China(电子科学与技术大学) ; Southwest Jiaotong University(西南交通大学) ; Tongji University(同济大学)
专题命中 预训练与数据 :foundation model(title,abstract)
AI总结 本文提出Policy Contrastive Decoding方法,通过对比原始与物体遮挡的视觉输入,提升机器人策略的泛化能力,实验表明其在仿真和现实环境中均有效。
Comments ICLR 2026. Project website: https://koorye.github.io/PCD/
面向迭代图像尺寸无关视觉变换器的自监督预训练
机构 * INSAIT, Sofia University "St. Kliment Ohridski", Bulgaria(INSAIT,索菲亚大学"圣克莱门特·奥赫里迪斯",保加利亚)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 本文提出基于DINO自蒸馏目标的新型序列到全局自监督学习框架,通过高效积分图像补丁提取方法实现图像尺寸无关的视觉编码器大规模预训练,取得ImageNet-1K和下游分类任务的竞争力表现。
ToLL: 基于非对称跨视图结构蒸馏的拓扑布局学习用于3D场景图生成预训练
机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 本文提出ToLL框架,通过拓扑几何推理和结构多视图增强,解决3D场景图生成预训练中的几何捷径问题,提升场景图生成质量。
Comments Under Reivew
通过分离前向和逆向动力学预训练实现解耦的机器人学习
机构 * Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; Eastern Institute of Technology, Ningbo(宁波东部技术研究所) ; Shanghai Innovation Institute(上海创新研究院) ; Tsinghua University(清华大学)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 本文提出DeFI框架,通过分离前向和逆向动力学预训练,利用不同数据源解决视觉-动作耦合问题,实现端到端微调,实验表明在CALVIN ABC-D和SimplerEnv上取得最佳性能。
Comments ICLR 2026
MixAtlas: 多模态大语言模型中训练过程中的数据混合优化方法
机构 * Apple(苹果公司) ; University of Washington(华盛顿大学) ; Virginia Tech(弗吉尼亚理工学院)
专题命中 预训练与数据 :LLM(title);分类 cs.CL、cs.AI、cs.LG
AI总结 MixAtlas通过双轴分解训练语料,结合小代理模型与高斯过程代理,优化多模态大语言模型的训练混合策略,提升性能和泛化能力。
从文本过程描述自动生成BPMN模型:一种多阶段大语言模型驱动的方法
专题命中 预训练与数据 :LLM(title,abstract)
AI总结 本文提出一种多阶段大语言模型驱动的方法,通过多语言BPMN XML文件翻译、验证和修复生成可靠数据,从而自动生成可执行的BPMN 2.0模型,实现高相似度的重建。
细胞分割模型的自监督预训练
机构 * School of Computer Science, Georgia Institute of Technology(佐治亚理工学院计算机科学学院) ; School of Materials Science and Engineering, Georgia Institute of Technology(佐治亚理工学院材料科学与工程学院) ; Department of Biomedical Engineering, Georgia Institute of Technology(佐治亚理工学院生物医学工程系) ; School of Mechanical Engineering, Georgia Institute of Technology(佐治亚理工学院机械工程学院)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 本文提出DINOCell,通过自监督学习和微调提升细胞实例分割性能,实验显示其在LIVECell基准上表现优于现有模型。
Comments 14 pages, 6 figures
基于生物标志物的预训练用于心电图中的查加斯病筛查
机构 * Akershus University Hospital(阿克什胡斯大学医院) ; University of Oslo(奥斯陆大学)
专题命中 预训练与数据 :pretraining(title,abstract)
AI总结 本文提出基于生物标志物的预训练方法,通过MIMIC-IV-ECG数据集训练ECG特征提取器,再在巴西数据集上微调以检测查加斯病,五模型集成在PhysioNet 2025挑战中取得第5名。
Journal ref Computing in Cardiology 2025; Vol 52
通过级联提示和基于ICL的在线强化学习增强对话式TTS
专题命中 预训练与数据 :prompting(title,abstract)
AI总结 本文提出一种级联框架,结合文本风格标记和高质量音频提示,实现单次适应细粒度语音风格和角色声音,并引入基于ICL的在线强化学习策略提升生成质量。