Stratified Sampling for Model-Assisted Estimation with Surrogate Outcomes
分层抽样用于模型辅助估计的替代性结果
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
AI总结 本文提出分层抽样方法,用于模型辅助估计中替代性结果的高效利用,通过优化分配规则提升估计效率。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
分层抽样用于模型辅助估计的替代性结果
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
AI总结 本文提出分层抽样方法,用于模型辅助估计中替代性结果的高效利用,通过优化分配规则提升估计效率。
自适应去偏Tsallis熵用于测试时适应
机构 * Nanjing University of Science and Technology(南京理工大学) ; Alibaba Cloud(阿里云) ; University of Texas at Dallas(德克萨斯大学达拉斯分校) ; University of Sussex(Sussex 大学) ; Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 预训练与数据 :language model(abstract);pretraining(abstract)
AI总结 本文提出自适应去偏Tsallis熵用于测试时适应,通过引入非广延参数q来缓解预训练数据偏差,提升模型适应性能。
Comments Accepted for publication at ICLR 2026; 24 pages; 5 figures
ALIVE: 用逼真音频视频生成动画你的世界
机构 * Bytedance ALIVE Team(字节跳动ALIVE团队)
专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)
AI总结 ALIVE通过结合预训练文本到视频模型与新的音频视频生成技术,实现了逼真的音频视频生成和动画,展示了优于开源和商业解决方案的性能。
Comments Technical report for ALIVE. Bytedance ALIVE Team. Homepage: https://foundationvision.github.io/Alive/
InterPrior:为基于物理的人-物体交互扩展生成控制
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon(亚马逊)
专题命中 预训练与数据 :pretraining(abstract);post-training(abstract)
AI总结 InterPrior通过大规模模仿预训练和强化学习微调,扩展生成控制以实现人形机器人在多样环境下泛化移动-操作技能。
Comments Webpage: https://sirui-xu.github.io/InterPrior/
数据验证是量子计算copilot的未来
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
AI总结 本研究提出数据验证在量子计算copilot和AI自动化中的重要性,强调验证作为架构基础的必要性,通过实验表明未验证的LLMs在电路优化中准确率仅为79%。
Comments 13 Pages, 20 Figures. Accepted to AAAI 2026 Workshop on AI4Research. Comments welcome
OpenOneRec 技术报告
专题命中 预训练与数据 :pretraining(abstract);post-training(abstract)
AI总结 OpenOneRec 通过 RecIF-Bench 和大规模数据集提升推荐系统智能,展示模型在复杂任务中的卓越表现。
DuoGen:迈向通用的交错多模态生成
机构 * Georgia Tech(佐治亚理工学院) ; NVIDIA research.nvidia.com/labs/dir/duogen(NVIDIA 研究所)
专题命中 预训练与数据 :LLM(abstract);pretraining(abstract)
AI总结 DuoGen通过系统性地解决数据整理、架构设计和评估问题,实现了通用的交错多模态生成,提升了文本质量、图像保真度和图像-上下文对齐性能。
Comments Technical Report. Project Page: https://research.nvidia.com/labs/dir/duogen/
基于文本的在线动作检测
机构 * Department of Computer Technology, University of Alicante(阿拉维大学计算机技术系) ; ValgrAI - Valencian Graduate School and Research Network of Artificial Intelligence(瓦伦西亚人工智能研究生学校和研究网络) ; Institute of Informatics Research, University of Alicante(阿拉维大学信息研究所)
专题命中 预训练与数据 :language model(abstract);pretraining(abstract)
AI总结 本文提出TOAD模型,利用CLIP文本嵌入实现高效的零样本和少样本在线动作检测,其在THUMOS14数据集上的mAP达到82.46%
Comments Published in Integrated Computer-Aided Engineering
Journal ref Integrated Computer-Aided Engineering. 2025;32(4):415-423
HERS:隐藏模式专家学习用于扩散模型中特定风险车辆损伤适应
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
AI总结 HERS通过领域特定专家学习提升扩散模型中车辆损伤生成的保真度与可控性,提高保险领域应用的安全性与可靠性。
Comments 26 pages
TIGaussian: 解耦高斯分布以实现空间感知的图文-3D对齐
机构 * Unmanned Vehicle Dept., Cainiao Inc., Alibaba Group, Hangzhou, China(阿里巴巴集团 Cainiao 无人机部门,杭州,中国) ; Hillbot, Sunnyvale, USA(Hillbot,美国 Sunnyvale) ; Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国)
专题命中 预训练与数据 :language model(abstract);pretraining(abstract)
AI总结 TIGaussian通过多分支3DGS分词器和模态特定对齐策略,实现空间感知的图文-3D跨模态对齐,提升3D相关任务的预训练效果。
通过合成视频评估VLMs的情境与空间意识
机构 * Delft University of Technology(代尔夫特理工大学)
专题命中 预训练与数据 :language model(abstract);pretraining(abstract)
AI总结 本文提出一个合成基准,评估VLMs在区分暴力与无害活动、跨视角角色绑定及细粒度轨迹对齐方面的性能,发现其表现仅略高于随机水平,且稳定颜色线索仅部分缓解了问题。
未来光流预测改进机器人控制与视频生成
机构 * Salesforce AI Research(Salesforce AI研究院) ; Stony Brook University(石溪大学)
专题命中 预训练与数据 :language model(abstract);pretraining(abstract)
AI总结 FOFPred通过统一的视觉-语言模型和扩散架构,实现高效的未来光流预测,提升机器人控制与视频生成的性能。
Comments Project Site (Code, Models, Demo): https://fofpred.github.io
PMOA-TTS:引入PubMed开放获取文本时间序列语料库
机构 * Machine Learning Department, School of Computer Science(计算机科学系机器学习部门) ; Heinz College of Information Systems and Public Policy(信息系统与公共政策学院) ; National Library of Medicine(国家医学图书馆)
专题命中 预训练与数据 :prompting(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 PMOA-TTS通过大规模语言模型管道构建,为时间序列分析提供结构化文本时间线,支持时间推理、生存建模和事件预测研究。
LiteEmbed: 适应CLIP的稀有类别
机构 * CVIT, Kohli Centre for Intelligent Systems, IIIT Hyderabad, India(印度海得拉巴IIIT大学计算机视觉研究所、Kohli智能系统中心) ; Adobe Research, Bengaluru, India(印度班加罗尔Adobe研究)
专题命中 预训练与数据 :language model(abstract);pretraining(abstract)
AI总结 LiteEmbed通过子空间优化和双目标方法,实现CLIP在稀有类别上的少样本个性化,提升分类和检索任务的性能。
Comments 14 pages, 12 figures
DiffSampling:提升神经文本生成的多样性和准确性
机构 * Alma Mater Studiorum Università di Bologna(博洛尼亚大学) ; University College London(伦敦大学学院)
专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 DiffSampling通过分析令牌概率分布,提升神经文本生成的多样性和准确性,实验表明其在质量上与现有方法相当。
Comments Published in Transactions on Machine Learning Research (2025), see https://tmlr.infinite-conf.org/paper_pages/kXjHbMvdIi.html
LingVarBench:在电话通话记录中对LLM进行实体识别和语言表达模式的基准测试
机构 * Infinitus Systems, Inc.(Infinitus系统公司)
专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 LingVarBench通过生成语言变化的训练数据,提升LLM在电话记录中提取结构化实体和主观问卷项目的能力,优化提示工程并提高鲁棒性。
Comments Accepted to EACL 2026 (Industry Track); to appear in the proceedings
从生成数据中进行潜在重建用于多模态虚假信息检测
机构 * Information Technology Institute, Centre for Research & Technology, Hellas(信息科技研究所,研究中心,希腊) ; Department of Electrical & Computer Engineering, Aristotle University of Thessaloniki(电气与计算机工程系,亚里士多德大学)
专题命中 预训练与数据 :language model(abstract);prompting(abstract)
AI总结 本研究提出MisCaption This!框架和LAMAR网络,通过生成高保真度的误标数据和潜在重建技术,提升多模态虚假信息检测的性能。
数字人偶与制度设计:突破实验瓶颈
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
AI总结 本文提出利用生成式AI驱动的数字人偶方法,通过模拟人类行为生成合成数据,以突破民主研究中的实验瓶颈,提升制度创新的效率与可行性。
Comments 28 pages
对人类图像伪造的总体方法
机构 * Michigan State University(密歇根州立大学)
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
AI总结 HuForDet通过双分支架构,结合异构专家和多模态大语言模型,实现了对人类图像伪造的全面检测,提升了对各类伪造的检测性能和鲁棒性。
Comments 6 figures, 5 tables
PROMISE: 过程奖励模型解锁生成推荐的测试时扩展定律
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
AI总结 PROMISE通过整合密集逐步验证和PRM引导的束搜索策略,解决生成推荐中的语义漂移问题,提升推荐准确性并实现高效部署。
DAVE: 一种用于文档理解与网络代理的视觉编码器
机构 * MIT-IBM Watson AI Lab(MIT-IBM Watson AI实验室) ; UC Berkeley(加州大学伯克利分校) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 预训练与数据 :language model(abstract);pretraining(abstract)
AI总结 DAVE是一种专为文档理解和网络代理设计的视觉编码器,通过自监督和监督预训练结合模型融合策略,提升对文档和网络任务的适应性与性能。
RAGPart & RAGMask:对抗检索增强生成中语料污染的检索阶段防御
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
AI总结 本文提出RAGPart和RAGMask两种检索阶段防御方法,用于对抗RAG中语料污染攻击,通过文档分区和标记遮蔽技术降低攻击成功率,提升RAG系统的鲁棒性。
Comments Published at AAAI 2026 Workshop on New Frontiers in Information Retrieval [Oral]
VADTree: 通过分层粒度感知树实现可解释的无训练视频异常检测
机构 * School of Software, Xi’an Jiaotong University(西安交通大学软件学院) ; China Railway Xi’an Group(中国铁路西安集团) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
AI总结 VADTree通过分层粒度感知树结构实现无训练视频异常检测,利用预训练模型知识和多维先验提升异常感知与推理能力。
Comments NeurIPS 2025 poster
DNAMotifTokenizer: 向生物信息学导向的基因组序列分词迈进
专题命中 预训练与数据 :language model(abstract);pretraining(abstract)
AI总结 DNAMotifTokenizer通过整合DNA序列模因的生物知识,提升了基因组序列分词的性能和可解释性。
Comments Preprint
Step-GUI 技术报告
机构 * GELab-Team(GELab团队)
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
AI总结 Step-GUI 是一种先进的 GUI 代理,通过自我进化训练管道和 GUI-MCP 协议,在保持高准确率的同时实现高效隐私保护的 GUI 自动化。
Comments 41 pages, 26 figures
Exo2Ego:基于外部知识引导的多模态大语言模型用于第一人称视频理解
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
AI总结 Exo2Ego通过迁移学习提升内向视频理解能力,利用外向知识增强模型性能。
Comments This paper is accepted by AAAI 2026
MFGDiffusion:基于掩码的烟雾合成以提升森林火灾检测
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
AI总结 MFGDiffusion通过掩码引导的烟雾合成提升森林火灾检测性能
Comments 14 pages, 11 figures
记忆问题:我们能否信任LLMs的经济预测?
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
AI总结 本文研究了LLMs在经济预测中的记忆问题,发现其能够记忆训练数据中的经济金融信息,且无法通过简单指令或屏蔽防止,表明LLMs的预测能力可能受限于记忆而非真正的预测能力。
隐性理解游戏(TUG):预测人际兼容性
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
AI总结 TUG通过玩家单字选择预测人际兼容性,利用隐私保护信号实现关系匹配,为社交平台提供新设计方法。
无监督获取离散语法范畴
机构 * Leiden University Centre for Linguistics (LUCL)(莱顿大学语言研究中心) ; Leiden University(莱顿大学) ; Leiden Institute for Brain and Cognition (LIBC)(莱顿脑与认知研究所) ; City University of Hong Kong (CityU)(香港城市大学)
专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过多代理系统无监督学习母语的语法范畴,利用统计分析生成离散语法规则,并验证了非平凡语法知识的获取。
Comments 34 pages, 3 figures, 7 tables. Related work: Shakouri et al., arXiv:2512.02195