arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 139420 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2601.00417 2026-07-29 cs.LG cs.AI cs.CL cs.CV 版本更新 75%

Deep Delta Learning

深度delta学习

Yifan Zhang, Yifeng Liu, Mengdi Wang, Quanquan Gu

机构 * Princeton University(普林斯顿大学) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出深度delta学习,通过选择性重写残差内容提升语言模型性能,改进了Transformer残差流的更新机制。

Comments Project Page: https://github.com/yifanzhang-pro/deep-delta-learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24276 2026-07-28 cs.CL cs.AI cs.LG 新提交 75%

The Tokenizer Tax: Quantifying and Explaining the Cross-Lingual Cost of Subword Tokenization for Indian Languages

分词器代价:量化并解释印度语言子词分词的跨语言成本

Priyansh Srivastava

机构 * Sirena Ai India(印度Sirena人工智能公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究量化印度语言子词分词跨语言成本,测量六种分词器在十四种语言上的分词丰富度,揭示字节对合并失败是高代价主因,多语言分词器可降低代价,还发现分词与阅读理解性能关联受语言资源可用性影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20310 2026-07-23 q-bio.NC 新提交 75%

Capturing Inner Experience At Scale: An AI Interviewer Co-Developed with the Founder of a Landmark Phenomenological Method

大规模捕捉内心体验:与一种具有里程碑意义的现象学方法的创始人共同开发的人工智能访谈者

Jona Carmon, Clara Bersch, Charles Fernyhough, Russell T. Hurlburt, Simone Kühn

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究聚焦于主观体验研究中深度与规模的权衡问题,核心方法是将描述性经验抽样法转化为人工智能访谈者的推理架构,主要贡献是开发出首个基于既定方法研究内心体验的人工智能访谈者及相关平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02776 2026-07-14 cs.RO 版本更新 75%

XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations

XR-1:通过学习统一的视觉-运动表示实现多功能的视觉-语言-动作模型

Shichao Fan, Kun Wu, Zhengping Che, Xinhua Wang, Di Wu, Fei Liao, Ning Liu, Yixue Zhang, Zhen Zhao, Zhiyuan Xu, Meng Li, Qingjie Liu, Shanghang Zhang, Min Wan, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics, Beijing, China(北京人形机器人创新中心,北京,中国) School of Mechanical Engineering and Automation, Beihang University, Beijing, China(北京航空航天大学机械工程及自动化学院,北京,中国) State Key Laboratory of Virtual Reality Technology and Systems, SCSE, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,SCSE,北京航空航天大学,北京,中国) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(多媒体信息处理国家重点实验室,计算机科学学院,北京大学,北京,中国)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 XR-1通过学习统一的视觉-运动表示,解决视觉-语言-动作模型在低级动作生成和跨数据源领域差距的挑战,提出三阶段训练方法并验证了其在多种机器人和任务上的优越性能。

Comments Accepted to ICML2026 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04939 2026-07-07 cs.SE 新提交 75%

Teaching LLMs a Low-Resource Language: Enhancing Code Completion in Pharo

教大语言模型一种低资源语言:增强Pharo中的代码补全

Kilian Kier, Alessandro Giagnorio, Omar AbedelKader, Oleksandr Zaitsev, Robert Peharz, Romain Robbes, Gabriele Bavota, Stéphane Ducasse

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究将基于大语言模型的代码补全引入低资源语言Pharo,介绍结合特定数据处理、预训练与微调的端到端流程,引入基准测试,实证表明专用模型性能超越原模型及更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01218 2026-07-02 cs.CL cs.AI cs.LG 新提交 75%

The State-Prediction Separation Hypothesis

状态-预测分离假说

Giovanni Monea, Nathan Godey, Kianté Brantley, Yoav Artzi

机构 * Cornell University(康奈尔大学) Harvard University(哈佛大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出状态-预测分离假说,通过双流Transformer解耦状态存储与下一词预测,在预训练中提升数据与计算效率,下游任务平均提升2-3个百分点。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26122 2026-06-26 cs.CV 新提交 75%

DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents

DocArena:将原始文档转化为可控的训练环境用于文档搜索代理

Jiamian Wang, Ruiyi Zhang, Tong Yu, Jing Shi, Samyadeep Basu, Rajiv Jain, Zhiqiang Tao, Tong Sun

机构 * Rochester Institute of Technology(罗切斯特理工学院) Adobe Research(Adobe研究院)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn)

AI总结 提出DocArena自动化流程,通过多模态文档结构化、推理型QA对构建和质量控制,生成可控训练环境,使基于文本LLM的搜索代理在多模态文档检索和问答中取得最佳性能。

Comments search agent for documents

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20173 2026-06-19 cs.SE 新提交 75%

Qiskit Code Migration with LLMs

使用大语言模型进行Qiskit代码迁移

Jose Manuel Suarez, Luis Mariano Bibbo, Joaquin Bogado, Alenandro Fernandez

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对量子软件开发套件版本演进导致的代码维护问题,提出结合大语言模型与检索增强生成(RAG)的混合方法,利用自动生成的迁移场景分类体系引导模型,实现Qiskit代码跨版本自动迁移,有效减少幻觉并提升迁移建议质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15551 2026-06-18 cs.CL cs.AI cs.LG 版本更新 75%

Rethinking Cross-lingual Gaps from a Statistical Viewpoint

从统计视角重新思考跨语言差距

Vihari Piratla, Purvam Jain, Darshan Singh, Trevor Cohn, Preethi Jyothi, Partha Talukdar

机构 * Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出跨语言差距源于目标语言响应方差,通过形式化偏差和无偏误差,并采用推理时集成方法降低方差,使跨语言迁移得分提升8%-50%以上。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18237 2026-06-17 cs.CL cs.AI cs.LG 新提交 75%

ReproRepo: Scaling Reproducibility Audits with GitHub Repository Issues

ReproRepo: 利用 GitHub 仓库问题扩展可重复性审计

Shanda Li, Qiuhong Anna Wei, Jingwu Tang, Valerie Chen, Nihar B Shah, Tim Dettmers, Yiming Yang, Ameet Talwalkar

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) Datadog

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出 ReproRepo 框架,利用 GitHub issues 作为监督信号,对 1149 篇论文进行可重复性评估,发现 Codex with GPT-5.5 能识别约 90% 论文的语义相关复现问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08289 2026-06-16 cs.CR 版本更新 75%

MIRAGE: Misleading Retrieval-Augmented Generation via Black-box and Query-agnostic Poisoning Attacks

MIRAGE: 通过黑盒与查询无关的投毒攻击误导检索增强生成

Tailun Chen, Yu He, Yan Wang, Shuo Shao, Haolun Zheng, Zhihao Liu, Jinfeng Li, Zhizhen Qin, Yuefeng Chen, Zhixuan Chu, Zhan Qin, Kui Ren

专题命中 预训练与数据 :LLM(abstract,abstract_cn);preference optimization(abstract)

AI总结 提出MIRAGE,一种在黑盒和查询无关场景下通过多阶段投毒管道攻击RAG系统的方法,利用代理模型反馈、人物驱动查询合成、语义锚定和对抗性TPO优化,显著提升攻击效果和隐蔽性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00809 2026-06-10 cs.CV 版本更新 75%

Let ViT Speak: Generative Language-Image Pre-training

让ViT说话:生成式语言-图像预训练

Yan Fang, Mengcheng Lan, Zilong Huang, Weixian Lei, Yunqing Zhao, Yujie Zhong, Yingchen Yu, Qi She, Yao Zhao, Yunchao Wei

机构 * Beijing Jiaotong University(北京交通大学) ByteDance(字节跳动) Nanyang Technological University(南洋理工大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出GenLIP框架,通过语言建模目标直接训练ViT从视觉token预测语言token,无需对比学习或额外文本解码器,实现简单、可扩展且性能优异的视觉编码器。

Comments 27 pages, 11 figures. Code and models are available at https://github.com/YanFangCS/GenLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03391 2026-06-03 cs.LG cs.AI cs.CL 75%

When Model Merging Breaks Routing: Training-Free Calibration for MoE

当模型合并破坏路由:MoE的无训练校准

Canbin Huang, Tianyuan Shi, Xiaojun Quan, Jingang Wang, Jianfei Zhang, Qifan Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 预训练与数据 :LLM(abstract_cn);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对MoE架构中模型合并导致的路由崩溃问题,提出基于二阶曲率的无训练校准方法HARC,通过闭式解和共轭梯度法高效重对齐路由器,显著提升数学推理和代码生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28522 2026-05-28 cs.IR 75%

Search for Coverage: Learning Coverage-Aware Retrieval with Augmented Sub-Question Answerability

搜索覆盖:学习基于增强子问题可回答性的覆盖感知检索

Jia-Huei Ju, Eugene Yang, Trevor Adriaanse, Suzan Verberne, Andrew Yates

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn)

AI总结 提出CoveR,一种通过覆盖对比和蒸馏目标训练的密集检索方法,结合LLM生成的子问题可回答性信号,在长文本RAG中提升覆盖度10%而不牺牲相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26019 2026-05-26 cs.LG cs.AI cs.CL 75%

Retrieval-Augmented Detection of Potentially Abusive Clauses in Chilean Terms of Service

智利服务条款中潜在滥用条款的检索增强检测

Christoffer Loeffler, Tomás Rey Pizarro, Daniel Ignacio Miranda Vásquez, Andrea Martínez Freile

机构 * School of Computer Engineering, Pontificia Universidad Católica de Valparaíso(Pontificia Universidad Católica de Valparaíso计算机工程学院) Faculty of Law, Universidad Adolfo Ibáñez(Adolfo Ibáñez大学法学院)

专题命中 预训练与数据 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出检索增强生成框架,结合混合稠密-稀疏检索与提示增强,用于自动检测和分类智利服务条款中的潜在滥用条款,并引入包含100份合同和10,029条标注条款的语料库,实验表明该方法显著提升性能,使本地模型接近云端系统。

Comments 42 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21433 2026-05-21 cs.SD 75%

Instrumental Text-to-Music Generation with Auxiliary Conditioning Branches

通过辅助条件分支进行乐器文生成

Junyoung Koh

机构 * Department of Artificial Intelligence(人工智能系) Yonsei University(延世大学) MAAP KRAFTON Seoul, Republic of Korea(韩国首尔)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 本文研究了在无外部预训练的情况下,通过控制数据和预训练来隔离有效设计选择的问题,发现去除辅助分支的模型在多个评估指标上表现较差,而增加DiT深度只能小幅恢复性能,表明辅助分支可能在训练时起到架构锚定作用。

Comments ICME 2026 Grand Challenge on Academic Text-to-Music Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18732 2026-05-19 cs.CL cs.AI cs.LG 75%

Predictable Confabulations: Factual Recall by LLMs Scales with Model Size and Topic Frequency

可预测的编造:大型语言模型的事实回忆能力随模型大小和主题频率而增加

Matthew L. Smith, Jonathan P. Shock, Samuel T. Segun, Iyiola E. Olatunji, Tegawendé F. Bissyandé

机构 * International Development Research Centre Canada(加拿大国际发展研究中心) University of Cape Town(开普敦大学) Global Center on AI Governance(人工智能治理全球中心) SnT, University of Luxembourg(卢森堡大学SnT分校) CITADEL AI Centre of Excellence, Burkina Faso(布基纳法索CITADEL人工智能卓越中心)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了大型语言模型在事实回忆方面的可预测性,发现模型大小和训练数据中主题频率是影响回忆质量的关键因素,且模型大小和主题频率的组合能解释60%-94%的方差。

Comments 18 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15711 2026-05-18 cs.CV 75%

EntropyScan: Towards Model-level Backdoor Detection in LVLMs via Visual Attention Entropy

EntropyScan: 向通过视觉注意力熵实现LVLMs的模型级后门检测

Xuanyu Ge, Zhongqi Wang, Jie Zhang, Shiguang Shan, Xilin Chen

机构 * China University of Geosciences(中国地质大学) University of the Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出EntropyScan,一种轻量且不依赖触发器的模型级后门检测方法,通过量化视觉注意力分布的结构扭曲来检测后门模型,实验显示其在两个LVLM架构和三种高级攻击场景中达到98.5%的F1分数和96.6%的AUC。

Comments 20 pages, 6 figures, 8tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21850 2026-05-18 cs.CV 75%

Visual Compositional Tuning

视觉组合调谐

Xindi Wu, Hee Seung Hwang, Polina Kirichenko, Esin Tureci, Olga Russakovsky

机构 * Princeton University(普林斯顿大学) Meta AI

专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出COMPACT方法,通过组合多个基本视觉能力提升视觉指令调谐数据效率,减少训练样本数量并提升多模态任务性能。

Comments See the project website at this [URL](https://princetonvisualai.github.io/compact/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06615 2026-05-08 cs.LG cs.AI cs.CL math.OC 75%

When and Why SignSGD Outperforms SGD: A Theoretical Study Based on $\ell_1$-norm Lower Bounds

何时以及为何SignSGD优于SGD:基于ℓ1范数下界的一个理论研究

Hongyi Tao, Dingzhi Yu, Lijun Zhang

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过分析ℓ1范数站稳性、ℓ∞光滑性和可分离噪声模型,揭示SignSGD在稀疏噪声下比SGD更高效的原因,并证明其在矩阵域中的最优性。

Comments Code is available at https://github.com/Dingzhen230/SignSGD_Outperforms_SGD

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21816 2026-04-22 cs.SE 75%

From Task to Tutorial: An Automated GUI Framework for Excel Tutorial Document and Video Creation

从任务到教程:一种自动化生成Excel教程文档和视频的GUI框架

Yuhang Xie, Jian Mu, Xiaojun Ma, Chaoyun Zhang, Lu Wang, Mengyu Zhou, Mugeng Liu, Si Qin, Qingwei Lin, Saravan Rajmohan, Shi Han, Dongmei Zhang

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出首个自动化生成Excel教程的框架,通过自然语言任务描述生成结构化文档和视频,提升教程质量和效率,减少人工劳动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17211 2026-04-21 cs.CV 75%

EmbodiedHead: Real-Time Listening and Speaking Avatar for Conversational Agents

EmbodiedHead:面向对话代理的实时听与说的虚拟形象

Yu Zhang, Kaiyuan Shen, Yang Li

机构 * School of Computer Science and Technology, East China Normal University, Shanghai, China(东华大学计算机科学与技术学院,上海,中国) Garabido Shanghai Technology Co., Ltd., Shanghai, China(Garabido上海科技有限公司,上海,中国)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 本文提出EmbodiedHead框架,通过实时语音驱动生成高质量对话代理虚拟形象,解决实时生成、统一听说行为和视觉质量的难题。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11269 2026-04-14 eess.AS 75%

Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS

带有说话者属性的自动语音识别使用语音感知的LLMS

Hagai Aronowitz, Zvi Kons, Avihu Dekel, George Saon, Ron Hoory

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出通过微调语音感知LLM实现带说话者属性的自动语音识别,引入说话者聚类标签提升识别精度,并通过数据增强方法解决训练数据限制问题。

Comments \c{opyright} 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15640 2026-04-14 cs.LG cs.AI cs.CL 75%

Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training

数据混合代理:学习重新加权领域以实现持续预训练

Kailai Yang, Xiao Liu, Lei Ji, Hao Li, Xiao Liang, Zhiwei Liu, Yeyun Gong, Peng Cheng, Mao Yang

机构 * The University of Manchester(曼彻斯特大学) Microsoft Research(微软研究院) Imperial College London(伦敦帝国学院) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出数据混合代理,通过强化学习学习重新加权领域,实现持续预训练中的平衡性能,优于现有基线方法,并在未见过的领域中表现良好。

Comments Accepted by the ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08423 2026-04-10 cs.CL cs.AI cs.LG stat.ML 75%

Synthetic Data for any Differentiable Target

为任何可微目标生成合成数据

Tristan Thrush, Sung Min Park, Herman Brunborg, Luke Bailey, Marcel Roed, Neil Band, Christopher Potts, Tatsunori Hashimoto

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Dataset Policy Gradient方法,通过合成数据生成器优化生成针对性示例,使目标模型在可微度量上表现优异,展示了通过合成数据改变模型属性的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08021 2026-04-10 cs.DB 75%

SynQL: A Controllable and Scalable Rule-Based Framework for SQL Workload Synthesis for Performance Benchmarking

SynQL: 一种可控且可扩展的基于规则的SQL工作负载合成框架用于性能基准测试

Kahan Mehta, Amit Mankodi

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SynQL通过遍历数据库外键图生成结构多样且可执行的SQL工作负载,解决现有合成工具在训练数据缺口上的不足,通过配置向量控制连接拓扑和分析强度,实验表明其合成数据能有效训练成本模型。

Comments 24 pages, 3 figures, Submitted to International Journal of Data Science and Analytics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03231 2026-04-06 cs.CV 75%

CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning

CoME-VL:扩展互补多编码视觉语言学习

Ankan Deria, Komal Kumar, Xilin He, Imran Razzak, Hisham Cholakkal, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 预训练与数据 :LLM(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出CoME-VL框架,通过融合对比学习和自监督编码器提升视觉语言模型性能,实验显示在多个基准上优于单编码基线。

Comments 16 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12993 2026-04-02 cs.SE cs.CR 75%

SmartPoC: Generating Executable and Validated PoCs for Smart Contract Bug Reports

SmartPoC: 为智能合约漏洞报告生成可执行且验证的PoC

Longfei Chen, Ruibin Yan, Taiyu Wong, Yiyang Chen, Jialai Wang, Chao Zhang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SmartPoC通过生成并执行可执行的PoC测试用例,验证审计报告中的漏洞。该方法通过提取关键函数切片、生成-修复-执行循环及差分验证提高可执行性与准确性,实现了高精度和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07732 2026-03-31 cs.RO cs.AI cs.CL cs.CV cs.LG 75%

ViPRA: Video Prediction for Robot Actions

ViPRA:用于机器人动作的视频预测

Sandeep Routray, Hengkai Pan, Unnat Jain, Shikhar Bahl, Deepak Pathak

机构 * Carnegie Mellon University(卡内基梅隆大学) Skild AI University of California, Irvine(加州大学尔湾分校)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ViPRA通过预训练和微调框架,从无标注视频中学习连续机器人控制,利用视频语言模型预测视觉观察和运动中心潜在动作,支持跨机器人形态的泛化和高频率连续控制。

Comments In ICLR 2026. Website: https://vipra-project.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22419 2026-03-31 cs.CV 75%

CLIP Is Shortsighted: Paying Attention Beyond the First Sentence

CLIP存在短视:超越第一句话的注意力分配

Marc-Antoine Lavoie, Anas Mahmoud, Aldo Zaimi, Arsene Fansi Tchango, Steven L. Waslander

机构 * University of Toronto Robotics Institute(多伦多大学机器人研究所) Mila - Quebec AI Institute(Mila - 魁北克人工智能研究所)

专题命中 预训练与数据 :LLM(abstract);language model(abstract);pretraining(abstract)

AI总结 CLIP模型在大规模数据上通过图像-文本对比学习获取可迁移的多模态特征,但其预训练过程偏向于短描述,导致复杂场景对齐不足。本文提出DeBias-CLIP,通过去除摘要句和子采样提升对齐效果,实现更优的长文本检索和鲁棒性。

Comments 20 pages, 15 figures, to be published in the CVPR 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏