TV2TV: A Unified Framework for Interleaved Language and Video Generation
TV2TV:一种用于交错语言和视频生成的统一框架
机构 * Meta FAIR
专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 TV2TV通过统一框架实现语言与视频生成的交错过程,提升视频生成的视觉质量和可控性。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
TV2TV:一种用于交错语言和视频生成的统一框架
机构 * Meta FAIR
专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 TV2TV通过统一框架实现语言与视频生成的交错过程,提升视频生成的视觉质量和可控性。
从文本数据中测量腐败
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
AI总结 本文提出一种基于词典和主成分分析的自动化腐败指数,通过巴西市政审计报告验证其有效性,并在透明度、成本和可重复性方面优于传统方法。
不完美之必要:通过模拟认知局限性逆转模型崩溃
专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出通过模拟认知局限性生成具有真实功能增益的合成数据,以解决模型崩溃问题。
Comments 60 pages,9 figures. v3: Major update. Added 3D topological visualization (Figure 1) and independent computational verification of the Adaptive Markets Hypothesis (AMH). Includes comprehensive Supplementary Materials (algorithmic pseudocode, system architecture, and real-time GARCH logs) for technical reproducibility
ReasonX: 基于多模态大语言模型的内在图像分解
机构 * Imperial College London(伦敦帝国学院) ; Adobe Research(Adobe研究院)
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
AI总结 ReasonX通过多模态大语言模型提供相对比较监督,提升内在图像分解的泛化能力与精度。
S5: 远程感知中可扩展的半监督语义分割
机构 * National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University(国家多媒体软件工程研究中心,计算机学院,武汉大学)
专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)
AI总结 S5提出了一种可扩展的半监督语义分割框架,通过大规模数据集和预训练范式提升遥感任务的性能。
Comments AAAI 2026 Oral
利用大规模预训练的空间-光谱先验进行通用零样本全色融合
专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)
AI总结 本文提出利用大规模模拟数据预训练空间-光谱先验,提升遥感图像融合在不同传感器和条件下的泛化能力。
关于对话语流和流畅性塑造特征的令牌级建模难度
机构 * Technische Hochschule Nürnberg Georg Simon Ohm(纽伦堡技术大学乔治·西蒙·奥姆学院) ; Technische Hochschule Rosenheim(罗森海姆技术大学) ; KST Institut GmbH(KST研究所)
专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种轻量级适应方法,用于提升ASR对语流和流畅性修改的识别能力,同时揭示多语言端到端系统在处理德语数据时的局限性。
Comments 6 pages, 1 figure. Accepted to ASRU 2025. This is the arXiv preprint of the accepted paper
IVCR-200K: 一个大规模多轮对话基准数据集用于交互视频语料检索
机构 * Xiangtan University(湘潭大学) ; Hunan University(湖南大学) ; Zhejiang Gongshang University(浙江工商大学) ; Fudan University(复旦大学)
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
AI总结 本文提出IVCR-200K数据集及基于多模态大语言模型的框架,用于交互视频语料检索,提升多轮对话式交互效果。
Comments Accepted by SIGIR2025
Life-Code: 多组学序列统一下的中心法则建模
专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Life-Code通过多组学序列统一和中心法则建模,实现对生物分子相互作用的全面理解。
Comments Preprint V3 (10 pages main text)
对多模态大语言模型在视频理解中的可信度进行基准测试
机构 * Hefei University of Technology(合肥工业大学) ; Tsinghua University(清华大学) ; Institute of Science Tokyo(东京科学研究所)
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
AI总结 本研究提出Trust-videoLLMs基准,评估23种视频LLMs在真实性、鲁棒性、安全性和隐私等方面的表现,揭示其在动态场景理解及现实风险缓解中的局限性。
自带知识图谱:零样本知识图谱问答的自监督程序合成
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; AWS AI Labs(AWS人工智能实验室)
专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 BYOKG通过自监督程序合成实现零样本知识图谱问答,利用探索机制和LLM生成查询程序,提升问答准确率。
InstaDA: 通过双代理系统增强实例分割数据
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
AI总结 InstaDA通过双代理系统提升实例分割数据质量,实现AP提升和效率优化
探索基于CLIP的分类中的弱到强泛化
机构 * School of Computing and Information Systems University of Melbourne, Australia(墨尔本大学计算机与信息系统学院) ; School of Computing and Information Systems University of Melbournem, Australia(墨尔本大学计算机与信息系统学院) ; School of Computer Science and Engineering Southeast University, China(东南大学计算机科学与工程学院)
专题命中 预训练与数据 :language model(abstract);pretraining(abstract)
AI总结 本文提出类别原型学习方法,通过弱监督提升CLIP模型分类性能,实验显示在预训练受限情况下取得显著改进。
Comments TMLR
POMA-3D:点地图方式的3D场景理解
机构 * Imperial College London(伦敦帝国学院)
专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)
AI总结 POMA-3D通过点地图实现3D场景理解,结合自监督学习和多视角对齐策略,提升3D任务表现。
Comments 11 pages, 6 tables, 5 figures
从游戏到回放:面向时间精细粒度视频的组合视频检索
专题命中 预训练与数据 :LLM(abstract);prompting(abstract)
AI总结 TF-CoVR提出了一种针对时间精细粒度视频检索的框架,通过预训练视频编码器和对比学习提升检索性能。
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Tencent AI Lab, USA(腾讯AI实验室(美国))
专题命中 预训练与数据 :language model(abstract);pretraining(abstract)
Comments Submitted to ICASSP2026
机构 * IKG
专题命中 预训练与数据 :foundation model(abstract);prompting(abstract)
机构 * New York University(纽约大学) ; Boston University(波士顿大学) ; AllenAI ; Vercept
专题命中 预训练与数据 :LLM(abstract);language model(abstract)
Comments Project page: https://ellisbrown.github.io/sims-v
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
Comments Accepted by AAAI 2026
机构 * Stable AI & Tsinghua University(Stable AI 与 清华大学)
专题命中 预训练与数据 :foundation model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 61 pages
机构 * PatSnap Co., LTD.(PatSnap公司)
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
专题命中 预训练与数据 :language model(abstract);pretraining(abstract)
Comments 7 pages, 2 figures, 1 table
机构 * Uni-Ubi ; Zhejiang University(浙江大学) ; Tongji University(同济大学)
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
机构 * IIT Kharagpur(印度克哈格普尔理工学院) ; IIT Kanpur(印度坎普尔理工学院)
专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at EMNLP 2025 (Main)
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
Comments 13 pages, 5 figures; accepted for ICSE 2026
机构 * School of Information and Computer Sciences University of California, Irvine(信息与计算机科学学院 加州大学伊维奇分校)
专题命中 预训练与数据 :prompting(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at ACL 2025 L2M2 Workshop
机构 * Technical University of Munich(慕尼黑技术大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
Comments 10 pages, 3 figures
机构 * University of Technology Sydney(悉尼技术大学)
专题命中 预训练与数据 :large language model(abstract);language model(abstract)
机构 * Stanford University(斯坦福大学) ; Tsinghua University(清华大学)
专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments EMNLP 2025 Findings