arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 140189 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2602.07488 2026-07-07 cs.LG cs.AI stat.ML 版本更新 62%

Deriving Neural Scaling Laws from the statistics of natural language

从自然语言统计中推导神经缩放定律

Francesco Cagnetta, Allan Raventós, Surya Ganguli, Matthieu Wyart

专题命中 预训练与数据 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究从自然语言统计推导神经缩放定律,分离出语言关键统计属性预测神经缩放指数,给出基于这些统计量的简单公式,与实验测量定律匹配。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01460 2026-07-07 cs.LG cs.AI 版本更新 62%

The Three Regimes of Offline-to-Online Reinforcement Learning

离线到在线强化学习的三种模式

Lu Li, Tianwei Ni, Yihao Sun, Pierre-Luc Bacon

机构 * Mila – Québec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) CIFAR AI Chair(CIFAR人工智能 chair)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究离线到在线强化学习,基于稳定性-可塑性原理提出框架解释其经验行为不一致性,识别三种在线微调模式,经实证研究验证该框架可指导相关设计选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09399 2026-07-02 cs.CV cs.AI cs.LG 版本更新 62%

ForAug: Mitigating Biases in Image Classification via Controlled Image Compositions

ForAug: 通过受控图像组合缓解图像分类中的偏差

Tobias Christian Nauen, Brian Moser, Federico Raue, Stanislav Frolov, Andreas Dengel

机构 * RPTU University Kaiserslautern-Landau(凯泽斯劳滕-兰道大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出ForAug方法,通过将训练图像分解为前景和背景并重新组合,显式控制物体位置、尺度和背景,打破前景-背景相关性,在ImageNet上提升最高6%准确率,并减少捷径学习行为。

Comments v2: DeiT, ablation vs simple copy-paste, v4: more augmentation pipelines, robustness benchmarks, mask quality analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31991 2026-07-01 cs.LG cs.AI 新提交 62%

Amplifying Membership Signal Through Chained Regeneration

通过链式再生放大成员信号

Wojciech Łapacz, Stanisław Pawlak

机构 * Warsaw University of Technology(华沙理工大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MADreMIA框架,利用链式再生迭代轨迹增强生成模型的成员推断和数据集推理攻击,在低误报率下提升信号强度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28933 2026-06-30 cs.CL cs.LG 62%

FinInvest-GTCN: Explainable Graph-Temporal-Causal Modeling for Risk-Aware Investment Decision Optimization

FinInvest-GTCN:用于风险感知投资决策优化的可解释图-时间-因果建模

Junyan Tan, Yifan Li, Minghao Wang, Zihan Chen, Haoyu Zhang

机构 * Department of Computer Science(计算机科学系)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.LG

AI总结 提出FinInvest-GTCN模型,结合图编码、多尺度时序融合和因果决策头,解决风投决策中的异构数据、非平稳时序和可解释性挑战,在私有数据集上RA-MSE降至2.51,模拟组合收益提升18.7%。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23611 2026-06-23 cs.CV cs.AI cs.LG 新提交 62%

Data Selection Through Iterative Self-Filtering for Vision-Language Settings

面向视觉-语言场景的迭代自过滤数据选择

Andrei Liviu Nicolicioiu, Sarvjeet Singh Ghotra, Morgane M. Moss, Aaron Courville

机构 * Mila, Université de Montréal(蒙特利尔大学Mila实验室)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种自举式方法,通过迭代训练CLIP模型并自选择改进的数据混合,无需额外数据或预训练模型即可提升下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22700 2026-06-23 cs.LG cs.AI cs.CR cs.CV 新提交 62%

SCRUB-FL: Sanitizing and Cleansing Representations via Unlearning of Backdoors

SCRUB-FL:通过遗忘后门来净化和清洗表示

Osama Wehbi, Sarhad Arisdakessian, Omar Abdel Wahab, Azzam Mourad, Hadi Otrok

机构 * Polytechnique Montréal(蒙特利尔综合理工学院) Khalifa University(哈利法大学)

专题命中 预训练与数据 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出SCRUB-FL,一种两阶段后门移除方法,在训练时通过谱分析和激活聚类检测可疑样本并训练WGAN-GP捕获触发分布,收敛后利用机器遗忘合成近似触发样本并消除触发-目标关联,在CIFAR-10和GTSRB上后门攻击成功率降至3.88%,正常任务准确率超91%。

Comments 14 pages, 3 tables, 1 algorithm, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21139 2026-06-23 cs.RO cs.AI cs.LG 新提交 62%

PoLAR: Factorizing Extent and Mode in Latent Actions for Robot Policy Learning

PoLAR:分解潜在动作中的程度和模式用于机器人策略学习

Youngjoon Jeong, Jihwan Yu, Minsoo Jo, Junha Chun, Taesup Kim

机构 * Seoul National University(首尔国立大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出PoLAR方法,通过径向方向结构分解潜在动作中的程度和模式,利用时间偏移作为程度代理,在双曲空间中实现,提升下游策略性能。

Comments Project Page: https://joon-stack.github.io/PoLAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20696 2026-06-23 cs.CL cs.AI eess.AS 新提交 62%

MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data

MindAlign: 在有限数据下通过多模态嵌入对齐从fMRI信号解码内心语言

Muxuan Liu, Ichiro Kobayashi, Satoshi Nishida

机构 * Graduate School of Humanities and Sciences Ochanomizu University(大仓山大学人文科学研究生院) Center for Information and Neural Networks Advanced ICT Research Institute National Institute of Information and Communications Technology(信息与神经网络中心先进信息通信研究机构信息通信技术研究所)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出MindAlign两阶段框架,通过神经-语义对齐将fMRI信号映射到多模态语义空间,再结合视觉上下文冻结多模态语言模型生成文本,在静默图像描述数据上优于基线,且语义-语言投影可跨被试泛化。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18717 2026-06-18 cs.CL cs.AI 新提交 62%

Morpheus: A Morphology-Aware Neural Tokenizer and Word Embedder for Turkish

Morpheus: 一种面向土耳其语的形态感知神经分词器和词嵌入器

Tolga Şakar

机构 * Independent Researcher(独立研究者)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 针对土耳其语粘着特性,提出Morpheus神经词素边界模型,实现无损可逆分词与结构化词嵌入,在可逆分词器中达到最低比特每字符(1.425),词素对齐F1提升至0.61,GPU内存节省约19%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17667 2026-06-17 cs.LG cs.AI 新提交 62%

Handling Feature Heterogeneity with Learnable Graph Patches

处理特征异质性:可学习图块方法

Yifei Sun, Yang Yang, Xiao Feng, Zijun Wang, Haoyang Zhong, Chunping Wang, Lei Chen

机构 * Zhejiang University(浙江大学) Huazhong University of Science and Technology(华中科技大学) Finvolution Group(信也科技集团)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出可学习图块概念,将图分解为语义单元,通过补丁编码器和聚合器实现跨域图数据的可迁移预训练,提升下游任务性能。

Comments Accepted at KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14771 2026-06-17 cs.CV cs.AI cs.LG cs.MM cs.NE 版本更新 62%

GOT-JEPA: Generic Object Tracking with Model Adaptation and Occlusion Handling using Joint-Embedding Predictive Architecture

GOT-JEPA:基于联合嵌入预测架构的通用目标跟踪与模型自适应及遮挡处理

Shih-Fang Chen, Jun-Cheng Chen, I-Hong Jhuo, Yen-Yu Lin

机构 * Department of Computer Science, National Yang Ming Chiao Tung University(国家阳明交通大学计算机科学系) Research Center for Information Technology Innovation, Academia Sinica(中华学术院信息技术创新研究中心) Microsoft AI(微软人工智能)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出GOT-JEPA框架,通过预测跟踪模型而非图像特征来提升泛化能力,并设计OccuSolver增强遮挡感知,在七个基准上验证了有效性。

Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT). This research focuses on learning model adaptation for adverse and dynamic environments, as well as fine-grained occlusion perception for tracking

Journal ref IEEE Transactions on Circuits and Systems for Video Technology 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16019 2026-06-16 cs.CL cs.LG cs.SD 新提交 62%

Scaling Human and G2P Supervision for Robust Phonetic Transcription

扩展人类与G2P监督以实现鲁棒语音转录

Alexander Metzger, Aruna Srivastava, Ruslan Mukhamedvaleev

机构 * Koel Labs LLC

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究自动语音转录中人类标注与G2P监督的扩展规律,发现当人类标注少于20-30小时时G2P有效,超过后无益甚至降低鲁棒性,而ASR预训练可显著提升性能。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15695 2026-06-16 cs.LG cs.AI 新提交 62%

When Generator Replay Degrades: Projected Rehearsal Orchestration for Heterogeneous Federated Class-Incremental Learning

当生成器回放退化时:面向异构联邦类增量学习的投影排练编排

Thinh T. H. Nguyen, Khoa D. Doan, Binh T. Nguyen, Danh Le-Phuoc, Kok-Seng Wong

机构 * VinUniversity VNU-HCM, University of Science(胡志明市国家大学理科大学) Technische Universität Berlin(柏林工业大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对异构联邦类增量学习中客户端标签子集不同、任务阶段不一致导致的旧知识遗忘问题,提出投影排练编排框架PRO及增强版PRO-MAX,通过服务器端维护紧凑类级投影记忆并实现平衡伪多任务训练,在图像、文本和图基准上提升异构流下的保留与最终效用。

Comments 46 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14971 2026-06-16 cs.LG cs.AI 新提交 62%

FastMix: Fast Data Mixture Optimization via Gradient Descent

FastMix: 通过梯度下降实现快速数据混合优化

Haoru Tan, Sitong Wu, Yanfeng Chen, Jun Xia, Ruobing Xie, Bin Xia, Xingwu Sun, Xiaojuan Qi

机构 * University of Hong Kong(香港大学) Tencent(腾讯) Chinese University of Hong Kong(香港中文大学)

专题命中 预训练与数据 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出FastMix框架,将数据混合选择重新表述为双层优化问题,通过联合优化混合系数和模型参数,实现高效、可扩展的数据混合发现,在预训练和后训练中均优于基线方法且大幅降低搜索成本。

Journal ref ICLR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13276 2026-06-12 cs.LG cs.AI 新提交 62%

Different Layers, Different Manifolds: Module-Wise Weight-Space Geometry in Transformer Optimization

不同层,不同流形:Transformer优化中的模块级权重空间几何

Kirato Yoshihara

机构 * School of Engineering Science, The University of Osaka(大阪大学工程科学学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究Transformer不同模块偏好不同流形几何,提出为注意力层和MLP层分别分配Stiefel和DGram约束,在GPT-2预训练中取得最佳性能。

Comments Accepted at WSS @ ICML 2026, code is available at https://github.com/kiratoyoshihara/module-wise-manifold-muon

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09794 2026-06-11 cs.AI cs.LG 版本更新 62%

Synthetic Homes: A Multimodal Generative AI Pipeline for Residential Building Data Generation under Data Scarcity

合成住宅:数据稀缺下用于住宅建筑数据生成的多模态生成式AI管道

Jackson Eshbaugh, Chetan Tiwari, Jorge Silveyra

机构 * Lafayette University(拉法叶大学) Georgia State University(佐治亚州立大学)

专题命中 预训练与数据 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 提出一个多模态生成式AI框架,整合图像、表格和模拟组件,从公开记录和图像生成合成住宅建筑数据集,以解决建筑参数数据稀缺问题。

Comments 33 pages; 2 appendices; 6 figures; 4 tables. Code available at https://github.com/Lafayette-EshbaughSilveyra-Group/synthetic-homes

Journal ref Machine Learning with Applications, 25 (2026), 100959

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00945 2026-06-11 cs.CL cs.AI 版本更新 62%

Neural FOXP2 -- Language Specific Neuron Steering for Targeted Language Improvement in LLMs

Neural FOXP2——面向大型语言模型目标语言改进的语言特定神经元引导

Anusa Saha, Tanmay Joshi, Vinija Jain, Aman Chadha, Amitava Das

机构 * Meta, USA(Meta, 美国) Apple, USA(Apple, 美国) Pragya Lab, BITS Pilani Goa, India(Pragya实验室,BITS Pilani Goa,印度)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 提出Neural FOXP2方法,通过定位语言神经元、计算引导方向和施加稀疏激活偏移,将模型默认语言从英语切换为印地语或西班牙语,实现可控的语言主导性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26294 2026-06-11 cs.LG cs.AI 版本更新 62%

Noise-Guided Transport for Imitation Learning

噪声引导的模仿学习传输方法

Lionel Blondé, Joao A. Candido Ramos, Alexandros Kalousis

机构 * University of Cambridge(剑桥大学) University of Oxford(牛津大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对低数据场景下的模仿学习,提出噪声引导传输(NGT)方法,通过对抗训练将模仿问题转化为最优传输问题,无需预训练或特殊架构,在极低数据量下实现强性能。

Comments Accepted at ICML 2026. Code: https://github.com/lionelblonde/ngt

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10406 2026-06-10 cs.LG cs.AI 新提交 62%

FOGO: Forgetting-aware Orthogonalization Optimizer

FOGO:遗忘感知正交化优化器

Toan Nguyen, Yang Liu, Trung Le, Celso de Melo, Flora D. Salim

机构 * School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院) Department of Data Science & AI, Monash University(莫纳什大学数据科学与人工智能系) DEVCOM Army Research Laboratory(DEVCOM陆军研究实验室)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出FOGO优化器,通过谱正交化动量更新并利用紧凑码本记忆解决梯度干扰,在类别不平衡、持续学习和大模型微调等场景中提升收敛与知识保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10087 2026-06-10 cs.CL cs.LG 新提交 62%

CodeAlchemy: Synthetic Code Rewriting at Scale

CodeAlchemy:大规模合成代码重写

Ankit Gupta, Aditya Prasad, Rameswar Panda

机构 * MIT-IBM Watson AI Lab, IBM Research(MIT-IBM沃森人工智能实验室,IBM研究院)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出CodeAlchemy框架,通过5种策略生成超过500B token的合成代码数据,引入DevEval和TraceEval基准,3B模型在多项任务上超越10倍大小的前沿模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.00859 2026-06-09 cs.LG cs.CL 版本更新 62%

Learning from flowsheets: A generative transformer model for autocompletion of flowsheets

从流程图学习:用于流程图自动补全的生成式Transformer模型

Gabriel Vogel, Lukas Schulze Balhorn, Artur M. Schweidtmann

机构 * University of Freiburg(弗赖堡大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

AI总结 受文本自动补全启发,提出基于SFILES 2.0字符串表示和Transformer语言模型的化工流程图自动补全方法,通过预训练和微调实现交互式流程图合成辅助。

Journal ref Computers and Chemical Engineering Volume 171, March 2023, 108162

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07036 2026-06-08 cs.CV cs.AI cs.CE cs.LG 新提交 62%

STREAM: Stochastic Riemannian Flow Matching with Anisotropic Decoder for Digital Histopathology Image Generation

STREAM: 用于数字组织病理学图像生成的随机黎曼流匹配与各向异性解码器

Won June Cho, Daeky Jeong, Hyeongyeol Lim, Hongjun Yoon

机构 * DEEPNOID Inc.(DEEPNOID公司)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出STREAM框架,利用组织病理学视觉基础模型的patch-token特征作为潜在空间,通过黎曼流匹配生成高质量组织病理学图像,解决条件崩溃问题,并设计各向异性解码器提升生成质量。

Comments 27 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03381 2026-06-08 cs.LG cs.AI 版本更新 62%

Proxy Reconstruction Pre-training for Ramp Flow Prediction at Highway Interchanges

高速公路立交匝道流量预测的代理重建预训练

Yongchao Li, Jun Chen, Zhuoxuan Li, Chao Gao, Yang Li, Chu Zhang, Changyin Dong

机构 * Southeast University(东南大学) Institute of Telecommunications and Information Sciences, China(中国电信与信息科学研究院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出时空解耦自编码器(STDAE),通过跨模态重建预训练从主线数据恢复匝道流量,结合GWNet等模型提升预测精度,在真实数据集上超越13个基线。

Comments Accepted at Applied Soft Computing Journal

Journal ref Applied Soft Computing Journal 200 (2026) 115462

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06458 2026-06-05 cs.LG cs.AI cs.CV 62%

In-Context Multiple Instance Learning

上下文多实例学习

Alexander Möllers, Marvin Sextro, Julius Hense, Gabriel Dernbach, Klaus-Robert Müller

机构 * Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所) Machine Learning Group, Technische Universität Berlin(柏林技术大学机器学习小组) Aignostics Institute of Pathology, Charité – Universitätsmedizin Berlin(柏林查理医院病理研究所) Max-Planck Institute for Informatics(马克斯·普朗克信息研究所) Department of Artificial Intelligence, Korea University(韩国大学人工智能系)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于感知器架构的上下文学习器,通过合成数据预训练,无需梯度更新即可从少量标记包中解决新的多实例学习任务,在12个基准上超越需任务特定训练的监督基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06418 2026-06-05 cs.LG cs.AI cs.SY eess.SY 62%

Double Preconditioning (DoPr): Optimization for Test-Time Performance, not Validation Loss

双重预处理 (DoPr):针对测试时性能而非验证损失的优化

Thomas T. Zhang, Alok Shah, Yifei Zhang, Vincent Zhang, Nikolai Matni, Max Simchowitz

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Cambridge(剑桥大学) DeepMind(深度Mind) Google Research(谷歌研究)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出双重预处理优化范式,通过结合梯度级和激活级预处理,缓解自回归语言建模等场景中训练/验证损失与下游指标不匹配的测试时反馈问题,提升测试时性能而不一定改善验证损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24059 2026-06-05 cs.LG cs.AI 62%

Spectral Probe-Circuits: A Three-Step Recipe for Identifying Attention-Head Circuits in Pretrained Transformers

频谱探测电路:识别预训练Transformer中注意力头电路的三步法

Yongzhong Xu

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出一种三步法,通过频谱信号排序、任务模式筛选和组消融因果验证,无需标签即可识别预训练Transformer中执行持续内容依赖计算的注意力头电路,并在多个模型上验证了其通用性和因果必要性。

Comments 35 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06219 2026-06-05 cs.RO cs.AI cs.LG 62%

Is Diversity All You Need for Scalable Robotic Manipulation?

多样性是否是可扩展机器人操作的全部需求?

Modi Shi, Li Chen, Jin Chen, Yuxiang Lu, Chiming Liu, Guanghui Ren, Ping Luo, Di Huang, Maoqing Yao, Hongyang Li

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了数据多样性在机器人学习中的作用,发现任务多样性比单任务演示量更重要,多身体预训练数据在跨身体转移中可选,专家多样性可能对策略学习产生干扰,提出分布去偏方法提升性能。

Comments Code is available at https://github.com/OpenDriveLab/AgiBot-World

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04106 2026-06-04 cs.LG cs.AI 62%

Building The Ph(ysical)AI Layer Of Machine Intelligence

构建机器智能的物理AI层

Ulbert Jose Botero, Liam Smith, Brooks Olney, Pooya Khorrami, Steven Kusiak, Watson Jia, Sage Trudeau, Daniel Capecci

机构 * MIT Lincoln Laboratory(麻省理工学院林肯实验室)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出基于信号处理原理的基座模型,通过射频数据训练实现跨模态迁移,无需目标域微调,以1.99M参数在15个任务上平均准确率77.7%。

Comments 102 pages, 11 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06006 2026-06-04 cs.CV cs.AI cs.CL 62%

Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics

视觉语言模型能预测未来状态吗?从逆动力学引导世界模型

Yifu Qiu, Yftah Ziser, Anna Korhonen, Shay B. Cohen, Edoardo M. Ponti

机构 * Institute for Language, Cognition and Computation, University of Edinburgh(语言、认知与计算研究所,爱丁堡大学) Language Technology Lab, University of Cambridge(语言技术实验室,剑桥大学) NVIDIA(NVIDIA公司) University of Groningen(格罗宁根大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文发现视觉语言模型(VLM)难以直接进行前向动力学预测(FDP),但逆动力学预测(IDP)更容易学习,并利用IDP通过弱监督学习和推理时验证两种策略引导FDP,在Aurora-Bench上取得与最先进图像编辑模型竞争的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏