arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 391 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 391 篇

2607.03946 2026-08-14 astro-ph.GA astro-ph.IM 版本更新 67%

A Model Context Protocol Server for Astrophysical RAG: Unified Access to HI, Dwarf, Globular Cluster, IntZ, and ALPINE Kinematic Corpora with FAISS Semantic Search

用于天体物理RAG的模型上下文协议服务器:通过FAISS语义搜索统一访问HI、矮星系、球状星团、IntZ和ALPINE运动学语料库

David C. Flynn

专题命中 预训练与数据 :LLM(abstract,abstract_cn)

AI总结 介绍EPS Research Astro-RAG MCP Server v2.3.0,可跨平台统一访问五个天体物理语料库。核心方法是用FAISS加速自然语言相似性搜索,贡献是提供多接口,实现多种功能且可公开部署、完全可重现。

Comments 10 Pages 3 Tables 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28560 2026-08-12 cs.RO 版本更新 67%

X-NavDP: Generalizing Navigation Diffusion Policy to Novel Behavior and Embodiments with Group Q-score Reweighted Matching

X-NavDP:通过组Q分数重加权匹配将导航扩散策略泛化到新行为和实体

Tianyu Yang, Yiming Zeng, Wenzhe Cai, Yuqiang Yang, Jiaqi Peng, Hui Cheng, Jiangmiao Pang, Tai Wang

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学) Tsinghua University(清华大学)

专题命中 预训练与数据 :pretraining(abstract);post-training(abstract)

AI总结 该研究针对导航扩散策略泛化性不足的问题,提出GQRM框架对X-NavDP进行后训练,大幅提升了跨实体视觉导航的模拟与现实场景成功率。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10744 2026-08-11 cs.CV cs.RO 版本更新 67%

Traj-VLN: Learning Pixel-Space Interaction via Autoregressive Trajectory Generation

Traj-VLN:通过自回归轨迹生成学习像素空间交互

Changfei Fu, Guangcheng Chen, Aoxiang Gu, Haoxiang Liang, Wenjun Xu, Hong Zhang

机构 * Southern University of Science and Technology(南方科技大学) Peng Cheng National Laboratory(鹏城国家实验室) Guangdong University of Technology(广东工业大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 研究连续环境中视觉与语言导航问题,提出通过自回归轨迹生成在2D像素空间微调视觉语言模型来学习导航交互的方法,实验验证该方法能显著提升性能,旗舰模型在有限资源和数据下达最优水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05663 2026-08-10 cs.CV cs.SD 版本更新 67%

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

Vorch-Streamer:将人类音视频生扩展至实时长格式流式生成

Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang

机构 * Vorch Team(Vorch团队) Tongji University(同济大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :language model(abstract);post-training(abstract)

AI总结 Vorch-Streamer是一款后训练框架,通过混合训练、自强制与DMD蒸馏等技术,实现了超24 FPS的实时长格式T2AV流式音视频生成,兼具音唇同步性与身份保留能力。

Comments Project page: https://vorch-project.github.io/Vorch-Streamer-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04000 2026-08-05 cs.HC 版本更新 67%

After Talking with 1,000 Personas: Learning Preference-Aligned Proactive Assistants From Large-Scale Persona Interactions

与1000个角色交谈后:从大规模角色交互中学习偏好对齐的主动助手

Ziyi Xuan, Yiwen Wu, Zhaoyang Yan, Vinod Namboodiri, Yu Yang

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 通过大规模角色交互模拟,学习偏好对齐的主动助手,实现设备端个性化适应与冷启动优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22078 2026-07-31 cs.RO 版本更新 67%

Do World Action Models Generalize Better than VLAs? A Robustness Study

世界动作模型是否比视觉语言动作模型表现更好?一项鲁棒性研究

Zhanguang Zhang, Zhiyuan Li, Behnam Rahmati, Rui Heng Yang, Yintao Ma, Amir Rasouli, Sajjad Pakdamansavoji, Yangzheng Wu, Lingfeng Zhang, Tongtong Cao, Feng Wen, Xinyu Wang, Xingyue Quan, Yingxue Zhang

机构 * Huawei Technologies(华为技术有限公司) University of Toronto(多伦多大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract)

AI总结 本文比较了最新状态的VLA策略和最近发布的WAMs,在不同视觉和语言扰动下评估其性能,发现WAMs在鲁棒性上表现更强,而VLA需要大量训练数据和多样化学习目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08716 2026-07-22 cs.CV 版本更新 67%

Great X: A Unified Multi-Modal Simulator Bridging the Sim2Real Gap for 6G

Great X:一种统一的多模态模拟器,弥合6G的模拟与现实差距

Yuan Gao, Kongwu Huang, Jun Jiang, Shiyi Mu, Shugong Xu

机构 * Shanghai University(上海大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 预训练与数据 :LLM(abstract);foundation model(abstract)

AI总结 针对6G无线研究中多模态数据集收集难题及现有模拟器不足,提出在虚幻引擎实现统一单引擎模拟器Great-X,集成光线追踪等技术,构建含大量同步样本的Great-MCD,实验显示其性能优于现有模拟器及测量数据基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24690 2026-07-08 cs.CV 版本更新 67%

UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy

UniICL:通过能力导向的分类系统化统一多模态上下文学习

Yicheng Xu, Jiangning Zhang, Zhucun Xue, Teng Hu, Ran Yi, Xiaobin Hu, Yong Liu, Dacheng Tao

机构 * Zhejiang University(浙江大学) Shanghai Jiaotong University(上海交通大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本文提出能力导向的分类系统,通过构建UniICL-760K语料库和UniICL-Bench评估体系,提出Context-Adaptive Prototype Modulator模块,提升多模态少样本学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20659 2026-07-07 cs.RO 版本更新 67%

StageCraft: Execution Aware Mitigation of Distractor and Obstruction Failures in VLA Models

StageCraft: 通过执行意识缓解VLA模型中干扰和障碍故障

Kartikay Milind Pangaonkar, Prabin Rath, Omkar Patil, Nakul Gopalan

机构 * Arizona State University(亚利桑那州立大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract)

AI总结 StageCraft通过利用大规模视觉语言模型进行推理,改进预训练VLA策略性能,通过操控环境初始状态避免执行故障,实现在三个真实任务领域中性能提升40%。

Comments Accepted to IEEE International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08067 2026-08-17 cs.CL cs.AI 版本更新 62%

DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects

DialectS2S:面向低资源汉语方言的端到端语音对话建模

Yi Shu, Tianyu Peng, Yingzhuo Deng, Wen Yang, Jun Lin, Changming Xie, Xinyu Yu, Jiajun Zhang

专题命中 预训练与数据 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 针对低资源汉语方言语音数据稀缺及语义不一致问题,提出DialectS2S模型,通过合成流水线与自对齐后训练策略提升方言语音生成质量,开源框架实现性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02462 2026-08-12 cs.LG cs.AI 版本更新 62%

Can Computational Reducibility Lead to Transferable Models for Graph Combinatorial Optimization?

计算可约性能否导致图组合优化的可迁移模型?

Semih Cantürk, Thomas Sabourin, Frederik Wenkel, Michael Perlmutter, Guy Wolf

机构 * Operations Research, Université de Montréal(运营研究,蒙特利尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所) Valence Labs(Valence实验室) Dept. of Mathematics, Boise State University(数学系,博伊州立大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于计算可约性的方法,通过表达性消息传递和预训练策略,在图组合优化中实现跨任务的可迁移模型。

Comments Accepted at ICML 2026; 20 pages, 2 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01401 2026-08-11 cs.LG cs.AI cs.CV 版本更新 62%

NeuroBridge: Bridging Multi-Task MRI Knowledge for Neurodegenerative Disease Diagnosis

NeuroBridge:桥接多任务MRI知识用于神经退行性疾病诊断

Mengyu Li, Guoyao Shen, Chad W. Farris, Xin Zhang

机构 * Department of Mechanical Engineering, Boston University(波士顿大学机械工程系) The Photonics Center, Boston University(波士顿大学光子中心) Rafik B. Hariri Institute for Computing and Computational Science & Engineering, Boston University(波士顿大学拉菲克·B·哈里里计算与计算科学与工程研究所) Department of Radiology, Boston University Chobanian & Avedisian School of Medicine(波士顿大学切博尼亚与阿维迪亚安医学学院放射科) Department of Radiology, Boston Medical Center(波士顿医学中心放射科) Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系) Department of Biomedical Engineering, Boston University(波士顿大学生物医学工程系) Division of Materials Science and Engineering, Boston University(波士顿大学材料科学与工程系)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出NeuroBridge框架,通过大规模自监督MRI预训练与多任务学习(海马分割、萎缩分类、重建)及门控融合微调,在AD和MCI诊断中达到88.17%准确率,优于单任务方法。

Comments 5 figures. 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27341 2026-08-11 cs.AI cs.CV cs.LG 版本更新 62%

A Comparative Study in Surgical AI: Potential and Limitations of Data, Compute, and Scaling

外科AI的比较研究:数据、计算和扩展的潜力与局限

Kirill Skobelev, Eric Fithian, Yegor Baranovski, Jack Cook, Sandeep Angara, Shauna Otto, Zhuang-Fang Yi, John Zhu, Neeraj Mainkar, Margaux Masson-Forsythe, Daniel A. Donoho, X. Y. Han

机构 * Center for Applied AI, Chicago Booth(应用人工智能中心,芝加哥商学院) Surgical Data Science Collective(外科数据科学集体) Children’s National Hospital(儿童医学中心) Operations Management & Tolan Center for Healthcare, Chicago Booth(运营管理与托兰医疗中心,芝加哥商学院)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过2026年最先进的AI方法,研究了外科手术工具检测中的性能和限制,发现即使使用多十亿参数模型和大量训练数据,当前的视觉语言模型在神经外科手术工具检测任务中仍表现不足,且模型规模和训练时间的增加对性能提升效果有限,表明当前AI在手术应用中仍面临显著挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05451 2026-08-06 cs.LG cs.CL 版本更新 62%

RingSQL: Schema-Independent Synthetic Data Generation for Text-to-SQL Reinforcement Learning

RingSQL: 通过不依赖模式的模板生成合成数据以用于文本到SQL推理模型

Marko Sterbentz, Kevin Cushing, Cameron Barrie, Kristian J. Hammond

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 RingSQL通过结合不依赖模式的模板和大语言模型生成,提升文本到SQL模型的准确性和多样性

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25464 2026-08-03 cs.LG cs.AI 版本更新 62%

Maximum Entropy Behavior Exploration for Sim2Real Zero-Shot Reinforcement Learning

为实机零样本强化学习的最大熵行为探索

Jiajun Hu, Nuria Armengol Urpi, Jin Cheng, Stelian Coros

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FB-MEBE算法,通过最大熵行为探索策略和正则化批评者,提升实机四足机器人控制的零样本强化学习性能,实现自然可部署的政策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19363 2026-07-28 cs.AI cs.CL 版本更新 62%

AdaRoPE: Not All Attention Heads Should Rotate and Scale Equally

AdaRoPE:并非所有注意力头都应同等旋转和缩放

Shaowen Wang, Yuke Zheng, Tansheng Zhu, Shuang Chen, Shaofan Liu, Suncong Zheng, Jian Li

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 研究发现Transformer中不同功能的注意力头需不同频率范围和缩放因子,提出AdaRoPE为各头配备可学习参数,实验表明其性能优于现有变体,能更好地进行上下文扩展并保留短上下文性能,凸显在单头级别优化旋转位置嵌入之重要性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10092 2026-07-24 cs.AI cs.LG 版本更新 62%

Interpretable Embeddings with Sparse Autoencoders: A Data Analysis Toolkit

使用稀疏自动编码器的可解释嵌入:一种数据分析工具包

Nick Jiang, Xiaoqing Sun, Lisa Dunlap, Lewis Smith, Neel Nanda

机构 * University of California, Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大规模文本语料库分析难题,提出用稀疏自动编码器创建SAE嵌入,经四个任务验证其比大语言模型更具性价比、比密集嵌入更可控,通过案例研究展示其在研究模型行为上的作用,是用于非结构化数据分析的通用工具。

Comments ICML 2026. Project page and code: https://interp-embed.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03354 2026-07-24 cs.CL cs.AI 版本更新 62%

Generative Artificial Intelligence in Bioinformatics: A Systematic Review of Models, Applications, and Methodological Advances

生物信息学中的生成式人工智能:模型、应用和方法进展的系统综述

Wasimul Karim, Riasad Alvi, Sayeem Been Zaman, Arefin Ittesafun Abian, Mohaimenul Azam Khan Raiaan, Saddam Mukta, Md Rafi Ur Rashid, Md Rafiqul Islam, Yakub Sebastian, Sami Azam

机构 * Department of Computer Science and Engineering, United International University(计算机科学与工程系,国际联合大学) Department of Data Science and Artificial Intelligence, Monash University(数据科学与人工智能系,墨尔本大学) Department of Software Engineering, Lappeenranta-Lahti University of Technology(软件工程系,拉佩兰塔-拉赫蒂技术大学) Department of Computer Science and Engineering, Pennsylvania State University(计算机科学与工程系,宾夕法尼亚州立大学) Faculty of Science and Technology, Charles Darwin University(科学与技术学院,查尔斯达尔文大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 综述围绕六个问题评估GenAI在生物信息学中的策略,发现其支持多种分析,专业架构表现优,在分子分析等方面有益,存在局限,多种数据集助其发展,展现出推进计算生物学的潜力。

Comments Accepted: Archives of Computational Methods in Engineering Journal

Journal ref Arch Computat Methods Eng (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06176 2026-07-22 cs.LG cs.AI physics.space-ph 版本更新 62%

A Self-Supervised Framework for Space Object Behaviour Characterisation

一种用于空间物体行为特征刻画的自监督框架

Ian Groves, Andrew Campbell, James Fernandes, Diego Ramírez Rodríguez, Paul Murray, Massimiliano Vasile, Victoria Nockles

机构 * Defence AI Research Centre, Defence & National Security, The Alan Turing Institute(国防人工智能研究中心,国防与国家安全,艾伦·图灵研究所) Department of Electronic and Electrical Engineering, University of Strathclyde(电子与电气工程系,斯特拉斯克莱德大学) GMV Aerospace Centre of Excellence, University of Strathclyde(航空航天卓越中心,斯特拉斯克莱德大学)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种自监督框架用于空间物体行为分析,通过预训练和微调实现异常检测、运动预测和合成数据生成,提升空间安全与可持续性。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25170 2026-07-17 cs.LG cs.AI cs.ET cs.RO 版本更新 62%

Grow-Prune-Freeze Networks: Adaptive & Continual Learning Technique for Olfactory Navigation

生长-剪枝-冻结网络:用于嗅觉导航的自适应与持续学习技术

Kordel K. France, Ovidiu Daescu

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出生长-剪枝-冻结(GPF)网络框架,通过动态调整策略网络层数实现持续学习,在湍流羽流导航任务中达到94%成功率,并推广到其他机器学习任务。

Comments Accepted as poster to the Reinforcement Learning in Big Worlds Workshop at the 2026 Reinforcement Learning Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11977 2026-07-16 cs.AI cs.CL 版本更新 62%

Optimization Is Not All You Need

优化并非你所需的全部

Minh Hua, Rita Raley

机构 * Scale AI(Scale人工智能公司) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 研究指出优化并非全部,以GPT - 2为例,通过追踪其预训练等环节的优化文化,发现优化程序虽能测文本可能性,但无法区分不可能性是错误还是创新,却在五年内获设定语言协议权威。

Comments This essay will be forthcoming in MFS Modern Fiction Studies, published by JHUP (Spring-Summer 2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22600 2026-07-08 cs.LG cs.AI 版本更新 62%

Transformers converge to invariant algorithmic cores

Transformer收敛到不变的算法核心

Joshua S. Schiffman

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究从Transformer偶然行为转向必然操作,用算法核心提取(ACE)隔离子空间等,发现不同Transformer的功能冗余及语言模型主谓语一致的控制轴,揭示其有简单共享计算结构,针对不变量利于理解和控制机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26012 2026-07-07 cs.LG cs.AI 版本更新 62%

Learning in Low-Dimensional Subspaces: Orthogonal Bottlenecks for Reinforcement Learning

低维子空间中的学习:强化学习的正交瓶颈

Aleksandar Todorov, Matthia Sabatelli

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出一种在强化学习编码器特征中插入固定正交投影以约束低维子空间的简单先验,证明其在线性可实现性假设下保持表达能力,并在实验中显示价值表示可压缩至极低维度而不损失性能。

Comments Reinforcement Learning Conference (RLC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07488 2026-07-07 cs.LG cs.AI stat.ML 版本更新 62%

Deriving Neural Scaling Laws from the statistics of natural language

从自然语言统计中推导神经缩放定律

Francesco Cagnetta, Allan Raventós, Surya Ganguli, Matthieu Wyart

专题命中 预训练与数据 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究从自然语言统计推导神经缩放定律,分离出语言关键统计属性预测神经缩放指数,给出基于这些统计量的简单公式,与实验测量定律匹配。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01460 2026-07-07 cs.LG cs.AI 版本更新 62%

The Three Regimes of Offline-to-Online Reinforcement Learning

离线到在线强化学习的三种模式

Lu Li, Tianwei Ni, Yihao Sun, Pierre-Luc Bacon

机构 * Mila – Québec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) CIFAR AI Chair(CIFAR人工智能 chair)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究离线到在线强化学习,基于稳定性-可塑性原理提出框架解释其经验行为不一致性,识别三种在线微调模式,经实证研究验证该框架可指导相关设计选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09399 2026-07-02 cs.CV cs.AI cs.LG 版本更新 62%

ForAug: Mitigating Biases in Image Classification via Controlled Image Compositions

ForAug: 通过受控图像组合缓解图像分类中的偏差

Tobias Christian Nauen, Brian Moser, Federico Raue, Stanislav Frolov, Andreas Dengel

机构 * RPTU University Kaiserslautern-Landau(凯泽斯劳滕-兰道大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出ForAug方法,通过将训练图像分解为前景和背景并重新组合,显式控制物体位置、尺度和背景,打破前景-背景相关性,在ImageNet上提升最高6%准确率,并减少捷径学习行为。

Comments v2: DeiT, ablation vs simple copy-paste, v4: more augmentation pipelines, robustness benchmarks, mask quality analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14771 2026-06-17 cs.CV cs.AI cs.LG cs.MM cs.NE 版本更新 62%

GOT-JEPA: Generic Object Tracking with Model Adaptation and Occlusion Handling using Joint-Embedding Predictive Architecture

GOT-JEPA:基于联合嵌入预测架构的通用目标跟踪与模型自适应及遮挡处理

Shih-Fang Chen, Jun-Cheng Chen, I-Hong Jhuo, Yen-Yu Lin

机构 * Department of Computer Science, National Yang Ming Chiao Tung University(国家阳明交通大学计算机科学系) Research Center for Information Technology Innovation, Academia Sinica(中华学术院信息技术创新研究中心) Microsoft AI(微软人工智能)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出GOT-JEPA框架,通过预测跟踪模型而非图像特征来提升泛化能力,并设计OccuSolver增强遮挡感知,在七个基准上验证了有效性。

Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT). This research focuses on learning model adaptation for adverse and dynamic environments, as well as fine-grained occlusion perception for tracking

Journal ref IEEE Transactions on Circuits and Systems for Video Technology 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09794 2026-06-11 cs.AI cs.LG 版本更新 62%

Synthetic Homes: A Multimodal Generative AI Pipeline for Residential Building Data Generation under Data Scarcity

合成住宅:数据稀缺下用于住宅建筑数据生成的多模态生成式AI管道

Jackson Eshbaugh, Chetan Tiwari, Jorge Silveyra

机构 * Lafayette University(拉法叶大学) Georgia State University(佐治亚州立大学)

专题命中 预训练与数据 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 提出一个多模态生成式AI框架,整合图像、表格和模拟组件,从公开记录和图像生成合成住宅建筑数据集,以解决建筑参数数据稀缺问题。

Comments 33 pages; 2 appendices; 6 figures; 4 tables. Code available at https://github.com/Lafayette-EshbaughSilveyra-Group/synthetic-homes

Journal ref Machine Learning with Applications, 25 (2026), 100959

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00945 2026-06-11 cs.CL cs.AI 版本更新 62%

Neural FOXP2 -- Language Specific Neuron Steering for Targeted Language Improvement in LLMs

Neural FOXP2——面向大型语言模型目标语言改进的语言特定神经元引导

Anusa Saha, Tanmay Joshi, Vinija Jain, Aman Chadha, Amitava Das

机构 * Meta, USA(Meta, 美国) Apple, USA(Apple, 美国) Pragya Lab, BITS Pilani Goa, India(Pragya实验室,BITS Pilani Goa,印度)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 提出Neural FOXP2方法,通过定位语言神经元、计算引导方向和施加稀疏激活偏移,将模型默认语言从英语切换为印地语或西班牙语,实现可控的语言主导性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26294 2026-06-11 cs.LG cs.AI 版本更新 62%

Noise-Guided Transport for Imitation Learning

噪声引导的模仿学习传输方法

Lionel Blondé, Joao A. Candido Ramos, Alexandros Kalousis

机构 * University of Cambridge(剑桥大学) University of Oxford(牛津大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对低数据场景下的模仿学习,提出噪声引导传输(NGT)方法,通过对抗训练将模仿问题转化为最优传输问题,无需预训练或特殊架构,在极低数据量下实现强性能。

Comments Accepted at ICML 2026. Code: https://github.com/lionelblonde/ngt

详情

展开后加载摘要…

URL PDF HTML 收藏