arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12429 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2602.14819 2026-06-16 cs.CL 83%

Testimole-Conversational: A 30-Billion-Word Italian Discussion Board Corpus (1996-2024) for Language Modeling and Sociolinguistic Research

Testimole-Conversational: 一个包含300亿词的意大利讨论板语料库(1996-2024)用于语言建模和社会语言学研究

Matteo Rinaldi, Rossella Varvara, Viviana Patti

机构 * University of Bologna(博洛尼亚大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 该语料库为意大利大语言模型预训练和语言社会学研究提供了丰富的讨论板文本资源,涵盖1996-2024年间超过300亿词的意大利语信息。

Journal ref Proceedings of the 12th Workshop on Challenges in the Management of Large Corpora (CMLC-12) @ LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12306 2026-06-16 cs.CL 版本更新 83%

A large-scale pipeline for LLM-assisted corpus annotation: variation and change in the English consider construction

基于大语言模型的大规模语料标注流水线:英语consider构式的变异与变化

Cameron Morin, Matti Marttinen Larsson

机构 * Université Paris-Cité(巴黎-城市大学) University of Gothenburg(哥德堡大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一种利用大语言模型自动标注大规模语料的四阶段流水线,在历史英语语料库中标注14万条consider构式,准确率超98%,揭示未记录的体裁特异性变化轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08306 2026-06-09 cs.LG cs.SI 新提交 83%

Towards Graph Foundation Models for Dynamics in Complex Networked Systems: Lessons from Super-Spreader Identification in Multilayer Networks

面向复杂网络系统中动力学的图基础模型:来自多层网络超级传播者识别的教训

Michał Czuba, Mateusz Stolarski, Adam Piróg, Piotr Bielak, Piotr Bródka

机构 * Department of Artificial Intelligence, Wroc{\l}aw University of Science and Technology, Wroc{\l}aw, Poland(人工智能系,沃斯拉夫科技大学,沃斯拉夫,波兰)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出图基础模型在动力学中需具备归纳跨网络泛化能力,通过仅基于合成多层网络训练的ts-net模型,在真实多层网络上实现零样本泛化,并优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07725 2026-06-09 physics.geo-ph cs.LG 新提交 83%

GNSS-FM: A Self-Supervised Foundation Model for Daily GNSS Displacement Time Series

GNSS-FM:用于日常GNSS位移时间序列的自监督基础模型

Nick Teutschmann, Laura Crocetti, Fanny Lehmann, Leonardo Trentini, Benedikt Soja

机构 * Institute of Geodesy and Photogrammetry, ETH Zurich(大地测量与摄影测量研究所,苏黎世联邦理工学院) ETH AI Center(ETH人工智能中心)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 提出GNSS-FM自监督基础模型,通过双流输入和掩码潜在预测预训练,在位移预测和地震阶跃定位任务上优于强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08920 2026-06-09 q-bio.BM cs.AI 版本更新 83%

AMix-1: A Pathway to Test-Time Scalable Protein Foundation Model

AMix-1: 迈向测试时可扩展的蛋白质基础模型

Changze Lv, Jiang Zhou, Siyu Long, Lihao Wang, Jiangtao Feng, Dongyu Xue, Yu Pei, Hao Wang, Zherui Zhang, Yuchen Cai, Zhiqiang Gao, Ziyuan Ma, Jiakai Hu, Chaochen Gao, Jingjing Gong, Yuxuan Song, Shuyi Zhang, Xiaoqing Zheng, Deyi Xiong, Lei Bai, Wanli Ouyang, Ya-Qin Zhang, Wei-Ying Ma, Bowen Zhou, Hao Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Generative Symbolic Intelligence Lab (GenSI), Tsinghua University(生成符号智能实验室(GenSI),清华大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) Tsinghua University(清华大学) Fudan University(复旦大学) Tianjin University(天津大学) Georgia Institute of Technology(佐治亚理工学院) Beijing University of Posts and Telecommunications(北京邮电大学) University of Chinese Academy of Sciences(中国科学院大学) City University of Hong Kong(香港城市大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 提出基于贝叶斯流网络的蛋白质基础模型AMix-1,通过预训练缩放律、涌现能力分析、上下文学习机制和测试时缩放算法,实现1.7B参数模型,并设计出活性提高50倍的AmeR变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06892 2026-06-08 cs.LG 新提交 83%

GRASP: Geometry-aware Residual Alignment for Scalable Pretraining Data Attribution

GRASP:面向可扩展预训练数据归因的几何感知残差对齐

Yue Min, Ruining Chen, Yujun Li

机构 * Wizard Quant University of Science and Technology of China(中国科学技术大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.LG

AI总结 提出GRASP方法,通过二次几何惩罚建模子集交互,结合低维特征草图与有限置信度选择协议,实现可扩展的预训练数据归因,显著提升反事实子集保真度并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00541 2026-06-08 cs.LG 版本更新 83%

One Loss to Rule Them All: Marked Time-to-Event for Structured EHR Foundation Models

一个损失统治一切:结构化EHR基础模型的标记时间到事件

Zilin Jing, Vincent Jeanselme, Yuta Kobayashi, Simon A. Lee, Chao Pang, Aparajita Kashyap, Yanwei Li, Xinzhuo Jiang, Shalmali Joshi

机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系) Department of Biomedical Informatics, Columbia University(哥伦比亚大学生物医学信息学系) Department of Computational Medicine, UCLA(洛杉矶大学计算医学系) Formation Bio

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 提出ORA预训练目标,联合建模事件时间和关联测量,相比下一词预测和忽略连续测量的损失,在多个数据集和下游任务上产生更通用的表示,提升回归和时间到事件预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16023 2026-06-08 cs.LG cond-mat.mtrl-sci 版本更新 83%

A Conformation-Centric Generative Foundation Model for Linear Polymer Modeling and Design

面向线性聚合物建模与设计的构象中心生成式基础模型

Fanmeng Wang, Ruochao Wang, Shan Mei, Wentao Guo, Hongshuai Wang, Qi Ou, Zhifeng Gao, Hongteng Xu

机构 * Gaoling School of Artificial Intelligence(人工智能学院) Renmin University of China(中国人民大学) DP Technology(DP技术) SINOPEC Research Institute of Petroleum Processing Co., Ltd.(中石油加工研究院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 提出PolyConFM基础模型,通过构象中心生成预训练(条件生成、掩码自回归建模和方向变换)来建模线性聚合物,在多种下游任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05257 2026-06-05 cs.LG cs.IR 83%

Scaling Laws for Behavioral Foundation Models over User Event Sequences

用户事件序列上行为基础模型的缩放定律

Rickard Brüel Gabrielsson

机构 * Unbox AI

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);分类 cs.LG

AI总结 研究行为基础模型在用户事件序列上的缩放定律,通过约600次实验发现小嵌入器参数最优,计算最优训练在低计算量时数据密集,且评估指标影响缩放定律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13548 2026-06-02 cs.RO cs.AI 83%

AttenA+: Rectifying Action Inequality in Robotic Foundation Models

AttenA+: 纠正机器人基础模型中的动作不平等性

Daojie Peng, Fulong Ma, Jiahang Cao, Qiang Zhang, Xupeng Xie, Jian Guo, Ping Luo, Andrew F. Luo, Boyu Zhou, Jun Ma

机构 * HKUST(GZ)(香港科技大学(广州)) HKU(香港大学) USTC(中国科学技术大学) IDEA Research(IDEA研究院) SUSTech(南方科技大学) X-Humaniod

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);分类 cs.AI

AI总结 针对机器人基础模型忽视动作物理重要性的问题,提出AttenA+框架,通过速度驱动的动作注意力重加权训练目标,提升复杂长程任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04958 2026-06-02 q-bio.QM cs.AI q-bio.NC 83%

CalM: A Self-Supervised Foundation Model for Population Dynamics in Calcium Imaging Data

CalM:一种用于钙成像数据中群体动力学的自监督基础模型

Xinhong Xu, Yimeng Zhang, Qichen Qian, Yuanlong Zhang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 提出自监督基础模型CalM,通过双轴自回归Transformer和高效分词器,在钙成像数据上预训练后,可迁移至神经群体动力学预测和行为解码等下游任务,并取得竞争性或更优性能。

Comments ICML accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02470 2026-06-02 cs.AI 83%

Breaking the Reversal Curse in Autoregressive Language Models via Identity Bridge

通过身份桥打破自回归语言模型中的逆转诅咒

Xutao Ma, Yixiao Huang, Hanlin Zhu, Somayeh Sojoudi

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 提出一种名为“身份桥”的简单数据正则化方法(形式为“A→A”),通过理论分析和实验证明该方法能有效缓解自回归语言模型中的逆转诅咒,使模型从事实记忆转向规则学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30561 2026-06-01 cs.CV cs.AI 83%

VLM3: Vision Language Models Are Native 3D Learners

VLM3:视觉语言模型是原生3D学习者

Zhipeng Cai, Zhuang Liu, Yunyang Xiong, Zechun Liu, Vikas Chandra, Yangyang Shi

机构 * Meta Princeton University(普林斯顿大学)

专题命中 预训练与数据 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出VLM3,通过焦距统一、文本像素参考和数据混合缩放,使标准视觉语言模型无需复杂架构或损失函数即可高效掌握多种3D任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29940 2026-05-29 cs.AI 83%

Make LLM Learn to Synthesize from Streaming Experiences through Feedback

使大语言模型通过反馈从流式经验中学习合成

Zhenlin Hu, Yan Wang, Zhen Bi, Zihao Xue, Bingyu Zhu, Longtao Huang, Xiongtao Zhang, Zeyu Yang, Zhixuan Chu, Jungang Lou

机构 * Huzhou Normal University(湖州师范学院) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Zhejiang Key Laboratory of Intelligent Education Technology and Application(浙江省智能教育技术与应用重点实验室)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出StreamSynth设置和SynLearner框架,使模型通过任务流积累经验并利用反馈提升合成数据生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28174 2026-05-28 cs.CV cs.AI 83%

FLORO: A Multimodal Geospatial Foundation Model for Ecological Remote Sensing Across Sensors and Scales

FLORO:面向跨传感器与尺度的生态遥感多模态地理空间基础模型

Jorge L. Rodriguez, Victor Angulo Morales, Areej Alwahas, Mariana Elias Lara, Fida Mohammad Thoker, Kasper Johansen, Bernard Ghanem, Fernando T. Maestre, Matthew F. McCabe

机构 * Biological and Environmental Science and Engineering Division, King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹科技大学生物与环境科学与工程 division) Computer, Electrical and Mathematical Science and Engineering Division, King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹科技大学计算机、电气与数学科学与工程 division)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 提出FLORO多模态地理空间基础模型,通过掩码自编码在异构遥感数据上预训练,利用可用性感知输入统一异构传感器配置,在PANGAEA基准上实现强迁移性能。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21835 2026-05-22 eess.IV cs.AI cs.CV physics.med-ph 83%

An Open Multi-Center Whole-Body FDG PET/CT Foundation Model for Tumor Segmentation

一种开放的多中心全身FDG PET/CT基础模型用于肿瘤分割

Xiaofeng Liu, Qianru Zhang, Thibault Marin, Menghua Xia, Chi Liu, Georges El Fakhri, Jinsong Ouyang

机构 * Department of Radiology and Biomedical Imaging, Yale Biomedical Imaging Institute, Yale University(放射学与生物医学成像系,耶鲁生物医学影像研究所,耶鲁大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出了一种开放的多中心全身FDG PET/CT基础模型,通过整合四个公开数据集中的4997份标准化扫描,利用层次UNet结构和早期通道拼接实现解剖和代谢特征的交互,提高了肿瘤分割的标签效率和跨模态表征学习能力。

Comments Code available at: https://github.com/liu-xiaofeng/Foundation-Model-for-PET-CT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21075 2026-05-21 cs.CV cs.LG 83%

SpectralEarth-FM: Bringing Hyperspectral Imagery into Multimodal Earth Observation Pretraining

SpectralEarth-FM: 将高光谱图像引入多模态地球观测预训练

Nassim Ait Ali Braham, Aaron Banze, Conrad M. Albrecht, Julien Mairal, Jocelyn Chanussot, Xiao Xiang Zhu

机构 * Chair of Data Science in Earth Observation(地球观测数据科学主任) Technical University of Munich(慕尼黑技术大学) Remote Sensing Technology Institute(遥感技术研究所) German Aerospace Center (DLR)(德国航空航天中心) Department of Aerospace Engineering(航空航天工程系) University of the Bundeswehr Munich(联邦国防军慕尼黑大学) LEAP Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Univ. Grenoble Alpes(格勒诺布尔阿尔卑斯大学) Inria(法国国家信息与自动化技术研究院) CNRS(法国国家科学研究中心) Grenoble INP(格勒诺布尔INP) LJK

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 本文提出SpectralEarth-FM,一种用于多传感器地球观测输入的分层变压器,旨在联合处理高光谱图像与低通道观测。通过构建SpectralEarth-MM数据集,采用JEPA风格的目标进行预训练,实现了在高光谱下游任务和标准EO基准上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19359 2026-05-20 cs.CV cs.LG 83%

MAM-CLIP: Vision-Language Pretraining on Mammography Atlases for BI-RADS Classification

MAM-CLIP:基于乳腺X线图集的视觉-语言预训练用于BI-RADS分类

Halil Ibrahim Gulluk, Olivier Gevaert

机构 * Department of Electrical Engineering(电气工程系) Biomedical Informatics Research (BMIR)(生物医学信息学研究(BMIR)) Stanford University(斯坦福大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.LG

AI总结 本文提出MAM-CLIP模型,通过预训练PubMedBERT和对比学习来提升乳腺X线图像的BI-RADS分类性能,实验表明在标注样本稀缺时,该方法能显著提高F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14907 2026-05-15 cs.AI 83%

KGPFN: Unlocking the Potential of Knowledge Graph Foundation Model via In-Context Learning

KGPFN:通过上下文学习解锁知识图谱基础模型的潜力

Yisen Gao, Jiaxin Bai, Haoyu Huang, Zhongwei Xie, Yufei Li, Hong Ting Tsang, Sirui Han, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST, Hong Kong, China(香港科技大学计算机科学与工程系) Department of Computer Science and Engineering, HKBU, Hong Kong, China(香港城市大学计算机科学与工程系)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 KGPFN通过结合先验数据拟合网络与上下文学习,统一了可转移关系规律与推理时的上下文学习,有效提升知识图谱推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17025 2026-05-13 cs.NI cs.AI 83%

netFound: Principled Design for Network Foundation Models

netFound:网络基础模型的原理化设计

Sylee Beltiukov, Satyandra Guthula, Haarika Manda, Jaber Daneshamooz, Wenbo Guo, Walter Willinger, Arpit Gupta, Inder Monga

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) Northwestern University(西北大学) ESNet

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 netFound通过四个设计原则提升网络基础模型性能,实现高质量表示与隐私保护,在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10184 2026-05-12 cs.CV cs.AI 83%

Developing a foundation model for high-resolution remote sensing data of the Netherlands

为荷兰高分辨率遥感数据开发一个基础模型

Paul Vermeeren, Heysem Kaya

机构 * Utrecht University, Department of Information and Computing Sciences(乌得勒支大学信息与计算科学系)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出结合卷积神经网络与视觉Transformer的基础模型,用于处理荷兰1.2米高分辨率卫星图像,通过融合时序数据提升遥感特征表示,实现更高效的遥感任务性能。

Comments 9 pages, 4 figures, under review in a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10129 2026-05-12 cs.CL 83%

Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data

合成预预训练提升语言模型对噪声预训练数据的鲁棒性

Xu Guo, Runyu Peng, Jian Tong, Yunhua Zhou, Haijun Lv, Zhihui Lu, Qipeng Guo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文研究了基于合成数据的轻量预预训练(PPT)阶段对提升语言模型在预训练阶段对噪声的鲁棒性的作用,实验表明PPT能有效降低噪声影响,尤其在高噪声水平下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04306 2026-05-12 cs.CV cs.AI 83%

HighFM: Towards a Foundation Model for Learning Representations from High-Frequency Earth Observation Data

HighFM:面向高频率地球观测数据学习表示的基础模型

Stella Girtsou, Konstantinos Alexis, Giorgos Giannopoulos, Charalambos Kontoes

机构 * National Observatory of Athens(国家天文台) National Technical University of Athens(雅典国家技术大学) National and Kapodistrian University of Athens(雅典国家与卡波迪斯特里亚大学) Athena Research Center(雅典研究所以及研究中心)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出HighFM,一种针对高时间分辨率多光谱地球观测数据的基础模型,通过SEVIRI影像和SatMAE框架学习时空表示,并在云遮蔽和主动火检测任务中展现优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21015 2026-05-12 cs.IR cs.CL 83%

Don't Retrieve, Generate: Prompting LLMs for Synthetic Training Data in Dense Retrieval

不检索,生成:通过提示LLMs生成合成训练数据用于密集检索

Aarush Sinha

专题命中 预训练与数据 :prompting(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过提示大型语言模型生成合成硬负样本,用于密集检索模型训练,通过在10个BEIR基准数据集上评估发现,生成模型性能不优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08472 2026-05-12 cs.AI 83%

Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models

中期使用自生成数据提升语言模型中的强化学习

Aswin RRV, Jacob Dineen, Divij Handa, Mihir Parmar, Ben Zhou, Swaroop Mishra, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学) Google Cloud AI Research(谷歌云人工智能研究) Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文研究在强化学习前使用多样化的自生成数据提升语言模型的强化学习效果,通过自生成数据训练后,模型在数学推理等任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07302 2026-05-11 cs.LG 83%

Pretraining Induces a Reusable Spectral Basis for Downstream Task Adaptation

预训练诱导了可重用的谱基底以用于下游任务适应

Junjie Yu, Yue Wang, Zihan Deng, Yan Zhu, Wenxiao Ma, Quanying Liu

机构 * Department of Biomedical Engineering, Southern University of Science and Technology(生物医学工程系,南方科技大学) Department of Psychology, The University of Hong Kong(心理学系,香港大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.LG

AI总结 本文通过系统谱分析揭示预训练模型的主奇异向量在微调中保持稳定且跨任务共享,表明预训练建立了可重用的谱坐标系,且更大规模预训练提升几何可迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07204 2026-05-11 cs.LG 83%

Arrow: A Foundation Model for Causal Discovery

Arrow:一种因果发现的基础模型

Ryan Thompson, He Zhao, Daniel M. Steinberg, Edwin V. Bonilla

机构 * University of Technology Sydney(技术科技大学) CSIRO’s Data61(CSIRO数据61)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 Arrow模型通过将有向无环图分解为无向骨架和拓扑序,实现零样本因果发现。该模型基于Transformer架构预测边概率和节点顺序,训练于合成数据集,能在多种数据集上实现高效准确的因果发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11016 2026-05-08 cs.CV cs.AI 83%

SoccerMaster: A Vision Foundation Model for Soccer Understanding

SoccerMaster: 一种用于足球理解的视觉基础模型

Haolin Yang, Jiayuan Rao, Haoning Wu, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出SoccerMaster,一种统一的足球视觉理解模型,通过多任务预训练统一处理从细粒度感知到高层语义推理的多种任务,实验表明其在多种下游任务中表现优异。

Comments Accepted by CVPR 2026 (Oral); Project Page: https://haolinyang-hlyang.github.io/SoccerMaster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05773 2026-05-08 cs.AI 83%

CircuitFormer: A Circuit Language Model for Analog Topology Design from Natural Language Prompt

CircuitFormer:一种用于从自然语言提示中进行模拟拓扑设计的电路语言模型

Md Touhidul Islam, Sujan Kumar Saha, Farimah Farahmandi, Mark Tehranipoor

机构 * Department of Electrical and Computer Engineering, University of Florida, Gainesville, FL, USA(佛罗里达大学电气与计算机工程系,盖恩斯维尔,佛罗里达州,美国)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文提出CircuitFormer,一种专门用于模拟拓扑设计的电路语言模型,通过改进的电路图分词器CKT,实现了更高效的电路拓扑表示,提升了设计准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26960 2026-05-01 cs.CY cs.AI 83%

LLM Biases

LLM偏见

Jinhui Han, Ming Hu, Xilin Zhang

机构 * Guanghua School of Management, Peking University(北京大学光华管理学院) Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究了基于Transformer的生成推荐系统中四种系统性偏见机制,指出其可能影响长期多样性和用户选择,强调需关注运营风险而非仅依赖性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏