arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-05 至 2026-02-05 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 18 篇

2602.04602 2026-02-05 cond-mat.mtrl-sci physics.data-an 89%

Automated Extraction of Multicomponent Alloy Data Using Large Language Models for Sustainable Design

利用大语言模型自动化提取多组分合金数据用于可持续设计

Aravindan Kamatchi Sundaram, Mohit Chakraborty, Sai Mani Kumar Devathi, B. Pabitramohan Prusty, Rohit Batra

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 利用大语言模型自动化提取多组分合金数据,构建大规模数据库并用于可持续材料选择。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04731 2026-02-05 cs.CL cs.LG 88%

Less Finetuning, Better Retrieval: Rethinking LLM Adaptation for Biomedical Retrievers via Synthetic Data and Model Merging

更少微调,更好检索:通过合成数据和模型合并重新思考LLM适应于生物医学检索器

Sameh Khattab, Jean-Philippe Corbeil, Osman Alperen Koraş, Amin Dada, Julian Friedrich, François Beaulieu, Paul Vozila, Jens Kleesiek

机构 * IKIM, University Hospital Essen(IKIM,埃森大学医院) Microsoft Healthcare & Life Sciences(微软医疗与生命科学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出STM框架,通过合成数据和模型合并提升生物医学检索性能,实验显示在任务特定专家上提升23.5%并优于基线模型。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04785 2026-02-05 cs.LG cs.AI 84%

Team, Then Trim: An Assembly-Line LLM Framework for High-Quality Tabular Data Generation

团队后再修剪:一种用于高质量表格数据生成的流水线LLM框架

Congjing Zhang, Ryan Feng Lin, Ruoxuan Bao, Shuai Huang

机构 * Department of Industrial & Systems Engineering, University of Washington(华盛顿大学工业与系统工程系) Department of Management, Shanghai University(上海大学管理学院)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Team-then-Trim框架通过协作LLMs生成高质量表格数据,并结合三阶段质量控制流程,有效解决表格数据稀缺和质量低的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17923 2026-02-05 cs.CL 79%

Language models can learn implicit multi-hop reasoning, but only if they have lots of training data

语言模型可以学习隐式多跳推理,但只有在有大量训练数据的情况下

Yuekun Yao, Yupei Du, Dawei Zhu, Michael Hahn, Alexander Koller

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本文研究了语言模型通过大量训练数据学习隐式多跳推理的能力,并发现训练数据量随推理跳数呈指数增长,但通过课程学习可部分缓解这一需求。

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16381 2026-02-05 cs.CL cs.LG 79%

PaTH Attention: Position Encoding via Accumulating Householder Transformations

PaTH Attention: 通过累积Householder变换实现位置编码

Songlin Yang, Yikang Shen, Kaiyue Wen, Shawn Tan, Mayank Mishra, Liliang Ren, Rameswar Panda, Yoon Kim

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Watson AI Lab(MIT-IBM Watson人工智能实验室) Stanford University(斯坦福大学) Microsoft(微软公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 PaTH Attention通过累积Householder变换实现数据依赖的位置编码,提升Transformer模型的表达能力。

Comments NeurIPS 2025 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16793 2026-02-05 cs.RO 78%

PhysBrain: Human Egocentric Data as a Bridge from Vision Language Models to Physical Intelligence

PhysBrain: 人眼视角数据作为视觉语言模型到物理智能的桥梁

Xiaopeng Lin, Shijie Lian, Bin Yu, Ruoqi Yang, Zhaolong Shen, Changti Wu, Yuzhuo Miao, Yurun Jin, Yukun Shi, Jiyan He, Cong Huang, Bojun Cheng, Kai Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) Harbin Institute of Technology(哈尔滨工业大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 PhysBrain通过将人类眼动视频转化为多级具身监督,提升机器人在眼动感知和长期规划中的能力,实现从人类视角到机器人控制的有效迁移。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04441 2026-02-05 cs.CV 78%

Benchmarking Foundation Models for Mitotic Figure Classification

对有监督模型进行基准测试以进行分裂图分类

Jonas Ammeling, Jonathan Ganz, Emely Rosbach, Ludwig Lausser, Christof A. Bertram, Katharina Breininger, Marc Aubreville

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 本研究通过LoRA调整基础模型,在仅用10%训练数据的情况下达到接近100%性能,并在未见领域中表现优异。

Comments Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2026:003

Journal ref Machine.Learning.for.Biomedical.Imaging. 2026 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04195 2026-02-05 cs.SE cs.CR 75%

Semantic Consensus Decoding: Backdoor Defense for Verilog Code Generation

语义一致性解码:用于Verilog代码生成的后门防御

Guang Yang, Xing Hu, Xiang Chen, Xin Xia

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出语义一致性解码方法,通过提取功能需求和融合输出分布,有效防御Verilog代码生成中的后门攻击。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04304 2026-02-05 cs.CV cs.AI cs.CL 73%

Beyond Static Cropping: Layer-Adaptive Visual Localization and Decoding Enhancement

超越静态裁剪:层适应的视觉定位与解码增强

Zipeng Zhu, Zhanghao Hu, Qinglin Zhu, Yuxi Hong, Yijun Liu, Jingyong Su, Yulan He, Lin Gui

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) King’s College London(伦敦大学国王学院)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LASER方法,通过动态层适应提升视觉定位和解码精度,解决静态裁剪在复杂推理任务中的局限性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02619 2026-02-05 cs.LG cs.AI cs.SE 73%

daVinci-Agency: Unlocking Long-Horizon Agency Data-Efficiently

daVinci-Agency: 解锁长周期代理数据高效性

Mohan Jiang, Dayuan Fu, Junhao Shi, Ji Zeng, Weiye Si, Keyu Li, Xuefeng Li, Yang Xiao, Wenjie Li, Dequan Wang, Pengfei Liu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 daVinci-Agency通过PR序列生成长周期代理数据,实现高效且高质量的监督学习,提升模型在复杂任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03962 2026-02-05 cs.CL 70%

Automatic Classification of Pedagogical Materials against CS Curriculum Guidelines

根据CS课程指南自动分类教学材料

Erik Saule, Kalpathi Subramanian, Razvan Bunescu

机构 * Department of Computer Science(计算机科学系) The University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出利用自然语言处理技术自动分类教学材料,以加速根据CS课程指南评估课程内容覆盖情况的过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04072 2026-02-05 quant-ph 67%

Data Verification is the Future of Quantum Computing Copilots

数据验证是量子计算copilot的未来

Junhao Song, Ziqian Bi, Xinliang Chia, William Knottenbelt, Yudong Cao

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本研究提出数据验证在量子计算copilot和AI自动化中的重要性,强调验证作为架构基础的必要性,通过实验表明未验证的LLMs在电路优化中准确率仅为79%。

Comments 13 Pages, 20 Figures. Accepted to AAAI 2026 Workshop on AI4Research. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24762 2026-02-05 cs.IR 67%

OpenOneRec Technical Report

OpenOneRec 技术报告

Guorui Zhou, Honghui Bao, Jiaming Huang, Jiaxin Deng, Jinghao Zhang, Junda She, Kuo Cai, Lejian Ren, Lu Ren, Qiang Luo, Qianqian Wang, Qigen Hu, Rongzhou Zhang, Ruiming Tang, Shiyao Wang, Wuchao Li, Xiangyu Wu, Xinchen Luo, Xingmei Wang, Yifei Hu, Yunfan Wu, Zhanyu Liu, Zhiyang Zhang, Zixing Zhang, Bo Chen, Bin Wen, Chaoyi Ma, Chengru Song, Chenglong Chu, Defu Lian, Fan Yang, Feng Jiang, Hongtao Cheng, Huanjie Wang, Kun Gai, Pengfei Zheng, Qiang Wang, Rui Huang, Siyang Mao, Tingting Gao, Wei Yuan, Yan Wang, Yang Zhou, Yi Su, Zexuan Cheng, Zhixin Ling, Ziming Li

专题命中 预训练与数据 :pretraining(abstract);post-training(abstract)

AI总结 OpenOneRec 通过 RecIF-Bench 和大规模数据集提升推荐系统智能,展示模型在复杂任务中的卓越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04605 2026-02-05 cs.CL cs.AI 62%

RexBERT: Context Specialized Bidirectional Encoders for E-commerce

RexBERT: 电商专用双向编码器

Rahul Bajaj, Anuj Garg

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 RexBERT通过专为电商设计的编码器,在参数更少的情况下超越通用模型,提升电商领域任务表现。

Comments Blog: https://huggingface.co/blog/thebajajra/rexbert-encoders Models: https://huggingface.co/collections/thebajajra/rexbert Ecom-niverse Dataset: https://huggingface.co/datasets/thebajajra/Ecom-niverse

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04706 2026-02-05 cs.CL 57%

LiteToken: Removing Intermediate Merge Residues From BPE Tokenizers

LiteToken: 从BPE分词器中移除中间合并残余

Yike Sun, Haotong Yang, Zhouchen Lin, Muhan Zhang

机构 * Peking University, Beijing, China(北京大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 LiteToken通过移除BPE分词器中的低频残余标记,减少标记碎片化和参数,提升对噪声输入的鲁棒性,同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26064 2026-02-05 cs.LG 57%

Towards Scaling Laws for Symbolic Regression

迈向符号回归的标度法则

David Otte, Jörg K. H. Franke, Arbër Zela, Fábio Ferreira, Frank Hutter

机构 * University of Freiburg(弗赖堡大学) ELLIS Institute Tübingen(图宾根ELLIS研究所) Open-Sci Collective(开放科学集体) LAION Prior Labs(Prior实验室)

专题命中 预训练与数据 :language model(abstract);分类 cs.LG

AI总结 本文研究符号回归中计算量与性能之间的标度关系,发现验证损失和解决率随计算量呈幂律趋势,并确定了计算最优的超参数标度。

Comments Accepted at the NeurIPS 2025 Math-AI Workshop and the EurIPS 2025 AITD Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04681 2026-02-05 eess.SP 50%

HFMCA: Orthonormal Feature Learning for EEG-based Brain Decoding

HFMCA:基于EEG的脑解码的正交特征学习

Yinghao Wang, Lintao Xu, Shujian Yu, Enzo Tartaglione, Van-Tam Nguyen

专题命中 预训练与数据 :pretraining(abstract)

AI总结 HFMCA通过正交特征学习提升EEG脑解码的准确率和泛化能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03307 2026-02-05 cs.SD 50%

GRAM: Spatial general-purpose audio representations for real-world environments

GRAM:用于现实环境的空间通用音频表示

Goksenin Yuksel, Marcel van Gerven, Kiki van der Heijden

专题命中 预训练与数据 :foundation model(abstract)

AI总结 GRAM通过多通道掩码自编码器学习空间音频表示,在真实环境中的声音定位和识别任务中表现出色。

Comments I have accidentally uploaded a revised version of my old paper. I meant to revise arXiv:2506.00934 rather than upload a new version

详情

展开后加载摘要…

URL PDF HTML 收藏