arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 139420 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2410.18677 2025-06-09 cs.CV cs.LG eess.IV 80%

Enhancing pretraining efficiency for medical image segmentation via transferability metrics

Gábor Hidy, Bence Bakos, András Lukács

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

Comments An error was discovered in the aggregation process of our results, particularly affecting the experiments involving the advanced pretraining method. This impacts the main conclusions of the paper, and we are therefore withdrawing the submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11898 2024-09-30 cs.RO cs.LG 80%

VITaL Pretraining: Visuo-Tactile Pretraining for Tactile and Non-Tactile Manipulation Policies

Abraham George, Selam Gano, Pranav Katragadda, Amir Barati Farimani

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

Comments 7 pages, 6 figures, submitted to ICRA 2025. Prior version named "Visuo-Tactile Pretraining for Cable Plugging"

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.13703 2023-08-29 cs.LG 80%

PAITS: Pretraining and Augmentation for Irregularly-Sampled Time Series

Nicasia Beebe-Wang, Sayna Ebrahimi, Jinsung Yoon, Sercan O. Arik, Tomas Pfister

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

Comments Code: \url{https://github.com/google-research/google-research/tree/master/irregular_timeseries_pretraining}

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.08082 2022-06-17 cs.CL 80%

Self-Generated In-Context Learning: Leveraging Auto-regressive Language Models as a Demonstration Generator

Hyuhng Joon Kim, Hyunsoo Cho, Junyeob Kim, Taeuk Kim, Kang Min Yoo, Sang-goo Lee

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

Comments NAACL 2022 Workshop on Large-scale Pre-trained Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.11229 2021-03-02 cs.CV cs.LG 80%

Pretraining boosts out-of-domain robustness for pose estimation

Alexander Mathis, Thomas Biasi, Steffen Schneider, Mert Yüksekgönül, Byron Rogers, Matthias Bethge, Mackenzie W. Mathis

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

Comments A.M. and T.B. co-first authors. Dataset available at http://horse10. deeplabcut.org . WACV 2021 conference

Journal ref https://openaccess.thecvf.com/content/WACV2021/html/Mathis_Pretraining_Boosts_Out-of-Domain_Robustness_for_Pose_Estimation_WACV_2021_paper.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17187 2026-08-25 stat.ME stat.OT 版本更新 80%

Identifying Model Quality Effects on User Engagement: A Within-Version Causal Estimator with Synthetic Data Validation

识别模型质量对用户参与度的影响:一种结合合成数据验证的版本内因果估计器

John Tribbia

专题命中 预训练与数据 :LLM(summary_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM模型更新与用户参与度的因果识别难题,提出结合合成数据验证的版本内因果估计器,经衰减调整后可准确估计模型质量对参与度的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11250 2026-08-25 cs.CR cs.CV 版本更新 80%

Environmental Injection Attacks against GUI Agents in Realistic Dynamic Environments

针对现实动态环境中的GUI代理的环境注入攻击

Yitong Zhang, Ximo Li, Liyi Cai, Jia Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Computer Science, Peking University(北京大学计算机学院)

专题命中 预训练与数据 :LLM(summary_cn,abstract)

AI总结 本文提出Chameleon框架,通过LLM驱动的环境模拟和注意力黑洞机制,有效暴露GUI代理在动态环境中的隐藏漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12536 2026-08-24 cs.DB cs.DS cs.IR 版本更新 80%

jXBW: A Compressed Index Enabling Structure-Aware JSONL Retrieval for Structured RAG

jXBW: 面向结构化RAG中结构感知JSONL检索的压缩索引

Yasuo Tabei

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出jXBW压缩索引,通过合并树表示、基于扩展Burrows-Wheeler变换的简洁树索引和三阶段子结构搜索算法,实现查询依赖的复杂度,在百万级JSONL数据集上比最强基线快16倍至2800倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10315 2026-08-13 cs.CY 版本更新 80%

Is Misinformation More Open? A Study of robots.txt Gatekeeping on the Web

虚假信息是否更开放?一项关于robots.txt门禁的网络研究

Nicolas Steinacker-Olsztyn, Devashish Gosain, Ha Dao

专题命中 预训练与数据 :LLM(summary_cn);large language model(abstract);language model(abstract)

AI总结 研究发现可信网站比虚假信息网站更频繁地禁止AI爬虫,且这种差异随时间扩大,可能影响LLM训练数据和网络透明度。

Comments 10 pages, 11 figures

Journal ref In Proceedings of the ACM Web Conference 2026 (WWW 26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05108 2026-08-06 cs.CR 新提交 80%

Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming

智能体对抗智能体:一种用于自动提示注入红队测试的智能体系统

Yanting Wang, Chenlong Yin, Runpeng Geng, Jinyuan Jia

专题命中 预训练与数据 :LLM(summary_cn,abstract)

AI总结 本研究提出PIMiner智能体系统,用于自动提示注入红队测试,该系统构建可迁移策略库,仅需少量查询即可在IPIArena、AgentDojo基准上对多款LLM实现高攻击成功率,解决现有方法泛化性差的问题。

Comments Our code is available at https://github.com/wang-yanting/PIMiner

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19258 2026-08-04 cs.CL cs.AI cs.CR cs.LG 版本更新 80%

MAPLE: Metadata Augmented Private Language Evolution

MAPLE:元数据增强的隐私语言演化

Eli Chien, Yuzheng Hu, Ryan McKenna, Shanshan Wu, Zheng Xu, Peter Kairouz

机构 * National Taiwan University(国立台湾大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google Research(谷歌研究) Meta

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MAPLE通过差分隐私元数据提取和上下文学习,解决私有演化中初始化瓶颈问题,实现更优的隐私-效用平衡和更低的API成本。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10161 2026-07-24 q-bio.GN 版本更新 80%

Omics Data Discovery Agents: Agent-Supported Retrieval, Reanalysis, and Synthesis of Published Omics Data

组学数据发现代理

Alexandre Hutton, Jesse G. Meyer

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于代理的框架,通过自动化提取和处理组学数据,实现对生物医学文献的可执行查询和大规模数据重用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08194 2026-07-10 cs.CV 新提交 80%

Dive Into the Implicit Biases of Low-rank Vision-language Alignment

深入探究低秩视觉-语言对齐中的隐式偏差

Mingjia Shi, Shuo Wang, Xiaobo Wang, Sifan Zhou, Kai Wang, Tianyu Fu, Chenxu Zhao, Anyang Su, Ping Jiang, Minghui Wu

机构 * Shenzhen University of Advanced Technology(深圳先进技术研究院) National University of Singapore(新加坡国立大学) Mininglamp(明略科技)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 挑战视觉-语言对齐需全参数更新的观点,研究低秩适应在此阶段的应用,发现其能降成本且性能优。通过实证、几何分析和理论推导探究现象原因,并进行多方面消融实验。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27080 2026-06-26 cs.SE 新提交 80%

ATGBuilder: Feature-Assisted Graph Learning for Activity Transition Graph Construction with Seed Supervision

ATGBuilder: 基于特征辅助图学习的活动转换图构建与种子监督

Chenhui Cui, Zixiang Xian, Danyu Li, Tao Li, Rubing Huang, Dave Towey, Shikai Guo, Jiakun Liu

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出ATGBuilder,利用大语言模型总结UI布局元数据,并将控件触发信息建模为边属性,通过辅助重构目标进行图学习,在种子监督下构建高质量活动转换图,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14961 2026-06-26 q-bio.NC 版本更新 80%

Power-Law Scaling in the Classification Performance of Small-Scale Spiking Neural Networks

小规模脉冲神经网络分类性能的幂律标度

Zhengdi Zhang, Cong Han, Wenjun Xia

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究基于LIF神经元模型的小规模脉冲神经网络分类性能,发现准确率主要随类别数呈幂律标度,并使用大语言模型辅助发现函数关系。

Comments We need to improve the academic writing and the model in this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21996 2026-06-23 cs.SI cs.CY 新提交 80%

Cultural Targets, Structural Frames, Binding Morals: A Cross-Lingual Audit of Online Hate in Multicultural Singapore

文化目标、结构框架、约束道德:多元文化新加坡中在线仇恨的跨语言审计

Emilio Ferrara

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 通过分析新加坡多语言社交媒体语料,发现仇恨言论的目标群体因语言而异,但威胁框架和道德基础(圣洁与忠诚)跨语言高度一致,且反移民仇恨被优先放大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01241 2026-06-23 cs.CR cs.SE 80%

MCP-SandboxScan: WASM-based Secure Execution and Runtime Analysis for MCP Tools

MCP-SandboxScan:基于WASM的MCP工具安全执行与运行时分析

Zhuoran Tan, Run Hao, Jeremy Singer, Yutian Tang, Christos Anagnostopoulos

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出MCP-SandboxScan框架,通过WASM环境执行工具并提取运行时证据,结合语义分析识别MCP工具的风险,验证其在跨语言项目、 evasion基准和100个仓库中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13918 2026-06-15 cs.SE cs.CR 新提交 80%

Bayesian-Calibrated Detection of Hallucinated Package Imports in AI-Assisted Code

AI辅助代码中幻觉包导入的贝叶斯校准检测

Lom M. Hillah, Jean-Marc Richard, Ryan Hasnaoui

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出贝叶斯校准层,基于三元认知分类法输出Beta后验概率,并利用PyPI元数据检测注册但可疑的包,优于二元基线。

Comments 23 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13095 2026-06-12 eess.AS cs.SD 新提交 80%

Balancing ASR and diarization in end-to-end LLMs for multi-talker speech recognition

在端到端大语言模型中平衡ASR与说话人日志以进行多说话人语音识别

Naijun Zheng, Yuke Lin, Sanli Tian, Mengtian Li, Zhiwei Lin, Longshuai Xiao, Dandan Tu

机构 * Huawei Technologies, China(华为技术有限公司)

专题命中 预训练与数据 :LLM(summary_cn,abstract)

AI总结 提出双编码器架构、特征交错格式、长度感知说话人ID损失和自适应阈值ASR损失策略,在有限真实数据下高效训练LLM系统,平衡ASR与说话人日志任务,在AliMeeting和Aishell4语料库上分别实现18%和24%的相对改进。

Comments Accepted in Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03001 2026-06-12 cs.DC 版本更新 80%

FOLD: Fuzzy Online Deduplication for Very Large Evolving Datasets via Approximate Nearest Neighbor Search

FOLD: 面向超大规模演化数据集的模糊在线去重方法(基于近似最近邻搜索)

Nelson Bore, Pritish Mishra, Constantin Adam, Eyal de Lara, Oana Balmau

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出FOLD系统,利用增量更新的HNSW索引和位图表示改进Jaccard相似度计算,实现高召回率和高吞吐量的在线模糊去重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10481 2026-06-10 cs.LG cs.AI cs.CL cs.CR stat.ML 新提交 80%

Advancing the State-of-the-Art in Empirical Privacy Auditing

推进经验隐私审计的最新水平

Nicole Mitchell, Galen Andrew, Arun Ganesh, Brendan McMahan, Peter Kairouz

机构 * Google Research(谷歌研究院)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出通过高温采样生成合成金丝雀,用于经验隐私审计,并引入基于辅助模型的合成数据审计方法,系统研究模型容量与金丝雀熵对记忆化的交互影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09145 2026-06-09 cs.CR 新提交 80%

PrivCode++: Latent-Conditioned Differentially Private Code Generation for Comprehensive Guarantees

PrivCode++: 潜在条件差分隐私代码生成以实现全面保障

Zheng Liu, Chen Gong, Terry Yue Zhuo, Zhou Yang, Kecen Li, Wenlong Meng, Xinwen Hou, Yu Liu, Xiaochen Li

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对指令-代码对微调的大语言模型可能泄露敏感数据的问题,提出PrivCode-Plus,首个在微调中同时保护提示和代码的差分隐私代码生成方法,通过两阶段DP框架和无隐私潜在条件模块实现高效合成。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07732 2026-06-09 cs.SE 新提交 80%

The Windows IOCTL Census: A Corpus-Scale, Multi-Architecture Database of the Driver Control-Code Surface

Windows IOCTL 普查:驱动程序控制码界面的语料规模、多架构数据库

Michael J. Bommarito

专题命中 预训练与数据 :LLM(summary_cn,abstract)

AI总结 通过确定性、架构无关的静态分析,构建了27,087个签名Windows驱动程序的IOCTL控制码分发表数据库,覆盖x86和x64,并利用LLM对可达处理程序进行排序。

Comments 15 pages, 4 figures, 4 tables. Companion structural-tier dataset: huggingface.co/datasets/mjbommar/ioctl-census

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06425 2026-06-05 cs.SI 80%

Annotation of Positive vs Negative User Interactions for Social Sign Prediction

社交关系符号预测中积极与消极用户交互的标注

Biancamaria Bombino, Chiara Boldrini, Andrea Passarella, Marco Conti

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出利用大语言模型零样本识别交互中的个人赞扬和攻击作为关系信号,以改进社交关系符号预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17016 2026-05-26 cs.SE 80%

HELO-APR: Enhancing Low-Resource Program Repair through Cross-Lingual Knowledge Transfer

HELO-APR:通过跨语言知识迁移增强低资源程序修复

Zhipeng Wang, Boyang Yang, Yidong Wan, Liuye Guo, You Lv, Tao Zheng, Zhuowei Wang, Tieke He

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出HELO-APR框架,通过从高资源语言合成低资源语言修复数据并采用课程学习策略,显著提升低资源语言的自动程序修复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23820 2026-05-25 cs.CY cs.SI 80%

Inferential Privacy Leakage in Anonymized Conversational AI Logs

匿名化对话式AI日志中的推断隐私泄露

S M Mehedi Zaman, Kiran Garimella

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 通过分析来自四个全球南方国家1000多名用户的ChatGPT对话历史,测量了显式披露和推断性隐私泄露,发现即使移除显式个人身份信息,大型语言模型仍能以高F1分数推断用户年龄、性别和国家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21242 2026-05-21 cs.RO 80%

To Select or not to Select, that is the Question: Distilling Robot Skill Prediction into a Small Ensemble

选择还是不选择,这是个问题:将机器人技能预测蒸馏成一个小集成

Haechan Mark Bong, Simon Roy, Euhid Aman, Giovanni Beltrame

机构 * Department of Computer Engineering and Software Engineering, Polytechnique Montréal(蒙特利尔理工学院计算机工程与软件工程系) MILA(蒙特利尔人工智能研究所) National Taiwan University of Science and Technology (NTUST)(台湾科技大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract)

AI总结 本文研究了机器人技能预测问题,通过合成数据集和微调句子编码器,提出了一种小规模专用模型,在零样本提示下优于大型通用LLM,在机器人队伍任务路由中表现更佳。

Journal ref ICRA 2026 Workshop on Synthetic Data for Robot Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20602 2026-05-21 cs.CL cs.AI cs.LG 80%

Self-Training Doesn't Flatten Language -- It Restructures It: Surface Markers Amplify While Deep Syntax Dies

自我训练不使语言扁平化——它重构了它:表面标记增强而深层语法消失

Ming Liu

机构 * Amazon(亚马逊)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究通过实验发现自我训练过程并非使语言扁平化,而是重构了语言结构,表面标记增强而深层语法结构消失,并提出了结构性深度假说来解释这一现象。

Comments 19 pages (14 main + 5 appendix), 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17846 2026-05-19 eess.AS 80%

UrduSpeech: A 156-Hour Urdu Speech Corpus with 12-Dimension Paralinguistic Annotations

UrduSpeech: 一个包含12维副语言标注的156小时乌尔都语语音语料库

Attia Nafees ul Haq, Zeyu Zhu, Jingbin Hu, ChunJiang He, Lei Xie

专题命中 预训练与数据 :LLM(summary_cn,abstract)

AI总结 本文提出UrduSpeech语料库,包含156小时乌尔都语语音和12维副语言标注,通过LLM驱动的流程处理多种类别,如新闻、戏剧和罕见文学形式,并发布了一个9小时的基准集,用于评估语音质量。

Comments 6 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10825 2026-05-12 cs.NI 80%

Large Spectrum Models (LSMs): Decoder-Only Transformer-Powered Spectrum Activity Forecasting via Tokenized RF Data

大规模频谱模型(LSMs):通过令牌化射频数据的解码器-only变换器进行频谱活动预测

Mohammad Mosiur Lunar, Mehmet C. Vuran

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出大规模频谱模型(LSMs),通过令牌化射频数据利用大规模语言模型架构进行频谱预测,展示了LSMs在频谱预测中的有效性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏