arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 799 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 799 篇

2608.10154 2026-08-12 cs.CL cs.AI 新提交 82%

Multimodal Item Parameter Estimation using Simulated Response Probabilitie

基于模拟响应概率的多模态题目参数估计

Christopher Ormerod, YoungKoung Kim

机构 * College Board(大学理事会)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究基于Qwen3.5微调多模态大语言模型,利用含图像与文本的多项选择题训练语料,通过学习学生能力相关的选择概率,实现了题目参数的准确估计。

Comments Submitted and Accepted for AIME-Con 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07316 2026-08-10 cs.CL cs.AI cs.SI 新提交 82%

Natural Language Processing Psychometrics

自然语言处理心理测量学

Edoardo Sebastiano De Duro, Emma Franchino, Massimo Stella

机构 * University of Trento(特伦托大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 该研究将文本心理预测视为心理测量问题,用9种LLM角色完成问卷,结合多特征构建RF模型,解释了SWLS等的方差,还能区分角色、分类临床与对照参与者,明确了NLP心理测量的区分方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03372 2026-08-05 cs.CL cs.AI 新提交 82%

FACTWASH: Catching AI Rewrites That Wash Hearsay into Fact

FACTWASH:捕捉将传闻洗成事实的AI改写

Alex Kwon

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出开源工具factwash,用于捕捉AI将传闻洗成事实的改写,明确否定线索检测F1达0.91,LLM见证者可提升线索检测召回率,在mem0 2.0.7上标记8个模糊传闻写入中的5个。

Comments 15 pages, 3 figures. Code and data: https://github.com/collapseindex/factwash

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25135 2026-07-29 cs.AI cs.LG 新提交 82%

ScalableRAG: High-Quality RAG at Zero Ingestion Cost

ScalableRAG:零摄入成本下的高质量检索增强生成

Hilaf Hasson, Aditya Chakravarty, Jayant Thomas, Krishna Gogineni

机构 * Cohesity(科赫思)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 研究提出零摄入成本的ScalableRAG及有限摄入的改进版本,通过维护工作区实现即时聚合推理,在六个语料库测试中表现出色,平均准确率大幅超越基线,还通过固定LLM调用次数等进一步提升大规模时的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10534 2026-07-14 cs.AI cs.CR cs.LG 新提交 82%

Cross-Layer Misalignment Detection in Agent Skills: A Progressive Loading-Aware Contrastive Learning Approach

智能体技能中的跨层错位检测:一种渐进式加载感知对比学习方法

Chengjun Zhang, Yang Gao, Jianna Hur, Jingjing Zhang, Sagar Samtani

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究智能体技能跨层错位问题,提出渐进式加载感知分层对比学习框架PL-HCL,通过建模技能分层结构和学习跨层一致性来检测错位,使用相关语料库与挑战集,提升宏F1指标,为用户和运营商提供筛选工具与设计原则。

Comments 10 pages, 5 pages supplemental. Accepted at the KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30813 2026-07-01 cs.LG cs.AI 新提交 82%

Gradient Smoothing: Coupling Layer-wise Updates for Improved Optimization

梯度平滑:耦合逐层更新以改进优化

Haoming Meng, Anton Sugolov, Vardan Papyan

机构 * Vector Institute(向量研究所)

专题命中 预训练与数据 :LLM(abstract_cn);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 提出深度梯度增强框架,通过窗口平滑算子沿深度方向变换优化器更新,在不改变模型架构或训练目标下提升多种架构和任务的优化与泛化性能。

Comments Published in the Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27242 2026-06-26 cs.LG cs.CL stat.ML 新提交 82%

The Geometry of Updates: Fisher Alignment at Vocabulary Scale

更新的几何:词汇规模下的Fisher对齐

John Sweeney

机构 * Sideplane AI

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 针对共享词汇的LLM家族,提出FisherSketch方法,通过核均值嵌入的余弦相似度估计Fisher对齐,实现词汇规模下的高效源选择,并揭示激活、误差及耦合因素。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026), PMLR 306. 64 pages total (main paper plus appendix), 4 figures, 29 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16307 2026-06-16 cs.AI cs.CL 新提交 82%

State-Grounded Multi-Agent Synthetic Data Generation for Tool-Augmented LLMs

面向工具增强型大语言模型的基于状态的多智能体合成数据生成

Rahul Khedar, Eshita, Sneha Teja Sree Reddy Thondapu, Mayank Malhotra, Arup Das, Jitesh Chandra, Yun-Shiuan Chuang, Chaitanya Kulkarni, Arun Menon, Linsey Pang, Avinash Karn, Mouli V, Prakhar Mehrotra

机构 * PayPal AI

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出StateGen平台,通过四角色LLM循环和状态管理器生成多轮、工具接地的高质量训练对话,消除工具调用幻觉,支持层次化多智能体设置。

Comments 9 pages, 5 figures, 6 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08960 2026-06-09 cs.CR cs.AI cs.LG cs.MA 新提交 82%

Hardening Agent Benchmarks with Adversarial Hacker-Fixer Loops

通过对抗性黑客-修复者循环强化智能体基准测试

Ziqian Zhong, Ivgeni Segal, Ivan Bercovich, Shashwat Saxena, Kexun Zhang, Aditi Raghunathan

机构 * Carnegie Mellon University(卡内基梅隆大学) Fewshot Corp(Fewshot公司) Independent Researcher(独立研究员)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出黑客-修复者循环方法,通过LLM代理交替攻击和修补验证器,自动生成抗利用的验证器,将KernelBench攻击成功率从62%降至0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14924 2026-08-18 cs.CV cs.AI 新提交 82%

PaSTel: Anchoring Histology in Spatial Transcriptomics via Multi-Scale Hierarchical Bio-Prior Contrastive Pretraining

PaSTel:通过多尺度层级生物先验对比预训练锚定空间转录组学中的组织学

Azim Dehghani Amirabad, Junchao Zhu, Pushpak Pati, Walid Abdelmoula, Tommaso Mansi, Rui Liao

机构 * Johnson & Johnson Innovative Medicine(强生创新医药)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI;large language model(comments);language model(comments)

AI总结 PaSTel是一种整合多尺度生物先验的层级多模态预训练框架,通过三层生物先验设计解决现有空间转录组学方法的局限,在多个下游任务中性能优于现有编码器。

Comments This paper was accepted to the 3rd ICML 2026 Workshop on Multi-modal Foundation Models and Large Language Models for Life Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16718 2026-08-18 cs.CV 新提交 82%

CytoFormer: A Molecularly Supervised Cell Foundation Model for Histopathology Cell Classification

CytoFormer:用于组织病理学细胞分类的分子监督细胞基础模型

Jialu Yao, Songhao Li, Alina Yu, Zhi Huang

机构 * University of Pennsylvania(宾夕法尼亚大学) Germantown Friends School(日耳曼敦贵格会学校)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 CytoFormer利用配对H&E染色与空间转录组学数据训练细胞基础模型,在细胞分类、迁移学习及主动学习中表现优异,为常规组织学的细胞分析提供高效可复用表示。

Comments 20 pages, 5 figures, 2 extended data figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16614 2026-08-18 cs.CV 新提交 82%

Beyond Accuracy: Assessing Calibration of Geospatial Foundation Models and Their Sensitivity to Distribution Shifts

超越准确率:评估地理空间基础模型的校准度及其对分布偏移的敏感性

Nils Lehmann, Jakob Gawlikowski, Burak Ekim, Isaac Corley, Xiao Xiang Zhu

机构 * Technical University of Munich (TUM)(慕尼黑工业大学) German Aerospace Center (DLR)(德国航空航天中心) Massachusetts Institute of Technology (MIT)(麻省理工学院) Taylor Geospatial(泰勒地理空间公司)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 该研究指出GeoFMs仅用准确率排序的不足,分析其校准度与分布偏移敏感性,发现EO预训练模型更易过度自信,提出需多条件多指标评估以缩小实际部署差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13183 2026-08-14 cs.CV 新提交 82%

A Controlled Study of Self-Supervised Image and Video Pretraining under Limited Resources

有限资源下自监督图像与视频预训练的对照研究

Brunó B. Englert, Gijs Dubbelman

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract)

AI总结 该研究对照研究有限资源下的图像与视频自监督预训练,发现DINOv2式预训练性能最优,结合其与VideoMAE可提升图像任务性能但降低部分视频任务性能,为资源有限场景的视觉模型训练提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08994 2026-08-11 cs.IR cs.AI cs.CL cs.LG 新提交 82%

Guardian Crawler: Retrieval-First Knowledge Discovery with Bounded LLM Augmentation for Noisy Web Intelligence

Guardian Crawler:面向噪声网络智能的、结合受限大语言模型增强的检索优先型知识发现方法

Joshua Castillo, Santosh Nukavarapu, Ravi Mukkamala

专题命中 预训练与数据 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Guardian Crawler是面向噪声网络智能的检索优先型测试平台,结合BM25与风险感知重排序等技术,在合成语料库实验中取得较高检索分数,可用于知识发现与证据摘要生成。

Comments 8 pages, 2 figures. Accepted as a Short Paper at KDIR 2026 (International Conference on Knowledge Discovery and Information Retrieval)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07767 2026-08-11 cs.CV 新提交 82%

DINO-3DRA: Leveraging 2D Foundation Model Semantics for 3D Cerebral Aneurysm Segmentation

DINO-3DRA:利用二维基础模型语义实现三维颅内动脉瘤分割

Jiayang Lu, Fengming Lin, Alejandro F. Frangi, Ali Sarrami-Foroushani

机构 * University of Manchester(曼彻斯特大学) Christabel Pankhurst Institute, University of Manchester(曼彻斯特大学克里斯塔贝尔·潘克赫斯特研究所) NIHR Manchester Biomedical Research Centre(NIHR曼彻斯特生物医学研究中心) Manchester Academic Health Sciences Centre(曼彻斯特学术健康科学中心)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 DINO-3DRA是一种双路径框架,通过将冻结的DINOv3特征注入3D U-Net实现跨维度语义迁移,在多中心3DRA数据上以572万参数达到最优动脉瘤分割性能,且泛化能力强。

Comments Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02573 2026-08-04 astro-ph.IM 新提交 82%

Foundation Models for Astrophysics

天体物理学领域的基础模型

Xiaosheng Zhao, Yuan-Sen Ting

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本章介绍面向天文领域的基础模型,阐述其核心是可迁移表示,指出当前天文领域此类模型的可迁移性验证案例较少,未来需进一步探索提升路径。

Comments Invited chapter for the edited book "Machine Learning Techniques for Astrophysics and Cosmology" (Eds. Cosimo Bambi, Vinay Kashyap, Swarnim Shashank, Naoki Yoshida, Springer Singapore, expected in 2026). Submitted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27372 2026-07-31 cs.LG cs.AI cs.CL cs.CV 新提交 82%

Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation

探索式建模:解锁第三大预训练轴与端到端生成

Alexi Gladstone, Heng Ji, Yilun Du

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) Harvard(哈佛大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出探索式建模(XMs),为生成式模型增添第三预训练轴,可提升多域性能与效率,还能实现端到端重构生成建模,推理步骤大幅减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22204 2026-07-27 eess.SP 新提交 82%

A Foundation Model for Cross-Band CSI Reconstruction

跨频段 CSI 重建的基础模型

Hongpu Zhang, Shu Sun, Ruifeng Gao, Tongjia Zhang, Feng Yang

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 研究多频段低空无线系统中跨频段 CSI 重建问题,提出在公共频谱表示频段、用射频元数据辅助的基础模型,经特定训练,相比基线降低平均归一化均方误差,能转移到未见频段对且在导频有噪声时仍有效。

Comments 6 pages, 4 figures, accepted by 2026 IEEE/CIC International Conference on Communications in China (ICCC Workshops)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20832 2026-07-24 cs.LG cs.AI cs.CL cs.CR 新提交 82%

Beyond Heavy Log Curation: Perplexity-Based APT Detection via Unsupervised, Context-Augmented Language Models

超越繁重的日志整理:通过无监督、上下文增强语言模型进行基于困惑度的APT检测

Shoya Otsu, Kei Suzuki, Toshiaki Koike-Akino, Jing Liu, Ye Wang

机构 * Mitsubishi Electric Corporation(三菱电机公司) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对APT检测难题,提出CAPTAIN方法,利用通用预训练语言模型,经最少领域无关预处理,通过编码历史、注入上下文令牌及应用平滑滤波器,实现稳健日志评分,在基准测试中表现良好,降低了日志预处理成本。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13678 2026-07-16 eess.SP 新提交 82%

M3F-UAV: A Missing-Modality Multimodal Foundation Model for Low-Altitude Wireless Sensing

M3F-UAV:一种用于低空无线传感的缺失模态多模态基础模型

Pengxuan Gao, Kai Ying, Botao Wu, Jianhua Mo, Qingsong Wen

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 针对复杂环境下单模态模型可靠性低的问题,提出M3F-UAV模型,通过特定模态预训练特征提取器、跨模态融合及缺失模态感知预训练,从多观测中学习统一表示,在LAMBDA数据集实验中性能优于单模态基线且在缺失模态下稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07675 2026-07-09 cs.CV 新提交 82%

Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence

用于具身智能的缩放专家混合视频预训练

Shuailei Ma, Jiaqi Liao, Xinyang Wang, Jingjing Wang, Chaoran Feng, Zijing Hu, Chong Bao, Zichen Xi, Yuqi Gan, Weisen Wang, Yanhong Zeng, Qin Zhao, Zifan Shi, Wei Wu, Hao Ouyang, Qiuyu Wang, Shangzhan Zhang, Jiahao Shao, Yipengjing Sun, Liangxiao Hu, Lunke Pan, Nan Xue, Kecheng Zheng, Yinghao Xu, Xing Zhu, Yujun Shen, Ka Leong Cheng

机构 * Robbyant(蚂蚁灵波)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract)

AI总结 针对视频生成模型领域不匹配问题,提出LingBot-Video,采用MoE架构、构建数据剖析引擎、开发多维奖励系统进行视频预训练,验证了其性能和效率,贡献了首个大规模开源MoE视频基础模型。

Comments Project page: https://technology.robbyant.com/lingbot-video

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07001 2026-07-09 cs.CV 新提交 82%

Ego-Human Motion Prediction with 3D-Aware LLM

基于3D感知语言模型的自我-人类运动预测

Yujin Bae, Jaewoo Jeong, Hyeonseong Kim, Kuk-Jin Yoon

机构 * Visual Intelligence Lab., KAIST(视觉智能实验室,韩国科学技术院)

专题命中 预训练与数据 :LLM(title);instruction tuning(abstract);pretraining(abstract)

AI总结 研究从自我中心视角预测人类运动问题,提出Ego3DLM模型,基于准确运动预测需3D环境理解及姿势语言整体预测原则,通过三阶段训练,在相关任务中取得领先性能,实现跨模态和时间一致的运动预测。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05247 2026-07-07 cs.CV 新提交 82%

Vision Pretraining for Dense Spatial Perception

面向稠密空间感知的视觉预训练

Zelin Fu, Bin Tan, Changjiang Sun, Shaohui Liu, Kecheng Zheng, Yinghao Xu, Xing Zhu, Yujun Shen, Nan Xue

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract)

AI总结 针对现有视觉基础模型牺牲空间细节理解的问题,提出以边界为中心的掩码边界建模自监督预训练范式,提升稠密空间感知能力与下游任务性能。

Comments Tech report, 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02513 2026-07-03 cs.CL cs.AI cs.LG 新提交 82%

LACUNA: A Testbed for Evaluating Localization Precision for LLM Unlearning

LACUNA: 评估大语言模型遗忘定位精度的测试平台

Matteo Boglioni, Thibault Rousset, Siva Reddy, Marius Mosbach, Verna Dankers

机构 * Mila – Quebec Artificial Intelligence Institute(米拉-魁北克人工智能研究所) McGill University(麦吉尔大学)

专题命中 预训练与数据 :LLM(title);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LACUNA测试平台,通过注入合成个人身份信息到模型参数,评估遗忘方法是否真正擦除知识,发现现有方法定位不精确且易受重现攻击,而精确定位可实现强擦除。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28103 2026-06-29 cond-mat.dis-nn cond-mat.stat-mech 新提交 82%

Phase structure of the Random Language Model

随机语言模型的相结构

Alessio Giorlandino, Eric De Giuli, Sebastian Goldt

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract)

AI总结 通过双标度极限分析,揭示随机语言模型存在一系列相变,包括符号关联涌现、单符号边缘分布非均匀化以及规则使用的玻璃态冻结,并导出与大型语言模型一致的标度律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27100 2026-06-26 q-fin.MF 新提交 82%

Pretrained Time-Series Foundation Models for Financial Return Forecasting

用于金融收益预测的预训练时间序列基础模型

Miquel Noguer I Alonso, Rodolfo Pereira Franklin

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文在保守的金融设置下,基准测试预训练时间序列基础模型(TSFMs)与从头训练的神经基线,发现TSFMs在排名上占优,但相对于随机游走基准的预测提升微弱且稀疏,表明TSFMs作为实用先验可降低模型开发成本,但并非统计可靠的alpha生成引擎。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22660 2026-06-23 cs.CV 新提交 82%

Prompting Diffusion Models for Zero-Shot Instance Segmentation

提示扩散模型用于零样本实例分割

Irem Zeynep Alagöz, Nils Morbitzer, Andrea Ramazzina, Nassir Navab, Federico Tombari, Stefano Gasperini

机构 * Technical University of Munich (TUM)(慕尼黑工业大学) Munich Center of Machine Learning (MCML)(慕尼黑机器学习中心) Mercedes-Benz AG(梅赛德斯-奔驰集团) Visualais

专题命中 预训练与数据 :prompting(title);foundation model(abstract);pretraining(abstract)

AI总结 提出Prompt2Seg框架,通过空间条件化增强扩散模型,利用2D高斯或置信度图作为提示,实现零样本实例分割,在多个数据集上优于基线。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12366 2026-06-11 cs.RO 新提交 82%

APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies

APT: 动作专家预训练提升视觉-语言-动作策略的指令泛化能力

Kechun Xu, Zhenjie Zhu, Anzhe Chen, Rong Xiong, Yue Wang

机构 * Zhejiang University(浙江大学) Zhejiang Humanoid Robot Innovation Center(浙江人形机器人创新中心)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract)

AI总结 针对连续动作专家模型对分布外语言指令泛化差的问题,提出APT两阶段训练方法,先预训练动作专家作为视觉-动作先验,再通过门控融合注入语言,显著提升泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10846 2026-06-10 cs.CR cs.SE 新提交 82%

Securing Code Understanding: Detecting Natural Backdoor Vulnerability in Code Language Models

保障代码理解安全:检测代码语言模型中的自然后门漏洞

Yuchen Chen, Weisong Sun, Haocheng Huang, Yuan Xiao, Chunrong Fang, Yiran Zhang, Tingting Xu, Zhenpeng Chen, An Guo, Peizhuo Lv, Xiaofang Zhang, Zhenyu Chen, Yang Liu, Baowen Xu

专题命中 预训练与数据 :language model(title,abstract);post-training(abstract)

AI总结 本研究系统探究代码语言模型中的自然后门漏洞,通过44种场景证明其普遍性,分析其与注入后门的差异及迁移性,并提出检测方法ScanNBT。

Comments Accepted to IEEE Transactions on Software Engineering (TSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18655 2026-08-20 cs.CL 新提交 81%

TranslatePsy-AfriSLM: High-Quality Data Scaling For Low-Resource Machine Translation

TranslatePsy-AfriSLM:面向低资源机器翻译的高质量数据扩展

Milan Gritta, Patrik Lambert, Jihye Back, Amril Nazir

机构 * Tether AI Research(泰瑟人工智能研究院)

专题命中 预训练与数据 :LLM(abstract_cn);language model(abstract);small language model(abstract);SLM(abstract_cn)

AI总结 针对非洲语言机器翻译的数字鸿沟问题,推出面向19种撒哈拉以南非洲语言的开源资源TranslatePsy-AfriSLM,经质量过滤后构建的小参数模型性能远超更大规模的同类系统。

Comments EMNLP 2026 (under ARR, meta review of 4, awaiting accept decision)

详情

展开后加载摘要…

URL PDF HTML 收藏