arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12403 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12403 篇

2602.00462 2026-07-23 cs.CV cs.AI 版本更新 81%

LatentLens: Revealing Highly Interpretable Visual Tokens in LLMs

LatentLens: 揭示大语言模型中高度可解释的视觉标记

Benno Krojer, Shravan Nayak, Oscar Mañas, Vaibhav Adlakha, Desmond Elliott, Siva Reddy, Marius Mosbach

机构 * University of Cambridge(剑桥大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出 LatentLens 方法,通过将视觉标记与文本语料库中的上下文标记表示进行最近邻匹配,实现视觉标记的可解释性,发现大多数视觉标记在各层均具有可解释性。

Comments ICML 2026 (Camera Ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19104 2026-07-22 cs.SE cs.AI 新提交 81%

SciCodePile: A 128GB Corpus and Executable Benchmark for Challenging Scientific Code Generation

SciCodePile:用于具有挑战性的科学代码生成的128GB语料库和可执行基准测试

Weifeng Sun, Ye Fan, Yuchen Chen, Gou Tan, Jieke Shi, Yuan Yidi, Swee Liang Wong, Jonathan Pan, David Lo

机构 * Singapore Management University(新加坡管理大学) Nanjing University(南京大学) SUN YAT-SEN University(孙中山大学) Home Team Science & Technology Agency(家庭团队科技局)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract);pretraining(abstract)

AI总结 研究大型语言模型处理科学代码的能力,提出SciCodePile语料库及可执行基准测试,评估15个模型在三项任务上的表现,发现科学代码生成极具挑战,同时展示了该语料库在训练上的效用,代码和数据可获取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18424 2026-07-22 cs.CY cs.CL 新提交 81%

Enabling Multilingual Privacy Policy Audits: Large-Scale Analysis of Spanish Mobile Apps

实现多语言隐私政策审计:对西班牙移动应用的大规模分析

Marcos Moran, David Rodriguez, Luka Nenadic, Norman Sadeh, Jose M. Del Alamo

机构 * ETH Zurich(苏黎世联邦理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究多语言环境下隐私政策审计,利用大语言模型构建跨语言分类器,通过对西班牙谷歌应用商店应用的大规模审计,发现公共部门与商业应用语言使用差异及声明与实际做法的差异,揭示仅英语审计掩盖透明度差距的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19198 2026-07-22 cond-mat.mtrl-sci cs.LG physics.comp-ph 新提交 81%

ATLAS: A Foundation Neural Sampler for Amorphous Materials

ATLAS:一种用于非晶材料的基础神经采样器

Mouyang Cheng, Denis Blessing, Botao Yu, Gerhard Neumann, Mingda Li, Carles Domingo-Enrich, Yuanqi Du

机构 * Microsoft Research New England(微软研究院新英格兰分部) Center for Computational Science and Engineering(计算科学与工程中心) MIT(麻省理工学院) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Department of Materials Science and Engineering(材料科学与工程系) Department of Computer Science and Engineering(计算机科学与工程系) OSU(俄亥俄州立大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)

AI总结 研究针对非晶材料能量景观难采样问题,提出ATLAS神经采样器,由等变图神经网络参数化,能跨系统泛化,利用扩散过程时间反转估计热力学量。在多种系统中验证有效性,还通过预训练降低逆设计成本,结合大语言模型搜索高熵金属玻璃,确立其为基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11783 2026-07-14 cs.CL 新提交 81%

How Temperature Shapes Ideological Discourse in Retrieval-Augmented Generation?

温度如何塑造检索增强生成中的意识形态话语?

Elmira Salari, Hazem Amamou, José Victor de Souza, Shruti Kshirsagar, Maria Nunes Delfino, Anderson Avila

机构 * Wichita State University(威斯康星州立大学) São Paulo Catholic University(圣保罗天主教大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨温度对检索增强生成中意识形态话语的影响,通过对新冠治疗文章语料库应用词汇多维分析,让模型在不同温度下回答意识形态问题并评估,发现RAG框架易转移意识形态话语,中等温度下话语对齐最高,低温时下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05235 2026-07-14 cs.CL 版本更新 81%

FedMosaic: Federated Retrieval-Augmented Generation via Parametric Adapters

FedMosaic:通过参数适配器进行联邦检索增强生成

Zhilin Liang, Yuxiang Wang, Zimu Zhou, Hainan Zhang, Boyi Liu, Yongxin Tong

机构 * SKLCCSE Lab Beihang University Beijing China(SKLCCSE实验室 北航) Department of Data Science City University of Hong Kong Hong Kong China(数据科学系 香港城市大学) Beijing Advanced Innovation Center Beihang University Beijing China(北京先进创新中心 北航) Beihang University(北航) City University of Hong Kong(香港城市大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对隐私敏感领域,解决联邦检索增强生成中高存储通信及适配器聚合问题。核心方法是提出FedMosaic框架,聚类文档成多文档适配器并选择性聚合。主要贡献是准确率提高,存储和通信成本降低,且不共享原始文档。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03978 2026-07-07 cs.HC cs.AI cs.CV 新提交 81%

Scalable Semantic Steering of Embedding Projections

嵌入投影的可扩展语义引导

Wei Liu, Eric Krokos, Kirsten Whitley, Rebecca Faust, Chris North

机构 * Virginia Tech(弗吉尼亚理工学院) Department of Defense(国防部) Tulane University(路易斯安那州立大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究高维数据嵌入的低维投影语义结构问题,提出可扩展语义引导方法,将语义计算从单个项目转移到用户定义组,通过单LLM调用为组生成结构化配置文件,减少LLM调用并在多模态嵌入中有效应用。

Comments Accepted as a short paper at IEEE VIS 2026. 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00016 2026-07-02 cs.IR cs.AI 新提交 81%

Libra: Training the Environment for Agentic Information Retrieval

Libra: 为智能信息检索训练环境

Xuan Zhao, Andy Chiu, Gengyu Wang

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出Libra框架,通过引入可变目录和LLM驱动优化循环,自动改进代码仓库的索引结构,提升代码定位准确率,并实现跨模型和问题的零样本迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00890 2026-07-02 cs.CL 新提交 81%

MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages

MultiSynt/MT:跨36种语言翻译的万亿Token多平行预训练数据

Maximilian Idahl, Jörg Tiedemann, Sampo Pyysalo, David Salinas, Tomasz Galica, Shenbin Qian, Tudor Nicolae Mateiu, Zihao Li, Anna Lokrantz, Fedor Vitiugin, André F. T. Martins, Jenna Kanerva, Filip Ginter, Matthias Lindemann, Tim Isbister, Birger Moell, Jonas Lindh, Jan Hajič, Jenia Jitsev, Andrey Kutuzov, Stephan Oepen, Gema Ramírez-Sánchez

机构 * ellamind Leibniz University Hannover(莱布尼茨汉诺威大学) University of Helsinki(赫尔辛基大学) University of Turku(图尔库大学) ELLIS Institute Tübingen(ELLIS 图宾根研究所) Prior Labs University of Oslo(奥斯陆大学) Prompsit Language Engineering(Prompsit 语言工程公司) AI Sweden Instituto de Telecomunicações(电信研究所) Instituto Superior Técnico(高等技术学院) TransPerfect Charles University(查理大学) Ontocord LAION Juelich Supercomputing Center (JSC), Research Center Juelich (FZJ)(于利希超级计算中心 (JSC), 于利希研究中心 (FZJ))

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出MultiSynt/MT,一个覆盖36种欧洲语言、约4.8万亿token的合成平行语料库,通过翻译1000亿高质量token生成,使参考LLM在减少72%预训练token下达到原生数据基线性能,并发现标准基准测试的评估盲点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30175 2026-06-30 cs.CL 81%

CORTEX: High-Quality Cross-Domain Organization of Web-Scale Corpora through Ontological Corpus Graph

CORTEX:通过本体语料图实现网络规模语料库的高质量跨领域组织

Chengtao Gan, Xiaoke Guo, Yushan Zhu, Zhaoyan Gong, Zhiqiang Liu, Songze Li, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学) JIUTIAN Research(JIUTIAN研究院)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出CORTEX框架,利用本体语料图(OCG)将网络规模语料构建从扁平文档筛选提升为结构化知识组织,实现质量精炼、层次化本体和跨领域对齐,并构建CortexBench基准验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28438 2026-06-30 cs.SE cs.AI 81%

When AI Reviews Its Own Code: Recursive Self-Training Collapse in Code LLMs

当AI审查自己的代码:代码大语言模型中的递归自训练崩溃

Xinyuan Song, Zekun Cai, Liang Zhao

机构 * Emory University(埃默里大学) The University of Tokyo(东京大学) LocationMind

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究代码LLM在递归自训练中因缺乏外部质量控制而崩溃的风险,对比无审查、人工门控和AI自门控三种机制,发现AI自门控会退化为无门控自训练,需外源验证。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04693 2026-06-30 cs.CL 81%

Thunder-KoNUBench: A Corpus-Aligned Benchmark for Korean Negation Understanding

Thunder-KoNUBench: 一个与语料库对齐的韩语否定理解基准

Sungmok Jung, Yeonkyoung So, Joonhak Lee, Sangho Kim, Yelim Ahn, Jaejin Lee

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出Thunder-KoNUBench,通过分析韩语否定现象,评估47个LLM在否定理解上的表现,揭示模型大小和指令微调的影响,并展示微调提升韩语否定理解和上下文理解的效果。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26062 2026-06-25 cs.CL 新提交 81%

When Certainty Is an Artifact: Keyword Lexicon Blindness and the (Mis)Measurement of Rhetorical Stance

当确定性是人为产物:关键词词典盲点与修辞立场的(误)测量

Bo Chen

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 通过对比关键词词典与LLM零样本分类在85篇访谈(2016-2026)中的表现,发现关键词计数产生的显著负情绪-确定性共现模式是测量伪影,而LLM揭示出悲观话语实际吸引的是模糊化而非确定性。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25721 2026-06-25 cs.CR cs.CL cs.IR 新提交 81%

Tracing Target Answers in Poisoned Retrieval Corpora via Token Influence Attribution

通过令牌影响归因追踪中毒检索语料库中的目标答案

Yan-Lun Chen, Pin-Yu Chen, Chia-Mu Yu, Ying-Dar Lin, Yu-Sung Wu, Wei-Bin Lee

机构 * National Yang Ming Chiao Tung University(阳明交通大学) IBM Research(IBM研究院) Hon Hai Research Institute(宏海研究院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出TRACE框架,通过令牌影响归因识别检索增强生成系统中的语料投毒攻击,无需额外分类器或LLM验证,在三个QA基准和六个LLM上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24897 2026-06-25 cs.DL cs.CL cs.IR 新提交 81%

Invisible to humans, visible to machines: a preregistered audit of Unicode fidelity across four biomedical bibliographic APIs

对人类不可见,对机器可见:四个生物医学文献API的Unicode保真度预注册审计

Przemysław Czuma

机构 * Przemysław Czuma(普拉姆斯拉夫·茨马)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过预注册审计,评估四个生物医学API(PubMed、Crossref、OpenAlex、Semantic Scholar)返回摘要的Unicode保真度,发现PubMed和OpenAlex存在系统性字符丢失,影响文献计量和语料构建。

Comments 14 pages, 1 figure. Pre-registered on OSF. Data and code available on Zenodo and GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14167 2026-06-24 cs.CL 81%

Synthetic Clarification and Correction Dialogues about Data-Centric Tasks -- A Teacher-Student Approach

数据导向任务的合成澄清与纠正对话——一种教师-学生方法

Christian Poelitz, Nick McKenna

机构 * Microsoft Research(微软研究院) Cambridge UK(剑桥英国)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出一种教师-学生框架,用于合成多轮对话以解决基于表格的问题回答任务,通过强教师模型验证生成对话质量,验证了其在前沿LLM基准中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23395 2026-06-23 cs.SE cs.AI 新提交 81%

Automated Semantic Fault Localization in SysML v2: A Human-in-the-Loop Framework Using Knowledge-Graph Augmented LLMs

SysML v2中的自动化语义故障定位:一种使用知识图谱增强大语言模型的人机协同框架

Haitham Al-Shami, Rohail Malik, Riku Ala-Laurinaho, Jari Vepsäläinen, Raine Viitala

机构 * Aalto University(艾洛大学)

专题命中 预训练与数据 :SLM(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.AI

AI总结 提出一种人机协同框架,结合微调小语言模型与领域知识图谱,自动识别并修复SysML v2模型中保持语法有效但违反领域规则的语义错误,在车辆系统领域验证中故障修复率从低于3%提升至91%以上。

Comments 12 pages, 4 figures. Presented at INCOSE International Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18389 2026-06-18 cs.CL 新提交 81%

Want Better Synthetic Data? Steer It: Activation Steering for Low-Resource Language Generation

想要更好的合成数据?引导它:面向低资源语言生成的激活引导

Jan Cegin, Daniil Gurgurov, Yusser Al Ghussin, Simon Ostermann

机构 * Kempelen Institute of Intelligent Technologies(肯佩伦智能技术研究所) German Research Institute for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出激活引导作为低资源语言合成数据生成的替代方法,包括语言引导和质量引导,实验表明早期层引导能提升数据多样性和下游模型性能。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15984 2026-06-16 cs.CL 新提交 81%

ROMPAR: Morphological Completion and Demographic Unlearning for Romanian-Accented Speech Recognition

ROMPAR:罗马尼亚口音语音识别的形态补全与人口统计去偏

Andrei-Marius Avram, Aureliu-Valentin Antonie, Ştefan-Bogdan Badea, Andrei Florea, Robert-Nicolae Zaharoiu, Dumitru-Clementin Cercel

机构 * National University of Science and Technology POLITEHNICA Bucharest(布加勒斯特理工大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出ROMPAR语料库和多任务对抗训练框架,通过指数衰减机制和LLM引导解码,实现人口统计不变性和形态补全,WER显著降低,形态重建F1达96.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00074 2026-06-16 q-bio.GN cs.AI 版本更新 81%

CRC-Screen: Certified DNA-Synthesis Hazard Screening Under Taxonomic Shift

CRC-Screen:分类偏移下认证的DNA合成危害筛查

Najmul Hasan

机构 * Najmul Hasan(纳杰姆·哈桑)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对DNA合成订单中危害序列因分类偏移导致基线筛查100%误报的问题,提出基于k-mer Jaccard相似度、五LLM评委修剪均值和嵌入聚类质心余弦相似度的融合信号,经单调逻辑聚合器和共形风险控制校准,在保证假阴性率受控的同时实现零漏检和低误报。

Comments Accepted at the 6th Muslims in ML (MusIML) Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22777 2026-06-16 cs.CL 版本更新 81%

RASST: Retrieval-Augmented Simultaneous Speech Translation

RASST:检索增强的同声传译

Jiaxuan Luo, Siqi Ouyang, Jiaxing Xu, Lei Li

机构 * Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对同声传译中罕见术语翻译不准的问题,提出检索增强方法RASST,通过轻量级语音-文本检索器提供分块术语提示,并合成训练数据教会模型何时应用检索术语,在ACL 60/60和ESO测试集上术语准确率提升近40%,BLEU提升最多3点。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13808 2026-06-15 cs.CL 新提交 81%

The Culture Funnel: You Can't Align What isn't in the Data

文化漏斗:你无法对齐不在数据中的内容

Ananya Sahu, Mehrnaz Mofakhami, Daniel D'Souza, Thomas Euyang, Julia Kreutzer, Marzieh Fadaee

机构 * Cohere Labs(Cohere实验室)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);pretraining(abstract);post-training(abstract);分类 cs.CL

AI总结 针对当前文化对齐方法依赖推理时干预而忽视训练数据的问题,提出文化数据漏斗概念,通过多维标签框架分析预训练、微调、对齐和推理数据集,发现后训练阶段文化信号急剧下降,多语言性虽增强地理多样性但未能确保平衡,所提标签可提升下游文化基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13668 2026-06-12 cs.CL 新提交 81%

Influcoder: Distilling Decoders' Gradient Influence Rankings into an Encoder for Data Attribution

Influcoder:将解码器的梯度影响排名蒸馏到编码器用于数据归因

Dimitri Kachler, Damien Sileo, Pascal Denis

机构 * Centre Inria de l’Université de Lille, CRIStAL, Université de Lille(里尔大学Inria中心,CRIStAL,里尔大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对大型语言模型训练数据归因中影响函数方法计算和存储成本高的问题,提出Influcoder方法,通过将解码器梯度影响排名蒸馏到编码器,实现快速且成本高效的大规模数据归因。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08715 2026-06-09 cs.CL 新提交 81%

Operationalizing Linguistic Methods through Prompt-Engineering Skills: An Automatic Chinese Web Neologism Detection Pipeline

通过提示工程技能操作化语言学方法:一种自动中文网络新词检测流水线

Yufeng Wu, Meichun Liu

机构 * City University of Hong Kong(香港城市大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出一种自动中文网络新词检测方法,将传统语言学识别原则转化为提示工程技能,通过四阶段流水线从2.67亿文档中检测出4853个新词,并揭示候选覆盖和LLM语义判断为瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02424 2026-06-09 cond-mat.mtrl-sci cs.AI 版本更新 81%

A large-scale nanocrystal database with aligned synthesis and properties enabling generative inverse design

大规模纳米晶体数据库:对齐合成与性质实现生成式逆向设计

Kai Gu, Yingping Liang, Senliang Peng, Aotian Guo, Haizheng Zhong, Ying Fu

机构 * MIIT Key Laboratory for Low-Dimensional Quantum Structure and Devices, School of Materials Sciences & Engineering, Beijing Institute of Technology(信息产业部低维量子结构与器件重点实验室,材料科学与工程学院,北京理工大学) School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 构建大规模对齐的纳米晶体合成-性质数据库,开发基于大语言模型的NanoExtractor提取文献数据,并利用NanoDesigner实现生成式逆向设计,成功设计PbSe和MgF2纳米晶体的合成路线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04362 2026-06-04 cs.IR cs.CL 81%

Disentangling Answer Engine Optimization from Platform Growth: A Log-Based Natural Experiment on ChatGPT Referral Traffic

解耦答案引擎优化与平台增长:基于日志的ChatGPT推荐流量自然实验

Keisuke Watanabe, Kazuki Nakayashiki

机构 * Glasp Inc.(Glasp公司)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过自然实验方法,利用同一域内未处理页面作为对照,分离了答案引擎优化(AEO)对推荐流量的因果效应与平台自身增长带来的混淆效应。

Comments 9 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22121 2026-06-04 cs.CV cs.AI 81%

GenSpan: Generation-Calibrated Motion Span Priors for Multi-Verb Video Corpus Moment Retrieval

GenSpan: 用于多动词视频语料库时刻检索的生成校准运动跨度先验

Yunzhuo Sun, Xinyue Liu, Yanyang Li, Nanding Wu, Linlin Zong, Xianchao Zhang, Wenxin Liang

机构 * Dalian University of Technology(大连理工大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出GenSpan框架,利用LLM生成辅助视频作为时间先验,结合令牌选择器和双向状态空间模型,提升多动词查询下的视频语料库时刻检索与定位性能。

Comments Major revision with title change, updated method, and additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31136 2026-06-01 cs.CL 81%

Multilingual and Cross-Lingual Citation Needed Detection on Wikipedia for Lower-Resource Languages

低资源语言维基百科的多语言和跨语言引用需求检测

Gerrit Quaremba, Amy Rechkemmer, Elizabeth Black, Denny Vrandečić, Elena Simperl

机构 * King’s College London(伦敦国王学院) Wikimedia Foundation(维基媒体基金会)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);SLM(abstract_cn)

AI总结 针对低资源语言,提出多语言引用需求检测语料库MCN,并证明使用编码器风格目标微调的小型解码器语言模型在跨语言任务中优于大型语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30582 2026-06-01 cs.CL 81%

AI for Monitoring and Classifying Data Used in Research Literature

AI用于监控和分类研究文献中使用的数据

Rafael Macalaba, Aivin V. Solatorio

机构 * World Bank(世界银行) Office of the World Bank Group(世界银行集团办公室) Development Data Group(发展数据组)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出基于GLiNER的多任务框架,结合合成数据生成和LLM重验证,实现研究文献中数据集提及的提取、关系识别和使用上下文分类,以解决数据集使用监控中的标注稀缺和引用不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29955 2026-05-29 cs.AI 81%

Formalizing Mathematics at Scale

大规模形式化数学

Ahmad Rammal, Niket Patel, Fabian Gloeckle, Amaury Hayat, Julia Kempe, Remi Munos, Charles Arnal, Vivien Cabannes

机构 * FAIR at Meta(Meta的FAIR) New York University(纽约大学) Korea Institute for Advanced Study(韩国高级研究院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出多智能体系统AutoformBot,利用LLM和形式化验证工具,自动将非正式教材翻译为Lean 4可验证代码,构建了包含超过45,000个声明和50万行代码的Atlas形式化库。

详情

展开后加载摘要…

URL PDF HTML 收藏