arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-28 至 2026-08-28 共收录 30 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 30 篇

2509.07274 2026-08-28 cs.CL cs.CY cs.LG 版本更新 92%

LLM Analysis of 150+ years of German Parliamentary Debates on Migration Reveals Shift from Post-War Solidarity to Anti-Solidarity in the Last Decade

基于150余年德国议会辩论的LLM分析揭示了从战后团结到反团结的转变

Aida Kostikova, Ole Pütz, Steffen Eger, Olga Sabelfeld, Benjamin Paassen

机构 * Bielefeld University(比勒费尔德大学) University of Technology Nuremberg(纽伦堡工业大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文利用LLM分析德国议会辩论中的迁移议题,发现战后时期团结程度较高,而2015年后反团结显著上升,提出需通过验证和统计修正来提升LLM在社会科学研究中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26130 2026-08-28 cs.CL cs.IR 新提交 90%

Agents Don't Paginate: First-Chunk Selection for LLM Tool Responses

智能体不进行分页:面向大语言模型工具响应的首块选择

Tatiana Petrova, Andrei Mazniak, Radu State

机构 * SnT, University of Luxembourg(卢森堡大学SnT(卢森堡大学安全、可靠性与信任中心))

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对LLM编码智能体的工具响应首块选择问题,发现提升首块Top1准确率不会系统性提升下游准确率,无参数关键词评分器可提升p₁但不影响下游准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15236 2026-08-28 cs.CL 版本更新 89%

MAPLE: Metadata Conditioned LLM Pretraining for Locale-Aware Question Answering

具有元数据条件的大型语言模型用于本地化

Anjishnu Mukherjee, Ziwei Zhu, Antonios Anastasopoulos

机构 * Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出通过元数据条件来提升大型语言模型的本地化能力,通过预训练和实验验证了其在不同区域表现的提升效果和效率优势。

Comments Published as a conference paper at EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26580 2026-08-28 cs.CV cs.CL 新提交 88%

Visual Information-Guided Parallel Decoding for Diffusion Multimodal Large Language Models

面向扩散多模态大语言模型的视觉信息引导并行解码

Insu Lee, Wooje Park, Wonseok Shin, Jinwoo Son, Byonghyo Shim

机构 * Seoul National University(首尔大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对扩散多模态大语言模型解码时未充分利用输入图像信息的问题,提出视觉信息引导采样器 VIG-Sampler,在 7 个基准及 3 个开源模型上验证其性能优于 Info-Gain 采样器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26186 2026-08-28 cs.CL cs.AI 新提交 86%

Investigating the Influence of Prompt and Response Languages on LLM Content Generation

探究提示词与响应语言对大语言模型内容生成的影响

Thi Thanh Nhan Nguyen, Mai Khoi Tieu, Michael A. Riegler, Pål Halvorsen, Thu Nguyen

机构 * Université de Technologie de Compiègne(贡比涅技术大学) Norwegian University of Science and Technology (NTNU)(挪威科技大学) SimulaMet(西穆拉梅特研究院) HUTECH University(胡志明市技术大学)

专题命中 预训练与数据 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究以5个大语言模型为对象,在4种语言条件下评估68个非翻译问题的响应,发现提示词语言会显著影响响应长度,且对多语言提示词设计具有启示意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26319 2026-08-28 cs.CL cs.LG 新提交 84%

When Is Noise Response Universal? Tokenization as the Hidden Variable in Language Models

噪声响应何时具有普适性?语言模型中作为隐藏变量的分词

Yefan Tao, Gerald Friedland, Luyang Kong

机构 * Amazon(亚马逊)

专题命中 预训练与数据 :language model(title);LLM(abstract_cn);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现语言模型对噪声的响应一致性取决于噪声规模,核心是训练目标而非架构,追溯到分词机制,可用于预测和提升模型抗噪声能力。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04778 2026-08-28 cs.CV cs.AI cs.CL cs.MM 版本更新 84%

CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models

CounterVid: 通过生成反事实视频缓解视频-语言模型中动作和时间幻觉

Tobia Poppi, Burak Uzkent, Amanmeet Garg, Lucas Porto, Garin Kessler, Yezhou Yang, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara, Florian Schiffers

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(帕尔马大学) Amazon Prime Video(亚马逊Prime视频)

专题命中 预训练与数据 :language model(title,abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 CounterVid通过生成反事实视频缓解视频-语言模型中动作和时间幻觉问题,提出反事实视频生成框架和MixDPO方法,提升时间推理和动作识别性能。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27428 2026-08-28 cs.CL 新提交 83%

Stochastic Estimation of Transduced Language Models

转导语言模型的随机估计

Vésteinn Snæbjarnarson, Samuel Kiegeland, Manuel de Prada Corral, Ryan Cotterell, Tim Vieira

机构 * ETH Zürich(苏黎世联邦理工学院) University of Copenhagen(哥本哈根大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 该研究针对转导语言模型提出无放回重加权的递归束求和算法,实现目标前缀概率的无偏估计,在文本、DNA等任务上较基线方法有更优性能,可支撑长目标字符串的前缀概率估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26563 2026-08-28 cs.CL 新提交 83%

SPT: Skills as Pre-Training Data for Agentic Language Models

SPT:将技能作为智能体语言模型的预训练数据

Yufei Sun, Yudong Li, Yiming Cheng

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 预训练与数据 :language model(title,abstract);post-training(abstract);分类 cs.CL

AI总结 本研究提出技能预训练(SPT)方法,将公开技能包作为训练数据,结合参考感知组装策略,可提升智能体语言模型的工具使用性能,同时保留通用性能,验证了技能包作为预训练数据源的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26716 2026-08-28 cs.CV 新提交 82%

Beyond Atomic Layouts: Compositional Design Understanding with Vision-Language Models

超越原子布局:基于视觉-语言模型的组合式设计理解

Yiyang Huang, Zhaowen Wang, Simon Jenni, Jing Shi, Yitian Zhang, Yizhou Wang, Yun Fu

机构 * Northeastern University(东北大学) Adobe Research(奥多比研究院)

专题命中 预训练与数据 :language model(title,abstract);post-training(abstract)

AI总结 本文针对组合式布局理解任务,提出后训练范式MASON,利用约2万布局的CoDeLayout数据集,使Qwen2.5-VL 7B准确率达91.66%,优于基线及全数据微调。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26899 2026-08-28 cs.AI 新提交 81%

Counterfactual Bias Testing for Application Tracking System

求职申请跟踪系统的反事实偏见测试

Sai Yashwant, Shruti Bansal, Anurag Dubey, Samaroha Chatterjee, Satyam Kumar, Shreyash Gupta, Gantala Thulsiram

机构 * ManpowerGroup Services India Pvt. Ltd.(万宝盛华印度服务私人有限公司) Indian Institute of Technology, Hyderabad(印度理工学院海得拉巴分校)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出一种基于LLM智能体的自动化多指标反事实偏见审计方法,用于检测求职跟踪系统的人口统计偏见,其结果表明该方法可发现单一指标遗漏的临界公平性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26779 2026-08-28 cs.CL 新提交 81%

Instruction Quality Matters: Refining Instructions for Effective Preference Learning

指令质量至关重要:优化指令以实现有效的偏好学习

Seohyeong Lee, Hwaran Lee, Buru Chang

机构 * Sogang University(西江大学) Korea University(高丽大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 该研究发现指令质量是偏好学习的隐性瓶颈,提出基于奖励信号与评分标准引导的LLM反馈的指令优化流程,可提升偏好数据质量,增强LLM对齐效果。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27395 2026-08-28 cs.CV cs.AI 新提交 79%

LeVJEPA: Efficient & Scalable Video Pretraining without the Heuristics

LeVJEPA:无需启发式方法的高效可扩展视频预训练

Lukas Kuhn, Lucas Maes, Giuseppe Serra, Quentin Le Lidec, Yann LeCun, Randall Balestriero, Florian Buettner

机构 * German Cancer Research Center(德国癌症研究中心) German Cancer Consortium(德国癌症联盟) Goethe University Frankfurt(法兰克福大学) Mila(米拉研究所) Université de Montréal(蒙特利尔大学) Brown University(布朗大学) Courant Institute, New York University(纽约大学柯朗研究所) Advanced Machine Intelligence (AMI Labs)(高级机器智能实验室(AMI Labs))

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 LeVJEPA是首个基于LeJEPA无崩溃目标训练的视频编码器,无需启发式方法,预训练计算量大幅降低,在ImageNet-1K等基准上性能优于现有方法,可作为通用视觉预训练的更优基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26649 2026-08-28 cs.LG 新提交 79%

Robust Neural Stimulation Response Modeling Through Meta-Learning and Pretraining

基于元学习与预训练的鲁棒神经刺激响应建模

Matthew J Bryan, Daniel C Muir, Felix Schwock, Azadeh Yazdan-Shahmorad, Rajesh P N Rao

机构 * University of Washington(华盛顿大学) Paul G. Allen School of Computer Science & Engineering(保罗·G·艾伦计算机科学与工程学院) Center for Neurotechnology(神经技术中心) Computational Neuroscience Center(计算神经科学中心) Department of Electrical and Computer Engineering(电气与计算机工程系) Department of Bioengineering(生物工程系)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 该研究首次将元学习与预训练应用于神经刺激响应建模,通过改进时间基函数模型,大幅降低预测失效,减少校准需求,为闭环神经刺激的临床部署提供了可行方案。

Comments Open source code available: this http URL (http://github.com/mmattb/py-tbfm/tree/multisession). 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27370 2026-08-28 cs.CL cs.LG 新提交 79%

Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090

Puro-2B:Poor Lab基于RTX 5090训练的Qwen2-1.5B模型,训练成本低于5090美元

Kairong Luo, Jiarui Cui, Yaorui Yin, Shengqi Chen, Yiming Yang, Linxiang Gao, Yanmohan Wang, Mingzhe Zhang, Kaiyue Wen, Kaifeng Lyu, Wenguang Chen

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出开源预训练方案,在RTX 5090上低成本训练出Puro-2B模型,推导出成本缩放定律并开展数据课程影响下游性能的案例研究,完整方案已开源。

Comments 62 pages, 20 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26288 2026-08-28 cs.LG math.OC stat.ML 新提交 77%

Muon with Finite Newton-Schulz: The Smoothing Benefit in Nonsmooth Nonconvex Optimization

带有限牛顿-舒尔茨迭代的Muon:非光滑非凸优化中的平滑优势

Mingyi Li, Taira Tsuchiya

机构 * The University of Tokyo(东京大学) RIKEN(理化学研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 该研究针对大型语言模型预训练优化器Muon,证明带有限牛顿-舒尔茨迭代的Muon可通过平滑极映射提升非光滑非凸优化的收敛性,其样本复杂度达最优,且优于采用精确极因子更新的Muon。

Comments 37 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26576 2026-08-28 cs.CL 新提交 74%

Double Trouble: Bilingual Pretraining Leaves Language-Conditioned Effects in Shared-Language Representations

双重麻烦:双语预训练会在共享语言表征中留下语言条件效应

Anjishnu Mukherjee, Ziwei Zhu, Antonios Anastasopoulos

机构 * George Mason University(乔治梅森大学)

专题命中 预训练与数据 :pretraining(title);分类 cs.CL

AI总结 该研究发现仅解码器多语言模型中,双语预训练会使共享语言的深层隐藏状态表征存在差异,嵌入对齐无法掩盖该差异,这对依赖对齐模型的下游研究有重要影响。

Comments Published as a conference paper at EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26194 2026-08-28 cs.CL cs.AI cs.IR 新提交 73%

A Reranker for Orchestrating Heterogeneous Speech and Text Retrievers

用于协调异构语音和文本检索器的重排序器

Inho Kim, Sumyeong Ahn

机构 * Korea Institute of Energy Technology(韩国能源技术研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态RAG数据库场景,提出STeReO重排序器,构建专用数据集训练后,可有效聚合异构检索结果,显著提升下游问答性能。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26163 2026-08-28 cs.CL cs.AI cs.HC cs.MA cs.SD 新提交 73%

From Sound to Symptom: Real-Time Respiratory Signal Understanding for Conversational Healthcare Agents

从声音到症状:面向对话式医疗智能体的实时呼吸信号理解

Tanmay Laud, Herprit Mahal, Subhabrata Mukherjee

机构 * Hippocratic AI(希波克拉底人工智能公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出面向对话式医疗智能体的HealthCUES系统,可实时检测分析咳嗽等呼吸信号,经内部与外部数据集评估及医疗人员验证,性能优异且具临床实用性。

Comments Accepted for publication at SIGDIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23838 2026-08-28 cs.CR cs.AI cs.CL cs.LG 版本更新 67%

TriShieldRAG: 3 Rings, One Blind Spot in Layered Defenses for Retrieval-Augmented Generation

TriShieldRAG:一种针对检索增强生成中知识腐败的三环深度防御框架

Susil Kumar Mohanty, Rohit Patel, Kosuru Yuvaraj, Jeenal Chaudhary, Disha Singhania

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对检索增强生成中知识腐败问题,构建TriShieldRAG框架,设置摄取防护、检索评分器和跨语言模型共识阶段三个环,推导环2和环3起作用的条件,评估表明该框架能大幅降低攻击成功率并保持良性查询准确性。

Comments v2: Adds an adaptive-attacker evaluation in which Ring 1 is fully evaded (500/500 documents, three corpora); scales to the full NQ, HotpotQA and MS-MARCO corpora; corrects Proposition 1, whose boundary is corpus-dependent (0.214/0.251/0.558) not 0.5; retracts a proposed closed form after a pre-registered prediction failed. The v1 headline 91%-to-13% result is withdrawn

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26923 2026-08-28 cs.CL 新提交 57%

TabuLM: Morphology-Aware Tabular Pre-training for Low-Resource Languages

TabuLM:面向低资源语言的形态感知表格预训练模型

Ireddi Rakshitha, Devavarapu Yashwanth, Ntakirutimana Pierre

机构 * Barclays(巴克莱银行) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 研究针对低资源语言卢旺达语,提出形态感知表格预训练模型TabuLM,在自研的卢旺达语表格问答基准TabQA-kin上,其精确匹配率显著优于基线模型。

Comments 18 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26812 2026-08-28 cs.CV cs.LG 新提交 57%

Hyperspectral Diffusion Equivariant Imaging (HyDiff-EI): A Self-supervised Framework for Hyperspectral Image Inpainting

高光谱扩散等变成像(HyDiff-EI):一种用于高光谱图像修复的自监督框架

Shuo Li, Mike Davies, Mehrdad Yaghoobi

机构 * University of Edinburgh(爱丁堡大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 提出HyDiff-EI自监督框架,将扩散建模与等变先验结合,针对高光谱图像修复,在Chikusei等真实数据集上表现优于现有算法,适配标注数据有限的遥感场景。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26344 2026-08-28 cs.CL 新提交 57%

MoganColBERT-TR: A Late-Interaction Multi-Vector Retrieval Model for Turkish

MoganColBERT-TR:面向土耳其语的晚交互多向量检索模型

Furkan Yilmaz, Habibe Aleyna Tasdemir, Muhammed Faruk Gozay

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL

AI总结 本研究提出面向土耳其语的晚交互多向量检索模型MoganColBERT-TR,以MoganBERT-TR编码器为起点经单轮蒸馏训练,在5个土耳其语BEIR零样本数据集上取得良好性能,位列对比模型第二。

Comments 12 pages, 6 tables. Model weights: this https URL (https://huggingface.co/moganai)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29353 2026-08-28 cs.AI 版本更新 57%

Nomad: Autonomous Exploration and Discovery

Nomad:自主探索与发现

Bokang Jia, Samta Kamboj, Satheesh Katipomu, Seung Hun Han, Neha Sengupta, Andrew Jackson

机构 * Inception, G42(G42 的 Inception) G42 MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 预训练与数据 :LLM(abstract);分类 cs.AI

AI总结 Nomad通过探索优先架构,构建领域探索地图,系统遍历以平衡广度与深度,生成并验证假设,最终生成可信报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27181 2026-08-28 cs.CV 新提交 50%

SSMB: Self-Supervised Local Feature Detection under Motion Blur

SSMB:运动模糊下的自监督局部特征检测

Zhenjun Zhao, Fabio Bellavia, Wenting Wang, Fan Zhu, Jiajun Wu, Suryansh Kumar, Mingqiang Wei, Haoang Li, Javier Civera

机构 * University of Zaragoza(萨拉戈萨大学) University of Palermo(巴勒莫大学) The Chinese University of Hong Kong(香港中文大学) Tohoku University(东北大学) Central South University(中南大学) Texas A&M University(德克萨斯农工大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对运动模糊下关键点检测的挑战,提出无去模糊的自监督关键点检测器SSMB,通过LDE模块及两阶段训练实现,在多项任务上优于现有基线,达到稀疏关键点检测的新最优性能。

Comments 20 pages, 11 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27172 2026-08-28 cs.CR 新提交 50%

X-WAD: eXplainable Web Anomaly Detection

X-WAD:可解释的Web异常检测

Matteo Bitussi, Roberto Doriguzzi-Corin

专题命中 预训练与数据 :language model(abstract)

AI总结 本文提出X-WAD方法,采用基于Transformer的语言模型,通过token级logit的惊讶度映射为HTTP请求异常检测提供可解释性,还发现公开数据集的标签不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27033 2026-08-28 cs.RO 新提交 50%

Riemann-1.0: An Embodied World Action Model for Physical AI

Riemann-1.0:面向物理人工智能的具身世界动作模型

Haofeng Sun, Jiangbo Pei, Fei Kang, Zexiang Liu, Yaokun Li, Boyi Jiang, Hua Xue, Cindy Zhou, Wei Li, Yichen Wei, Mengyin An, Fanliang Zhao, Biao Jiang, Zile Wang, Yang Liu, Yangguang Li

机构 * Riemann Dynamics(黎曼动力公司)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本研究提出Riemann-1.0具身世界动作模型,通过统一建模与渐进式具身预训练,在多个模拟及真实机器人操作基准任务中取得最优性能,实现大规模具身经验向可泛化机器人操作能力的转化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26673 2026-08-28 cs.RO 新提交 50%

PredVLA: A Sub-Million-Parameter Predictive-Coding Policy for Robot Manipulation

PredVLA:用于机器人操作的亚百万级参数预测编码策略

Hiroki Sawada, Shunichi Kasahara

机构 * Sony Computer Science Laboratory(索尼计算机科学实验室)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 PredVLA是仅0.68M参数的无机器人数据预训练预测编码策略,在LIBERO基准上远超参数匹配的Transformer、LSTM策略,实现强语言条件机器人操作性能且具备显式在线修正机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07775 2026-08-28 cs.CV 版本更新 50%

DALE-CT: Depth-Aware 2D Slice Encoders Learn an Anatomical World Model of Chest CT

DALE-CT: 用于计算机断层扫描的深度感知基础模型

Evan W. Damron, Mahmut S. Gokmen, Mitchell A. Klusty, Caroline N. Leach, Emily B. Collier, V. K. Cody Bumgardner

机构 * University of Kentucky(肯塔基大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出DALE-CT,一种基于LeJEPA的2D切片模型,通过3D深度感知预训练(利用解剖掩膜和异常标注)提升表示质量,在CT多异常检测中达到与3D视觉语言模型近似的性能。

Comments 18 pages, 5 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10445 2026-08-28 cs.CV 版本更新 50%

DOD-SA: Infrared-Visible Decoupled Object Detection with Single-Modality Annotations

DOD-SA:采用单模态标注的红外-可见光解耦目标检测

Hang Jin, Chenqiang Gao, Junjie Guo, Fangcen Liu, Qinyao Chang, Kanghui Tian, Deyu Meng

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对红外-可见光目标检测需双模态标注成本高的问题,提出采用单模态标注的DOD-SA框架,通过CoSD-TSNet、PaST策略及PLA解决模态错位,实现高效解耦检测。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏