arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-09-01 至 2026-09-01 共收录 968 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 68 篇

2608.26576 2026-09-01 cs.CL 版本更新 83%

Double Trouble: Bilingual Pretraining Leaves Language-Conditioned Effects in Shared-Language Representations

双重麻烦:双语预训练会在共享语言表征中留下语言条件效应

Anjishnu Mukherjee, Ziwei Zhu, Antonios Anastasopoulos

机构 * George Mason University(乔治梅森大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL

AI总结 该研究发现仅解码器多语言模型中,双语预训练会使共享语言的深层隐藏状态表征存在差异,嵌入对齐无法掩盖该差异,这对依赖对齐模型的下游研究有重要影响。

Comments Published as a conference paper at EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06892 2026-09-01 cs.LG 版本更新 83%

GRASP: Geometry-aware Residual Alignment for Scalable Pretraining Data Attribution

GRASP:面向可扩展预训练数据归因的几何感知残差对齐

Yue Min, Ruining Chen, Yujun Li

机构 * Wizard Quant University of Science and Technology of China(中国科学技术大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.LG

AI总结 提出GRASP方法,通过二次几何惩罚建模子集交互,结合低维特征草图与有限置信度选择协议,实现可扩展的预训练数据归因,显著提升反事实子集保真度并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07571 2026-09-01 cs.CL cs.MM 版本更新 83%

A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification

一种通过语音标记增强预训练语言模型用于分类的简单方法

Nicolas Calbucura, Jose Guillen, Valentin Barriere

机构 * Universidad de Chile, DCC(智利大学计算机科学系) Universidad Tecnica Santa Maria(圣玛利亚理工大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出一种简单方法,通过语音信息增强预训练语言模型以提高分类任务性能,采用多模态词袋表示和自监督语言建模目标,实验证明在论证谬误检测和情感计算任务中效果显著。

Comments Findings of ACL, EMNLP26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29644 2026-09-01 cs.CV cs.AI cs.CL 新提交 82%

Conducting Stylistic Analysis of Paintings through an Art-History Agent

通过艺术史智能体开展绘画的风格分析

Marc S. Walton, Astrid Harth

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出一种结合视觉Transformer与大型语言模型的艺术史智能体框架,可自动化绘画风格分析,弥合AI概率分类与艺术史风格分析间的方法学鸿沟,推动计算艺术史发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22343 2026-09-01 stat.ML cs.CL cs.LG stat.ME 版本更新 82%

Optimal Estimation of Watermark Proportions in Hybrid AI-Human Texts

混合AI-人类文本中水印比例的最优估计

Xiang Li, Garrett Wen, Weiqing He, Jiayuan Wu, Qi Long, Weijie J. Su

机构 * University of Pennsylvania(宾夕法尼亚大学) Yale University(耶鲁大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文针对混合AI-人类文本的水印比例估计问题,基于核心统计量构建混合模型,提出高效估计量,证明其达到极小极大下界,在合成数据与开源模型生成的混合文本上均实现高估计精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29395 2026-09-01 cs.CV 新提交 82%

GATE: Reliability-Gated Gaussian Evidence Fusion for Training-Free Test-Time Adaptation of Vision-Language Models

GATE:用于视觉语言模型无训练测试时自适应的可靠性门控高斯证据融合

Pedram MohajerAnsari, Amir Salarpour, Run Wang, Mert D. Pesé

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract)

AI总结 本研究提出无训练的两阶段直推式TTA框架GATE,通过可靠性门控融合文本与图像高斯证据,在多数据集及模型上显著提升视觉语言模型的零样本测试时自适应性能。

Comments Accepted to the British Machine Vision Conference (BMVC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28980 2026-09-01 cs.CL cs.AI cs.LG 新提交 82%

The Illusion of Replacement: Rethinking Specialized Machine Learning Models in the Foundation Model Era

替代的错觉:在基础模型时代重新审视专用机器学习模型

Kiyan Rezaee

专题命中 预训练与数据 :foundation model(title);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过分析159篇跨9种模态的论文,发现基础模型时代专用机器学习模型未被替代,语言模型需补充结构组件,其与结构感知架构的性能差距能否消除仍待验证。

Comments 41 pages, 7 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30147 2026-09-01 cs.CL 新提交 81%

CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents

CAST:用于训练可靠长程工具调用智能体的批判感知监督

Amir Saeidi, Zehua Zhang, Rishitosh Singh, Naman Ahuja, Vivek Gupta, Ali Payani, Gaowen Liu, Jayanth Srinivasa, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学) Cisco Research(思科研究院)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出批判感知训练框架CAST,通过分析智能体轨迹生成结构化批判,优化Qwen3模型,在零售、远程医疗等动态工具调用任务上提升可靠性,性能优于GPT-OSS-120B。

Comments Accepted to EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30291 2026-09-01 cs.IR 新提交 80%

PEARL: Front-Loading Relational Chains for Multi-Hop Table Retrieval

PEARL:面向多跳表格检索的前置化关系链

Subeen Ho, Hyeongu Kang, SeongKu Kang, Susik Yoon

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 PEARL是无需训练的多表格检索框架,通过前置化关系链实现垂直划分的子表格编码,在3跳查询的R@2指标上最高提升30.05%,性能优于现有方法。

Comments Accept to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08698 2026-09-01 cs.LG q-bio.GN 版本更新 79%

EvoLen: Evolution-Guided Tokenization for DNA Language Model

EvoLen:基于进化的标记化方法用于DNA语言模型

Nan Huang, Xiaoxiao Zhou, Junxia Cui, Mario Tapia-Pacheco, Tiffany Amariuta, Yang Li, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 EvoLen通过整合进化信息优化DNA标记化,优先保留功能序列模式,提升基因组上下文区分和进化约束对齐,优于标准BPE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07120 2026-09-01 cs.CL 版本更新 79%

Anchored Decoding: Provably Reducing Copyright Risk for Any Language Model

锚定解码:可证明降低任何语言模型的版权风险

Jacqueline He, Jonathan Hayase, Wen-tau Yih, Sewoong Oh, Luke Zettlemoyer, Pang Wei Koh

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 提出锚定解码,一种即插即用的推理时方法,通过将生成内容约束在许可训练的安全模型附近,可证明地抑制语言模型逐字复制受版权保护的内容,实现可调的风险-效用权衡。

Comments Accepted to ICML 2026. 53 pages, 14 figures, 22 tables. Code is publicly available at https://github.com/jacqueline-he/anchored-decoding

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28308 2026-09-01 cs.LG cs.AI 版本更新 79%

Deriving Scaling Laws for OpenEuroLLM Models: Learning Rate, Batch Size and Loss

推导OpenEuroLLM模型的缩放定律:学习率、批量大小与损失

Niccolò Ajroldi, Diana Alexandra Onutu, Haider Al-Tahan, Jörg Franke, Sampo Pyysalo, Jenia Jitsev, Aaron Klein

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对OpenEuroLLM模型,探究预训练时学习率与批量大小的缩放规律,开发相关模型并评估损失的缩放形式,建立基线与缩放程序并开源预训练运行集合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06022 2026-09-01 cs.CL cs.AI 版本更新 79%

AdaFuse: Adaptive Ensemble Decoding with Test-Time Scaling for LLMs

AdaFuse: 用于大语言模型的自适应集成解码与测试时缩放

Chengming Cui, Tianxin Wei, Ziyi Chen, Ruizhong Qiu, Zhichen Zeng, Zhining Liu, Xuying Ning, Duo Zhou, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 AdaFuse通过自适应集成解码与测试时缩放,提升大语言模型在多种任务上的生成性能。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23648 2026-09-01 cs.CL 版本更新 77%

EmoTrace: An Emotion Trajectory-Centered Framework for Psychological Support Dialogue Generation

EmoTrace:一种以情感轨迹为中心的心理支持对话生成框架

Kaitong Weng, Lixin Liu, Zihao Liu, Bo Wang, Shiguang Ni

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对现有心理支持对话数据生成方法的局限,提出EmoTrace框架,通过构建求助者认知概况及相关模块,以模拟其情感轨迹,增强情感表达层次性,实验证明该方法在情感丰富度和共情质量上优于现有方法。

Comments 36 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08025 2026-09-01 cs.CL 版本更新 77%

Arabic Sentence Segmentation Across Genres and Punctuation Conditions

跨体裁与标点条件下的阿拉伯语句子分割

Mohammed Elkholy, Khalid N. Elmadani, Nizar Habash, Bashar Alhafni

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·泽德人工智能大学) New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 针对阿拉伯语标点歧义和不一致导致的句子分割难题,构建跨8种体裁的语料库AraSEG,评估LLM、轻量编码器和依存解析器,发现轻量模型在困难设置下优于LLM,且准确分割能显著提升下游依存解析。

Comments Accepted to EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08289 2026-09-01 cs.CR 版本更新 75%

MIRAGE: Misleading Retrieval-Augmented Generation via Black-box and Query-agnostic Poisoning Attacks

MIRAGE: 通过黑盒与查询无关的投毒攻击误导检索增强生成

Tailun Chen, Yu He, Yan Wang, Shuo Shao, Haolun Zheng, Zhihao Liu, Jinfeng Li, Zhizhen Qin, Yuefeng Chen, Zhixuan Chu, Zhan Qin, Kui Ren

专题命中 预训练与数据 :LLM(abstract,abstract_cn);preference optimization(abstract)

AI总结 提出MIRAGE,一种在黑盒和查询无关场景下通过多阶段投毒管道攻击RAG系统的方法,利用代理模型反馈、人物驱动查询合成、语义锚定和对抗性TPO优化,显著提升攻击效果和隐蔽性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20873 2026-09-01 cs.LG 版本更新 74%

In-Cell Learning: Language Models That Update Their Own Weights in Sequence Without Changing the File They Ship

除模型外一切未变:CellFill——针对量化大语言模型的比特一致、可撤销更新的单元内受限学习

Zifeng Liu, Yaxin Lu, Xuanhan Wu, Zhiyong Du, Yiming Mao, Zhenhe Wang, Wenqi Shi, Zhengkun Jing, Linwei Liu

机构 * Institute for Frontier Interdisciplinary Research in Health Sciences and Technology, Sun Yat-sen University(中山大学健康科学与技术前沿交叉研究院) Guangdong Engineering Research Center of Medical Artificial Intelligence Multimodal System(广东省医学人工智能多模态系统工程研究中心) Sun Yat-sen University(中山大学) School of Business, Sun Yat-sen University(中山大学商学院) School of Computer Science, China University of Geosciences (Wuhan)(中国地质大学(武汉)计算机学院) School of Public Health, Sun Yat-sen University(中山大学公共卫生学院) Hospital of Stomatology, Sun Yat-sen University(中山大学口腔医院) Big Data and Artificial Intelligence Center, The Third Affiliated Hospital of Sun Yat-sen University(中山大学附属第三医院大数据与人工智能中心)

专题命中 预训练与数据 :language model(title);分类 cs.LG

AI总结 CellFill方法通过在量化决策单元内写入残差实现量化大语言模型的比特一致、可撤销更新,实验显示其在召回率接近基准的同时降低跨域遗忘,且可迁移至27B混合线性注意力模型。

Comments 94 pages, 14 figures, 22 tables. Technical Report, version 3. Code and archived artifacts: https://github.com/sumsliu/in-cell-learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30485 2026-09-01 cs.CL cs.CY cs.LG 新提交 73%

Two Centuries of Sexism in British Parliament: A Computational Analysis of Women's Representation in the Hansard Corpus

英国议会两百年的性别歧视:对Hansard语料库中女性代表性的计算分析

Mohammad Omar Khursheed, Mandira Sawkar, Ashiqur R. KhudaBukhsh

机构 * Rochester Institute of Technology(罗切斯特理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过分析英国Hansard语料库的6531篇议会演讲,利用大语言模型发现反对女性参政的演讲性别歧视比例更高,支持选举权的性别歧视多为善意,且男女议员支持女性权利的比例存在差距,验证了矛盾性别歧视理论。

Comments Accepted at EMNLP 2026 (Main Conference Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29326 2026-09-01 cs.CL cs.AI 新提交 73%

StageWell: A Process-Aligned Chinese Corpus for Positive-Psychology Support Dialogue

StageWell:面向积极心理学支持对话的流程对齐中文语料库

Yuxiong Wang, Ziwei Lin, Bo Wang, Yu Zhang, Shiguang Ni

专题命中 预训练与数据 :SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究构建了流程对齐中文语料库StageWell及HQS协议,用于优化多轮积极心理学支持对话的监督,在多个开源大模型上实现了流程控制、回复质量与安全性的提升。

Comments 29 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30461 2026-09-01 cs.CL 新提交 70%

From Final Artifacts to Trajectories: Retrospective Process Supervision for Evidence-Grounded Long-Form Generation

从最终产物到轨迹:面向证据支撑的长文本生成的回溯过程监督

Junjie Huang, Jiarui Qin, Di Yin, Weiwen Liu, Yong Yu, Xing Sun, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对开放式长文本生成任务轨迹数据稀缺的问题,提出RetroGen框架,利用预训练数据中丰富的高质量最终产物重构轨迹,训练模型以提升证据支撑等任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29890 2026-09-01 cs.CL 新提交 70%

En-ViMedNER: An English-Vietnamese Parallel Biomedical Corpus with UMLS Semantic Type Annotations

En-ViMedNER:带有UMLS语义类型标注的英越双语生物医学语料库

Nhu Vo, Phuong Nguyen, Nu Uyen Phuong Le, Inigo Jauregi Unanue, Dung D. Le, Massimo Piccardi, Wray Buntine

机构 * College of Engineering and Computer Science, VinUniversity(VinUniversity工程与计算机科学学院) Faculty of Engineering and IT, University of Technology Sydney(悉尼科技大学工程与信息技术学院) Center for AI Research, VinUniversity(VinUniversity人工智能研究中心) Monash University, Australia(莫纳什大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出首个带UMLS语义类型标注的英越双语生物医学NER语料库En-ViMedNER,经多环节构建后在两类NER任务中取得F1值结果,相关资源公开发布以推动越南语生物医学NLP研究。

Comments To appear in Proceedings of EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29662 2026-09-01 cs.CL 新提交 70%

ACTD: Anchor-Based Cross-Tokenizer Distillation with Residual Regularization

ACTD:带残差正则化的基于锚点的跨分词器蒸馏

Huiyi Zhang, Zijian Li, Xiaocheng Feng, Weitao Ma, Xiaoliang Yang, Yichong Huang, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对跨分词器蒸馏的词汇与序列不对齐及对齐噪声问题,提出带残差正则化的ACTD方法,在五个推理基准上用三种教师模型评估取得SOTA,多教师扩展版性能优于基线。

Comments Accepted by EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29144 2026-09-01 cs.CL 新提交 70%

Quantifying Error Tolerance in Synthetic Data: An Atomic-level Operand vs. Operator Perturbation Study

量化合成数据的误差容忍度:原子级操作数与算子扰动研究

Jiaxiang Liu, Chenhao Yuan, Shuwen Xu, Boxuan Xing, Xiusheng Huang, Yinhao Xu, Hao Liu, Wenhao Teng, Xiangwen Liao, Pengfei Cao, Jun Zhao, Kang Liu

机构 * CDL, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所CDL) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Fujian Provincial Cancer Hospital(福建省肿瘤医院) College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对合成数据误差容忍度定量分析缺失的问题,提出ATOM框架区分操作数与算子扰动,发现模型对操作数扰动鲁棒但受算子扰动影响,合成数据较LIMA提升3.1%,凸显算子多样性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28622 2026-09-01 cs.DB cs.AI 新提交 70%

PUFFER: Incremental Fuzzy Deduplication for Continuously Evolving Corpora

PUFFER:面向持续演化语料库的增量模糊去重算法

Xiao Yang, Erik Edward Aldape, Beren Millidge

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出 PUFFER 增量模糊去重算法,通过 LSH 带存储与 T-扇出分层压缩实现低内存、低成本的持续演化语料库去重,在百亿级文档场景下比同类工具快数十倍,已应用于超 300 亿文档并开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11660 2026-09-01 cs.LG 版本更新 70%

Bergson: An Open Source Library for Data Attribution

Bergson:一个用于数据归因的开源库

Lucia Quirke, Louis Jaburi, David Johnston, William Z. Li, Gonçalo Paulo, Guillaume Martres, Girish Gupta, Stella Biderman, Nora Belrose

机构 * EleutherAI Independent

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出Bergson开源库,支持大规模语言模型和预训练数据集的多种数据归因方法,提供磁盘梯度存储和多节点分布式训练,首次开源实现MAGIC、SOURCE和TrackStar三种方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12335 2026-09-01 cs.CV cs.LG 版本更新 70%

SynMulti: Synthetic-to-Real Learning for Multimodal Video Understanding

一站式:一个多模态视频理解统一合成数据管道

Tanzila Rahman, Renjie Liao, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(向量人工智能研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出统一合成数据管道,用于生成多模态视频数据,支持多种任务格式,提升模型推理能力,并在视频物体计数、视觉问答和分割任务中验证了其有效性。

Comments 14 Pages, 4 Tables, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15446 2026-09-01 cs.CL 70%

Toward expert-level motivational interviewing for health behavior improvement with LLMs

迈向利用大语言模型的专家级激励访谈以改善健康行为

Run-ze Hu, Yang Yang, Yi-hang Yang, Jing-qi Kong, Jia-hui Luo, Wen-yu Yang, Jing Chen, Jing-yao Liu, Hui-qun Zeng, Lei Zhang, Zheng Liu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过开发和评估基于大语言模型的激励访谈系统,探索了利用AI促进健康行为改变的可行性,展示了微调后模型在激励访谈技术上的表现。

Comments 26 pages, 3 figures

Journal ref JMIR Form Res. 2026;10:e89077

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30758 2026-09-01 cs.CV 新提交 67%

CheXGround: Anatomical Region Tokens for Grounded Longitudinal Chest X-ray Interpretation

CheXGround:用于 grounded 纵向胸部 X 线片解读的解剖区域标记

Adonay Demewez Gebremedhin, Wessam Shehieb, Sara Alansari, Mohamad Alansari, Muzammal Naseer, Sajid Javed, Naoufel Werghi

机构 * Ajman University(阿治曼大学) University of Birmingham(伯明翰大学) Khalifa University(哈利法大学) University of Western Australia(西澳大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract)

AI总结 本文提出 CheXGround,一种基于区域的纵向胸部 X 线片语言模型,通过时序区域-短语对齐预训练目标关联区域标记与临床文本,在多项放射学任务上较基线模型提升性能,验证了解剖层面组织纵向证据的有效性。

Comments Accepted for publication at the 37th British Machine Vision Conference (BMVC2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29374 2026-09-01 cs.CV 新提交 67%

Think, Look, and Revise: Inconsistency-Aware Visual Self-Correction in MLLMs

思考、观察与修正:多模态大语言模型中基于不一致感知的视觉自我修正

Yu Cheng, Arushi Goel, Hakan Bilen

机构 * University of Edinburgh(爱丁堡大学) NVIDIA Research(英伟达研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本研究针对工具增强型多模态推理中工具输出缺乏验证的问题,提出ReVISE框架,通过带监督反思的训练数据集与强化学习目标奖励,实现错误检测与修正,在多个基准上取得性能提升。

Comments accepted by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29426 2026-09-01 cs.CV cs.AI cs.LG 新提交 62%

Polis: 3D Self-Supervision at City Scale

Polis:城市规模的3D自监督学习

Alexander Rusnak, Sophia Kovalenko, Jingru Wang, Ismail Moudden, Xiru Wang, Frédéric Kaplan

机构 * École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究针对城市规模3D场景设计的Polis,结合SIGReg等技术,在14个城市与建筑规模基准上,提升了语义表示性能,同时展现了该领域自监督学习专业化的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏