arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-28 至 2026-08-28 共收录 36 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 36 篇

2608.26587 2026-08-28 cs.CL 新提交 93%

Surgical Alignment in Knowledge Graph Training for Clinical Diagnosis with Large Language Models

面向临床诊断的大语言模型训练中知识图谱的外科式对齐

Saksham Khatwani, He Cheng, Majid Afshar, Dmitriy Dligach, Yanjun Gao

机构 * University of Colorado Anschutz Medical Campus(科罗拉多大学安舒茨医学校区) University of Wisconsin Madison(威斯康星大学麦迪逊分校) Loyola University(洛约拉大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn)

AI总结 该研究针对临床诊断的LLM训练,通过多维度系统研究引入GID和GD,发现KL正则化下KG判断训练的稀疏更新(外科式对齐)可提升推理质量,需结合优化几何诊断评估KG-LLM整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26592 2026-08-28 cs.CL 新提交 92%

Benchmarking Clinical Decision Pathway Adherence in Large Language Models

大型语言模型的临床决策路径遵循情况基准测试

Nuo Chen, Xinyang Jiang, Zilong Wang, Zhifei Zhang, Xiaoye Qu, Jiajun Deng, Yulan Guo, Cairong Zhao

机构 * Tongji University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tongji University School of Medicine(同济大学医学院) Sun Yat-sen University(中山大学) Fuzhou University(福州大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究针对现有医疗LLM基准缺乏指南遵循评估的问题,构建了MEGA-CDP基准,经实验发现当前LLM提供可靠临床决策支持仍具挑战,凸显了CDP导向评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09492 2026-08-28 cs.IR 版本更新 91%

Generate to Accelerate: Improved Reranking via LLM-Generated Pivot Documents

基于LLM生成参考文档的重排序流水线动态排名列表截断

Nilanjan Sinhababu, Soumedhik Bharati, Debasis Ganguly, Pabitra Mitra

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出利用LLM生成参考文档作为相关与不相关文档的枢纽,实现动态排名列表截断和高效列表式重排序,在TREC DL基准上性能提升且加速达66%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15810 2026-08-28 cs.CR cs.AI 版本更新 90%

Let Them Steal: Trapping Large Language Model Extraction Attacks with Knowledge Honeypot

让他们偷:用知识蜜罐诱捕大语言模型提取攻击

Yuyang Dai, Yushun Dong

机构 * Florida State University(佛罗里达州立大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出知识陷阱防御方法,通过蜜罐知识图和面包屑引导消耗攻击者查询预算,在保持合法用户性能的同时降低替代模型一致性6.2%。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27102 2026-08-28 cs.AI cs.CR 新提交 90%

LAAF: A Layered Accountability Architecture Framework for LLM Applications

LAAF:面向大语言模型应用的分层问责架构框架

Prachi Chaturvedi, Shahnawaz Ahmad, Ehsan Nowroozi, Muhammad Waqas, George Loukas, Alireza Jolfaei, Lucas Cordeiro, Pierre Dantas

机构 * School of Computer Science Engineering and Technology, Bennett University(班尼特大学计算机科学与工程技术学院) Centre for Sustainable Cyber Security (CS2), University of Greenwich(格林威治大学可持续网络安全中心) School of Electrical Engineering, Computing & Mathematical Sciences, Curtin University(科廷大学电气工程、计算与数学科学学院) Systems and Software Security (S3), University of Manchester(曼彻斯特大学系统与软件安全中心)

专题命中 领域大模型 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对LLM应用问责问题,遵循PRISMA指南开展文献综述,整合四类问责机制与四层分类工具,提出LAAF架构,映射至相关法规标准,发现缺口与张力,为LLM问责提供综合方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26167 2026-08-28 cs.AI cs.ET cs.LG eess.AS 新提交 90%

Refusal Is Not Robustness: Auditing Confident Fabrication in Large Language Models on a Provably Uninformative Clinical Pain Speech Transcript

拒绝不等同于鲁棒性:在经证实无信息的临床疼痛语音转录本上审计大型语言模型的自信编造

Sagnik De, Sreenija Pavuluri

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本研究在TAME Pain语料库上评估7个大语言模型,发现部分模型在特定提示下会对无信息转录本产生自信编造,且拒绝不等同于鲁棒性,权威式提示会影响模型弃权行为。

Comments 14 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14892 2026-08-28 cs.LG cs.AI 版本更新 90%

Can LLMs Accurately Score Medical Diagnoses and Clinical Reasoning?

LLM能否准确评分医学诊断和临床推理?

Amy Rouillard, Sitwala Mundia, Linda Camara, Ziyaad Dangor, Michael Cameron Gramanie, Ismail Kalla, Shabir A. Madhi, Kajal Morar, Marlvin T. Ncube, Haroon Saloojee, Bruce A. Bassett

机构 * Wits MIND Institute, University of the Witwatersrand, Johannesburg, South Africa(维特士心理研究所,沃斯兰德大学,约翰内斯堡,南非) Grai Labs, Cape Town, South Africa(格雷实验室,开普敦,南非) South African Medical Research Council Vaccines and Infectious Diseases Analytics Research Unit, Faculty of Health Sciences, University of the Witwatersrand, Johannesburg, South Africa(南非医学研究理事会疫苗和传染病分析研究组,健康科学学院,沃斯兰德大学,约翰内斯堡,南非) Department of Internal Medicine, Charlotte Maxeke Johannesburg Academic Hospital, and Faculty of Health Sciences, University of the Witwatersrand, Johannesburg, South Africa(内科学系,查理·马克斯凯约翰内斯堡学术医院,以及健康科学学院,沃斯兰德大学,约翰内斯堡,南非) Department of Paediatrics and Child Health, Faculty of Health Sciences, University of the Witwatersrand, Johannesburg, South Africa(儿科学与儿童健康系,健康科学学院,沃斯兰德大学,约翰内斯堡,南非) Wits MIND Institute, University of the Witwatersrand, Johannesbu(维特士心理研究所,沃斯兰德大学,约翰内斯堡)

专题命中 领域大模型 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究使用LLM陪审团对300例低收入和中等收入国家医院病例的3334个诊断进行评分,发现校准后的LLM评分与专家评分高度一致,且严重错误风险更低,可作为可靠的评估代理。

Comments Extended version of a paper that appeared in Artificial Intelligence in Medicine 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25944 2026-08-28 cs.CL 版本更新 89%

Unveiling Spectral Mechanisms in Training-Free LLM Text Detection

揭示无训练大语言模型文本检测中的频谱机制

Haitong Luo, Xuying Meng, Weiyao Zhang, Wenji Zou, Shengfeng Lou, Xuefeng Jiang, Chungang Lin, Yujun Zhang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 领域大模型 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对无训练LLM文本检测中遗漏人类写作信号波动的问题,从理论和实证角度分析频谱检测机制,明确其适用场景,为多维检测器设计提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26753 2026-08-28 cs.SE cs.AI 新提交 87%

Beyond Execution: Auditing Experimental Fidelity in LLM-Driven Scientific Research

超越执行:审计大语言模型驱动科学研究中的实验保真度

Lezhi Yu, Xiaogang Xu, Yuhua Zhou, Shuibing He, Aimin Pan

专题命中 领域大模型 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究针对LLM驱动科学实验中智能体的方法学幻觉问题,提出ABE-Ralph审计框架,在复现实验中实现93%稳健执行率,可检测科学失败模式,NatureBench任务表现优异。

Comments 20pages, 5 figures, code link: this https URL (https://github.com/Flavorfish/AutoRepro)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04180 2026-08-28 cs.CL cs.AI 版本更新 87%

MedFabric: Gold Evidence Hides the Difficulty of Word-Level Medical Fabrication Detection

MedFabric:黄金证据掩盖了词级医学编造检测的难度

Tung Sum Thomas Kwok, Qian Qian, Xiaofeng Lin, Dongxu Zhang, Jun Han, Zhichao Yang, Davin Hill, Tamer Soliman, Sanjit Singh Batra, Robert Tillman, Guang Cheng

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM医学编造检测的评估假象问题,构建了词级医学编造基准MedFabric,发现检测由证据正确性决定,通过检索置信度门提升了检测性能并开放资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27287 2026-08-28 cs.IR 新提交 86%

Astar: Learning to Propose Evolution Directions for Self-Evolving Industrial AI Systems

Astar:为自演进工业AI系统学习提出进化方向

Jinxin Hu, Hao Deng, Haibo Xing, Lingyu Mu, Muyu Zou, Weiqin Yang, Sirui Chen, Bohao Wang, Zhezheng Hao, Hao Zhang, Zulong Chen, Shizhun Wang, Yu Zhang, Xiaoyi Zeng, Jiawei Chen

专题命中 领域大模型 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn)

AI总结 本研究提出Astar,通过工业系统迭代历史训练专用进化引导模型,解决通用LLM的不足,在Lazada广告系统验证中,其提案成功率远超人类专家与通用LLM,实现完全自动迭代并提升广告系统指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27006 2026-08-28 cs.IR 新提交 86%

Conversational Recommendation over Live E-Commerce Catalogues with Self-Refreshing Retrieval

基于自刷新检索的直播电商目录对话推荐

Ante Kapetanovic, Tomislav Duricic, Dionizije Fa, Andro Mercep, Emanuel Lacic

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对电商目录动态变化问题,提出与商家无关的多轮对话购物助手,核心为自刷新检索器,仅处理目录增量,对话层用LLM做意图分类,演示为WhatsApp购物助手。

Comments ACM RecSys 2026, 3 pages, 2 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17316 2026-08-28 cs.IR 版本更新 86%

Empowering Compact LLMs with Fusion of Layer-wise Exits for Recommendation

融合分层出口的紧凑型大语言模型推荐系统

Xurong Liang, Tong Chen, Quoc Viet Hung Nguyen, Jianxin Li, Xiangliang Zhang, Hongzhi Yin

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出FLEXRec框架,通过在紧凑型LLM的Transformer层插入预测头并自适应融合,结合AC-Router与目标k铰链损失,在三个数据集上以Qwen 3 1.7B和Llama 3.2 3B实现紧凑型主干方法中最优准确率且效率高。

Comments Accepted by ICDM'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10358 2026-08-28 cs.CV cs.AI 版本更新 85%

Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift

在域转移下对用于乳腺钼靶成像的基础模型的稳健性进行基准测试

Giang Nguyen, Raghav Mehta, Emma A.M. Stanley, Tian Xia, Thi Hao Nguyen, Hieu Pham, Ben Glocker

机构 * College of Engineering and Computer Science, VinUniversity(工程与计算机科学学院,文大大学) Imperial College London(伦敦帝国理工学院) Radiology Department, Vietnam National Cancer Hospital(越南国家癌症医院放射科) VinUni-Illinois Smart Health Center, VinUniversity(文大大学 - 伊利诺伊智能健康中心,文大大学) The Computer Vision and Medical AI Lab, VinUniversity(计算机视觉与医学人工智能实验室,文大大学)

专题命中 领域大模型 :foundation model(title,abstract);language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 研究在域转移下乳腺钼靶成像基础模型的稳健性,用统一协议在多数据集上训练评估15种模型主干,发现特定视觉语言模型性能强,DINOv3是有竞争力基线,适应预训练未持续提升泛化,强调数据集级OOD评估是核心标准。

Comments Accepted at Deep-Brea3th 2026 workshop in conjunction with MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26750 2026-08-28 cs.AI 新提交 84%

Discovering Relationships in Data Lakes Using Large Language Models: An Industrial Case

利用大语言模型发现数据湖中的关系:一个工业案例

Ahlame Diouan (ERIC, UL2), Eric Ferey, Sabine Loudcher (ERIC, UL2), Jérôme Darmont (ERIC, UL2)

专题命中 领域大模型 :large language model(title);language model(title);分类 cs.AI

AI总结 针对数据湖元数据对列关系发现信息不足的问题,提出两阶段方法ColRel,结合元数据、数据及业务字典构建列嵌入,在公共基准和工业ERP数据集上验证其在语义相关弱信号场景中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26153 2026-08-28 cs.AI 新提交 83%

EEG-to-Report: An Annotation and Feature-Text Framework for Training Language Models on Clinical EEG

EEG-to-Report:用于在临床脑电图上训练语言模型的标注与特征-文本框架

Xuan-The Tran, Le Trung Kien Nguyen

机构 * Vietnam Maritime University(越南海事大学) HAISmartlink Lab(HAISmartlink实验室)

专题命中 领域大模型 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 针对临床EEG报告依赖人工、现有工具无法满足AI训练需求的问题,提出EEG-to-Report框架,整合多格式EEG处理与标注,生成对齐特征-文本对,还含自动报告模块,为自动化EEG报告系统提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04731 2026-08-28 cs.CL cs.LG 版本更新 82%

Modular Expert Merging for Biomedical Retrieval

更少微调,更好检索:通过合成数据和模型合并重新思考LLM适应于生物医学检索器

Sameh Khattab, Jean-Philippe Corbeil, Osman Alperen Çinar-Koraş, Amin Dada, Julian Friedrich, Jiawei He, Douglas Teodoro, Jens Kleesiek

机构 * IKIM, University Hospital Essen(IKIM,埃森大学医院) Microsoft Healthcare & Life Sciences(微软医疗与生命科学)

专题命中 领域大模型 :LLM(title_cn,abstract);分类 cs.CL、cs.LG

AI总结 本文提出STM框架,通过合成数据和模型合并提升生物医学检索性能,实验显示在任务特定专家上提升23.5%并优于基线模型。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15129 2026-08-28 cs.CL cs.AI cs.HC 版本更新 82%

The BS-meter: Detecting Politics and Labour through ChatGPT's Language

BS-计:通过ChatGPT的语言检测政治与劳工相关议题

Alessandro Trevisan, Harry Giddens, Sarah Dillon, Alan F. Blackwell

机构 * University of Cambridge(剑桥大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文对比科学文献与ChatGPT生成文本的语言特征,构建扯淡的统计模型,探究其能否关联法兰克福式人工扯淡与政治、职场语境中的自然扯淡,相关成果可用于通过ChatGPT语言检测政治与劳工议题。

Comments 17 pages, 5 figures. Accepted for publication in AI&SOCIETY

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27184 2026-08-28 cs.AR cs.AI cs.SE 新提交 81%

LLMs in Digital EDA: A perspective on shifting roles from Generation to Orchestration

大语言模型在数字电子设计自动化(EDA)中的应用:从生成到编排的角色转变视角

Matthew Youngman, Cristian Sestito, Themis Prodromakis

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨LLMs在EDA领域的应用,定义生成器、智能体、编排器三个层级角色,指出当前方案存在语法陷阱且难以扩展至工业设计,提出需转向标准化、感知物理规律的编排器以优化硬件设计。

Comments 16 pages, 4 figures, 2 tables (in Supplementary Information); interactive version of Fig. 2 at this https URL (https://mattycode101.github.io/LLMs_in_Digital_EDA_Perspective/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26198 2026-08-28 cs.AI physics.ins-det 新提交 81%

Agentic AI for operating scientific instruments for nanoscale characterization

用于纳米尺度表征科学仪器操作的智能体AI

Zahra Ayar, Marcos Penedo, Mahdi Mehdikhani, Nahid Hosseini, Prabhu Prasad Swain, Georg E. Fantner

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于模型上下文协议(MCP)的智能体AI框架,通过3个AFM智能体实现原子力显微镜(AFM)的自动化操作,可安全执行命令、调优参数与后处理,其性能与专家操作相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27004 2026-08-28 cs.CV 新提交 78%

MVC-Bench: Benchmarking Calibration of Medical Vision-Language Models

MVC-Bench:医学视觉-语言模型的校准基准测试

Ashshak Sharifdeen, Shihab Aaqil Ahamed, Ufaq Khan, Muhammad Akhtar Munir Sujair Ibrahim, Mohamed Rafeek Mareer Ahamed, Yutong Xie, Imran Razzak, Muhammad Haris Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) Sabaragamuwa University of Sri Lanka(斯里兰卡萨巴拉加穆瓦大学) Digital Platform Development, SLT PLC(SLT公共有限公司数字平台开发部)

专题命中 领域大模型 :language model(title,abstract)

AI总结 该研究针对医学视觉-语言模型校准不足的问题,提出以校准为核心的基准MVC-Bench,通过多维度评估并提出MCM正则化方法,为医疗工作流提供校准改进指导。

Comments Accepted in EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20468 2026-08-28 cs.RO cs.AI cs.CL cs.HC cs.LG 版本更新 75%

MOMO: A framework for seamless physical, verbal, and graphical robot skill learning and adaptation

MOMO:一种无缝物理、语言和图形机器人技能学习与适应框架

Markus Knauer, Edoardo Fiorini, Maximilian Mühlbauer, Stefan Schneyer, Promwat Angsuratanawech, Florian Samuel Lay, Timo Bachmann, Samuel Bustamante, Korbinian Nottensteiner, Freek Stulp, Alin Albu-Schäffer, João Silvério, Thomas Eiband

机构 * German Aerospace Center (DLR), Institute of Robotics and Mechatronics (RMC)(德国航空航天中心(DLR)机器人与机电研究所) School of Computation, Information and Technology (CIT), Technical University of Munich (TUM)(计算、信息与技术学院(CIT),慕尼黑技术大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MOMO框架,通过三种互补交互方式实现机器人技能的灵活适应,结合触觉、自然语言和图形界面,提升非专家用户在工业环境中的应用能力。

Comments Accepted and published at IEEE RA-P, 15 pages, 13 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16313 2026-08-28 cs.AI cs.LG 版本更新 73%

Learning to Predict, Discover, and Reason in High-Dimensional Event Sequences

学习预测、发现和推理高维事件序列

Hugo Math

机构 * Faculty of Applied Computer Science(应用计算机科学系) University of Augsburg(艾格堡大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出统一事件序列建模、因果发现和大语言模型的框架,用于高维事件流中的自动化故障诊断,解决传统方法在高维数据中的不足。

Comments PhD dissertation, 135 pages of main content, 201 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27364 2026-08-28 cs.AI econ.GN 新提交 70%

Sophistication in GenAI Use: Field Evidence from a Large Firm

生成式AI(genAI)使用中的成熟度:来自一家大型企业的实地证据

Nicholas J. Hallman, Zachary T. Kowaleski, Anu Puvvada, Jaime J. Schmidt

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) KPMG LLP(毕马威有限责任公司)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究以某大型企业后台员工为对象,通过8个月的71万余条数据,发现资深员工genAI使用更成熟,战略等领域成熟度最高,且成熟度难随时间或培训提升,为管理者和研究者提供相关衡量指标与见解。

Comments 59 pages, 4 figures, 8 tables. Includes Appendix A (variable definitions), Appendix B (supplementary tables), and Online Appendix C (meta prompts)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26856 2026-08-28 cs.CV cs.AI 新提交 70%

From Reasoning to Pixels: Grounded Medical Multimodal LLMs for VQA and Segmentation

从推理到像素:用于VQA和分割的接地医学多模态大语言模型

Haowen Gu, Gensheng Pei, Junzhu Mao, Qiong Wang, Mingwu Ren, Yazhou Yao

机构 * Nanjing University of Science and Technology(南京理工大学) Sungkyunkwan University(成均馆大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有医学多模态大语言模型缺乏像素级接地的问题,提出MedREAL框架,引入SARP与R2V机制,构建MedRAVS-13K数据集,在Med-VQA和分割任务上性能优于现有方法,为医学图像分析提供可解释框架。

Comments accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26735 2026-08-28 cs.CL 新提交 70%

Preserving General Capabilities during Domain Specialization with Uncertainty-Calibrated MOPD

通过不确定性校准的MOPD在领域专业化过程中保留通用能力

Ziyuan Liu, Jiao Ou, Jian Liang, Ruiming Tang, Cheng Luo

机构 * Kuaishou Technology(快手科技)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对大语言模型领域专业化时通用能力下降的问题,提出不确定性校准的MOPD方法,在角色扮演和医疗领域实验中提升通用能力且保持垂直领域性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26596 2026-08-28 cs.CL 新提交 70%

Not Just Reason, Not Just Scan: Reinforcement Learning for Proactive Scientific Error Verification over Academic Paper

不仅是推理,不仅是扫描:面向学术论文的主动科学错误验证强化学习

Rongjin Li, Yuanxin Liu, Hao Zhou, Fandong Meng, Jie Zhou, Xu Sun

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) WeChat AI, Tencent Inc.(腾讯微信人工智能部门)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有无预设问题/证据的学术论文科学错误验证研究不足的问题,提出VERA-RL强化学习框架,构建VERA-13K数据集,训练Qwen3-VL-8B后其可验证推理能力接近旗舰级多模态大语言模型。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14104 2026-08-28 cs.CL 版本更新 70%

Legal Rule Induction: Towards Generalizable Principle Discovery from Analogous Judicial Precedents

法律规则归纳:从类似司法判例中发现可泛化的原则

Wei Fan, Tianshi Zheng, Yiran Hu, Zheye Deng, Weiqi Wang, Baixuan Xu, Chunyang Li, Haoran Li, Weixing Shen, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST, Hong Kong SAR, China(香港科技大学计算机科学与工程系) School of Law, Tsinghua University, Beijing, China(清华大学法学院)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究定义法律规则归纳任务,构建首个相关基准数据集,发现先进LLMs存在过度泛化和幻觉问题,经该数据集训练可提升其捕捉类似案件细微规则模式的能力。

Comments Accepted by EMNLP2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27069 2026-08-28 physics.app-ph physics.comp-ph 新提交 67%

Ternary-Valued Finite-Difference Time-Domain Method: Equivalence with the Yee Scheme Through Noise-Shaped Quantisation

三值有限差分时域方法:通过噪声整形量化与Yee格式的等价性

Ivan S. Maksymov

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 受量化大语言模型启发,本文提出三值有限差分时域方法,通过噪声整形量化实现与Yee格式等价,可大幅降低存储与运算复杂度,适用于多种物理方程求解。

Comments 3 figures, one table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02324 2026-08-28 cs.CL cs.AI cs.LG 版本更新 67%

Grounded Token Initialization for New Vocabulary in LMs for Generative Recommendation

为生成推荐系统中的新词汇提供基础性词 token 初始化

Daiwei Chen, Zhoutong Fu, Chengming Jiang, Haichao Zhang, Ran Zhou, Tan Wang, Chunnan Yao, Guoyao Li, Rui Cai, Yihan Cao, Ruijie Jiang, Fedor Borisyuk, Jianqiang Shen, Jingwei Wu, Ramya Korlakai Vinayak

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) LinkedIn Corporation(领英公司) Northeastern University(东北大学) University of California, Davis(加州大学戴维斯分校)

专题命中 领域大模型 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GTI方法,通过在预训练嵌入空间中语义地初始化新词汇,提升生成推荐系统性能,优于传统均值初始化和辅助任务适应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏