arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 139914 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12460 篇

2604.08115 2026-04-10 cs.AI 70%

Revise: A Framework for Revising OCRed text in Practical Information Systems with Data Contamination Strategy

修订:一种在实际信息系统中利用数据污染策略修订OCR文本的框架

Gyuho Shim, Seongtae Hong, Heuiseok Lim

机构 * Department of Computer Science and Engineering, Korea University(高丽大学计算机科学与工程系) Human-inspired AI Research(人类启发人工智能研究)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Revise框架,通过修正OCR文本的字符、词和结构层面错误,提升文档信息的结构化表示和管理能力,从而增强文档检索和问答任务的性能。

Comments Accepted to ACL 2025 Industry-Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07015 2026-04-09 cs.CL 70%

Corpora deduplication or duplication in Natural Language Processing of few resourced languages ? A case of study: The Mexico's Nahuatl

语料去重或重复在自然语言处理中少数资源语言的应用?一个案例研究:墨西哥的纳瓦特尔语

Juan-José Guzman-Landa, Juan-Manuel Torres-Moreno, Graham Ranger, Miguel Figueroa-Saavedra, Martha-Lorena Avendaño-Garrido, Elvys Linhares-Pontes, Luis-Gil Moreno-Jiménez

机构 * LIFAT, Université de Tours(图尔大学计算机科学、人工智能与图像处理实验室) Instituto de Investigaciones en Educación, Universidad Veracruzana(韦拉克鲁斯大学教育研究所) Trading Central(Trading Central公司) Independent Researcher(独立研究员)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨在计算资源有限的语言中,语料重复是否有助于自然语言处理。通过纳瓦特尔语语料扩展实验,发现可控重复可提升嵌入学习效果。

Comments 8 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04892 2026-04-07 cs.LG 70%

Data Attribution in Adaptive Learning

自适应学习中的数据归因

Amit Kiran Rege

专题命中 预训练与数据 :language model(abstract);post-training(abstract);分类 cs.LG

AI总结 本文研究自适应学习中的数据归因问题,提出条件干预目标,证明回放信息无法一般性恢复归因,并识别出一个结构类以从日志数据中识别目标。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29221 2026-04-01 cs.CL 70%

SiPaKosa: A Comprehensive Corpus of Canonical and Classical Buddhist Texts in Sinhala and Pali

SiPaKosa:一篇全面的斯里兰卡语和巴利经典和古典佛教文本语料库

Ranidu Gurusinghe, Nevidu Jayatilleke

机构 * School of Computing, Informatics Institute of Technology, Sri Lanka(斯里兰卡信息理工学院计算学院)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 SiPaKosa语料库包含约786万词和786千句,结合16份历史佛教文献和完整的巴利三藏文本,通过高质量OCR和网络爬虫构建,评估了10种预训练模型的性能,显示专有模型在开放源代码模型上表现优异,支持领域适应语言模型的预训练,促进历史语言分析和佛教研究信息检索系统的发展。

Comments 17 pages, 5 figures, 5 tables, Accepted paper at the 2nd Workshop on Challenges in Processing South Asian Languages (CHiPSAL) @ LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29176 2026-04-01 q-bio.NC cs.AI cs.CE cs.CV 70%

Predicting Neuromodulation Outcome for Parkinson's Disease with Generative Virtual Brain Model

利用生成虚拟脑模型预测帕金森病的神经调制疗效

Siyuan Du, Siyi Li, Shuwei Bai, Ang Li, Haolin Li, Mingqing Xiao, Yang Pan, Dongsheng Li, Weidi Xie, Yanfeng Wang, Ya Zhang, Chencheng Zhang, Jiangchao Yao

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院) Microsoft Research Asia(微软亚洲研究院) Zhongnan Hospital of Wuhan University(武汉大学中南医院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Artificial Intelligence for Medicine, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院人工智能医学研究所) Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学协同媒体创新中心)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出一种基于生成虚拟脑模型的预训练-微调框架,通过静息态fMRI预测帕金森病患者接受颞叶干扰和深部脑刺激的疗效,利用生成模型提高个体化虚拟脑的准确性,并通过反事实估计预测临床反应,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26211 2026-03-30 cs.CV cs.AI 70%

Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding

迈向GUI代理:用于GUI定位的视觉-语言扩散模型

Shrinidhi Kumbhar, Haofu Liao, Srikar Appalaraju, Kunwar Yashraj Singh

机构 * Arizona State University(亚利桑那州立大学) AWS Agentic AI

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文探讨了离散扩散视觉-语言模型在GUI定位中的应用,通过混合掩码策略提升定位精度,并在多个数据集上验证了其有效性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10000 2026-03-27 cs.LG cond-mat.other 70%

Neural Scaling Laws for Deep Regression

深度回归的神经扩展定律

Tilen Cadez, Kyoung-Min Kim

机构 * Asia Pacific Center for Theoretical Physics(亚太理论物理中心) Department of Physics(物理系) Pohang University of Science and Technology(坡山科学技术大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究深度回归模型中神经扩展定律,通过参数估计模型探讨回归性能与训练数据量和模型容量的幂律关系,发现损失与这些因素呈1到2之间的幂律关系。

Comments Supplementary Information will be provided with the published manuscript

Journal ref Machine Learning: Science and Technology, 7 025011 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17490 2026-03-27 cs.LG stat.ML 70%

Revisit, Extend, and Enhance Hessian-Free Influence Functions

重新审视、扩展和增强Hessian-Free影响函数

Ziao Yang, Han Yue, Jian Chen, Hongfu Liu

机构 * Brandeis University(布兰迪大学) Tsinghua University(清华大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文重新审视TracIn方法,扩展其应用至公平性和鲁棒性,并通过集成策略增强其性能,通过合成数据和噪声标签检测等实验验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24556 2026-03-26 cs.IR cs.AI 70%

Evaluating Chunking Strategies For Retrieval-Augmented Generation in Oil and Gas Enterprise Documents

评估检索增强生成在石油和天然气企业文档中的分块策略

Samuel Taiwo, Mohd Amaluddin Yusoff

机构 * Digital and Innovation Department, Nigeria LNG Limited(尼日利亚LNG公司数字与创新部门)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了四种分块策略在石油和天然气企业文档中的效果,发现结构感知分块在检索效果和计算成本上表现最佳,但对图表类文档仍有限。

Comments Presented at CCSEIT 2026. This version matches the published proceedings

Journal ref Computer Science and Information Technology (CS and IT), pp. 49-67, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22260 2026-03-24 cs.CL 70%

Greater accessibility can amplify discrimination in generative AI

更大的可及性可能放大生成AI中的歧视

Carolin Holtermann, Minh Duc Bui, Kaitlyn Zhou, Valentin Hofmann, Katharina von der Wense, Anne Lauscher

机构 * Trustworthy AI Lab, University of Hamburg(可信AI实验室,汉堡大学) NALA Group, JGU Mainz(NALA集团,吉森大学) Cornell University(康奈尔大学) Together AI Allen Institute for AI(人工智能研究院) CU Boulder(博尔德大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究发现语音交互虽提升可及性,但会因语音携带身份线索而加剧性别偏见,提出通过音调调节可缓解歧视问题。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21862 2026-03-24 cs.LG 70%

Holistic Scaling Laws for Optimal Mixture-of-Experts Architecture Optimization

整体缩放定律用于最优专家混合架构优化

Weilin Wan, Jingtao Han, Weizhong Zhang, Cheng Jin

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Hi Lab, Xiaohongshu Inc.(小红书公司Hi实验室) Project Numina(项目Numina) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种框架,通过联合约束三元组和代数约束,优化专家混合架构,实现鲁棒的缩放定律,为大规模计算预算提供完整最优架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21630 2026-03-24 cs.AI 70%

EnterpriseLab: A Full-Stack Platform for developing and deploying agents in Enterprises

EnterpriseLab:企业中开发和部署代理的全栈平台

Ankush Agarwal, Harsh Vishwakarma, Suraj Nagaje, Chaitanya Devaguptapu

机构 * Fujitsu Research India(富士通印度研究)

专题命中 预训练与数据 :language model(abstract);small language model(abstract);分类 cs.AI

AI总结 本文提出EnterpriseLab,一个统一开发和部署企业代理的全栈平台,通过模块化环境、自动化数据生成和集成训练管道,提升企业代理的能力与隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21529 2026-03-24 cs.CL 70%

SynSym: A Synthetic Data Generation Framework for Psychiatric Symptom Identification

SynSym:一种用于精神病症状识别的合成数据生成框架

Migyeong Kang, Jihyun Kim, Hyolim Jeon, Sunwoo Hwang, Jihyun An, Yonghoon Kim, Haewoon Kwak, Jisun An, Jinyoung Han

机构 * Sungkyunkwan University(成均馆大学) Samsung Medical Center(三星医疗中心) Indiana University(印第安纳大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SynSym框架,通过生成高质量训练样本提升症状识别模型的泛化能力,实验表明合成数据能与真实数据表现相当,并通过微调进一步提升性能。

URL PDF HTML 收藏
2505.11404 2026-03-24 cs.CV cs.AI 70%

Patho-R1: A Multimodal Reinforcement Learning-Based Pathology Expert Reasoner

Patho-R1: 基于多模态强化学习的病理专家推理器

Wenchuan Zhang, Penghao Zhang, Jingru Guo, Tao Cheng, Jie Chen, Shuwan Zhang, Zhang Zhang, Yuhao Yi, Hong Bu

机构 * Department of Pathology, West China Hospital, Sichuan University(四川大学华西医院病理科部门) Institute of Clinical Pathology, West China Hospital, Sichuan University(四川大学华西医院临床病理科研究所) University of Toronto(多伦多大学) Business School, Sichuan University(四川大学商学院) Department of Pathology, Shengjing Hospital of China Medical University(中国医科大学盛京医院病理科部门)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出Patho-R1,通过构建高质量推理导向数据集,结合三阶段训练流程提升病理推理能力,实现跨模态任务的鲁棒性能。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(33): 28418-28426, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01162 2026-03-24 cs.LG stat.ML 70%

Demystifying Group Relative Policy Optimization: Its Policy Gradient is a U-Statistic

解开群体相对策略优化:其策略梯度是U统计量

Hongyi Zhou, Kai Ye, Erhan Xu, Jin Zhu, Ying Yang, Shijin Gong, Chengchun Shi

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过经典U统计量框架解析GRPO,证明其策略梯度本质为U统计量,推导其MSE、有限样本误差界及渐近分布,揭示GRPO渐近等价于拥有价值函数的最优策略梯度算法,并建立通用缩放规律指导最优分组大小选择。

Comments 5 pages, 53 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03237 2026-03-24 cs.CL 70%

MUTANT: A Recipe for Multilingual Tokenizer Design

MUTANT:多语言分词设计的配方

Souvik Rana, Arul Menezes, Ashish Kulkarni, Chandra Khatri, Shubham Agarwal

机构 * Krutrim AI

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出MUTANT多语言分词方法,通过精心设计词汇和训练数据、语言感知预分词和子词多词感知训练,提升多语言LLM的分词效果,MUTANT-Indic在22种印度语言上实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03962 2026-03-23 cs.CL 70%

Exploring NLP Benchmarks in an Extremely Low-Resource Setting

在极低资源环境下探索NLP基准测试

Ulin Nuha, Adam Jatowt

机构 * National Kaohsiung University of Science and Technology(高雄科技大学) University of Innsbruck(因斯布鲁克大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文针对濒危罗曼语Ladin的Val Badia变体,利用少量平行语料生成合成数据集,提升低资源环境下的情感分析和多项选择问答性能,提供首个公开可用的Ladin数据集。

Comments The Association for Computational Linguistics: EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18014 2026-03-23 cs.LG 70%

Predictive Scaling Laws for Efficient GRPO Training of Large Reasoning Models

为高效训练大推理模型的预测缩放定律

Datta Nimmaturi, Vaishnavi Bhargava, Rajat Ghosh, Johnu George, Debojyoti Dutta

机构 * Nutanix

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出预测框架,通过实验推导出基于模型大小、初始性能和训练进度的经验缩放定律,识别三个训练阶段并建议提前停止以减少计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18073 2026-03-20 cs.AI 70%

Continually self-improving AI

持续自我改进的AI

Zitong Yang

机构 * STANFORD UNIVERSITY(斯坦福大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出三种方法,通过合成数据提升知识获取效率,减少对人类数据的依赖,并超越人类设计的训练范式,实现持续自我改进的AI。

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17884 2026-03-19 cs.CL 70%

DebugLM: Learning Traceable Training Data Provenance for LLMs

DebugLM: 为大语言模型学习可追溯的训练数据来源

Wenjie Jacky Mo, Qin Liu, Xiaofei Wen, Wenxuan Zhou, Zhe Zhao, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校) University of Southern California(南加州大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DebugLM通过内置数据溯源能力,使LLM能追溯行为来源,支持测试时针对性修复,提升调试效率和模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13047 2026-03-19 cs.CL 70%

Automated stance detection in complex topics and small languages: the challenging case of immigration in polarizing news media

复杂主题和小语言中的自动化立场检测:极化新闻媒体中移民问题的挑战性案例

Mark Mets, Andres Karjus, Indrek Ibrus, Maximilian Schich

机构 * School of Humanities, Tallinn University, Estonia(塔林大学人文学科学院,爱沙尼亚) Baltic Film, Media and Arts School, Tallinn University, Estonia(巴尔蒂克电影、媒体与艺术学院,塔林大学,爱沙尼亚) ERA Chair for Cultural Data Analytics, Tallinn University, Estonia(塔林大学文化数据分析埃拉教席,爱沙尼亚)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨了在形态复杂、低资源语言和复杂社会文化主题下,使用大语言模型进行自动化立场检测的可行性,通过对比多种语言模型和ChatGPT的表现,展示了其在新闻分析中的应用潜力。

Journal ref Plos one, 19(4), e0302380 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15151 2026-03-19 cs.LG 70%

Time Tracker: Mixture-of-Experts-Enhanced Foundation Time Series Forecasting Model with Decoupled Training Pipelines

时间追踪:混合专家增强的基础时间序列预测模型与解耦训练流水线

Aobo Liang, Yan Sun, Xiaohou Shi, Ke Li

机构 * School of Computer Science (National Pilot Software Engineering School)(计算机学院(国家级试点软件工程学院)) Beijing University of Posts and Telecommunications(北京邮电大学) China Telecom Research Institute(中国电信研究院)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出Time Tracker模型,通过稀疏混合专家和Any-variate Attention处理多变量时间序列,提升预测精度和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16086 2026-03-18 cs.RO cs.AI cs.CV cs.SD 70%

Towards the Vision-Sound-Language-Action Paradigm: The HEAR Framework for Sound-Centric Manipulation

迈向视觉-声音-语言-动作范式:用于以声音为中心的操作的HEAR框架

Chang Nie, Tianchen Deng, Guangming Wang, Zhe Liu, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University and Shanghai Key Laboratory of Navigation and Location Based Services(自动化与智能感知学院,上海交通大学,导航与基于位置的服务重点实验室) Department of Engineering, Cambridge University(工程系,剑桥大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出HEAR框架,通过整合声音、视觉、语言和本体感知,解决实时声音中心操作中的关键声音遗漏问题,强调因果持续性和显式时间学习的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15950 2026-03-18 cs.CL cs.CY cs.SI 70%

POLAR:A Per-User Association Test in Embedding Space

POLAR:嵌入空间中的用户级关联测试

Pedro Bento, Arthur Buzelin, Arthur Chagas, Yan Aquino, Victoria Estanislau, Samira Malaquias, Pedro Robles Dutenhefner, Gisele L. Pappa, Virgilio Almeida, Wagner MeiraJr

专题命中 预训练与数据 :LLM(abstract);language model(abstract);分类 cs.CL

AI总结 POLAR在嵌入空间中进行用户级词汇关联测试,通过定制化的词汇轴评估作者差异,区分LLM驱动的机器人与真实账号,并揭示极端论坛中词汇偏移趋势。

Comments Accepted paper at ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12774 2026-03-18 cs.CL 70%

LLMs as Repositories of Factual Knowledge: Limitations and Solutions

大型语言模型作为事实知识库:局限性与解决方案

Seyed Mahed Mousavi, Simone Alghisi, Giuseppe Riccardi

机构 * Signals and Interactive Systems Lab, Department of Information Engineering and Computer Science, University of Trento(信号与交互系统实验室,信息工程与计算机科学系,特伦托大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了LLM作为事实知识库的适用性,评估了24种先进LLM在时间敏感事实问题中的准确性和一致性,并提出ENAF方法以提升响应稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14838 2026-03-17 cs.CL 70%

The Impact of Ideological Discourses in RAG: A Case Study with COVID-19 Treatments

检索增强生成中意识形态话语的影响:以新冠治疗方案为例

Elmira Salari, Maria Claudia Nunes Delfino, Hazem Amamou, José Victor de Souza, Shruti Kshirsagar, Alan Davoust, Anderson Avila

机构 * Wichita State University(威斯康星州立大学) Pontifícia Universidade Católica de São Paulo(圣保罗天主教大学) Institut national de la recherche scientifique(国家科学研究中心) Université du Québec en Outaouais(魁北克大学Outaouais)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究检索到的意识形态文本对大语言模型输出的影响,通过新冠治疗方案案例,探讨意识形态在RAG框架中的识别与影响,揭示意识形态偏见与潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14369 2026-03-17 cs.LG 70%

From Specification to Architecture: A Theory Compiler for Knowledge-Guided Machine Learning

从规范到架构:一种知识引导机器学习的理论编译器

Asela Hevapathige, Yu Xia, Sachith Seneviratne, Saman Halgamuge

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出理论编译器,通过形式化领域理论自动生成架构,确保函数空间与理论一致。解决三大开放问题:通用理论语言设计、编译算法构建、形式验证标准建立。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14126 2026-03-17 cs.AI 70%

The Institutional Scaling Law: Non-Monotonic Fitness, Capability-Trust Divergence, and Symbiogenetic Scaling in Generative AI

机构规模定律:非单调适应度、能力-信任分歧与共生式规模在生成AI中的体现

Mark Baciak, Thomas A. Cellucci

专题命中 预训练与数据 :post-training(abstract);RLHF(abstract);分类 cs.AI

AI总结 本文提出机构规模定律,揭示机构适应度非单调随模型规模变化,证明能力与信任在临界规模后正式分歧,并展示领域特定模型的协同系统在特定环境中优于前沿通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13421 2026-03-16 cs.LG stat.ML 70%

Larger Datasets Can Be Repeated More: A Theoretical Analysis of Multi-Epoch Scaling in Linear Regression

更大的数据集可以重复更多次:线性回归中多轮缩放的理论分析

Tingkai Yan, Haodong Wen, Binghui Li, Kairong Luo, Wenguang Chen, Kaifeng Lyu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文理论分析了在线性回归中,通过多次训练同一数据集的常见方法如何改变数据缩放规律。研究发现,当训练轮数K较小时,数据有效重复率E(K,N)近似为K,而随着K增加,E(K,N)趋于一个随数据规模N增长的值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10016 2026-03-12 cs.CY cs.AI 70%

Assessing Cognitive Biases in LLMs for Judicial Decision Support: Virtuous Victim and Halo Effects

评估大语言模型在司法决策支持中的认知偏差:善良的受害者效应和光环效应

Sierra S. Liu

机构 * Sierra S. Liu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究评估大语言模型在司法决策支持中的认知偏差,发现善良受害者效应和光环效应存在差异,部分偏差在人类和模型间有显著差异。

Comments IEEE ICDM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏