arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-25 至 2026-08-25 共收录 47 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 47 篇

2608.21668 2026-08-25 cs.AI cs.HC 新提交 92%

From Mastery Profile to Simulated Response: Stochastic Student Knowledge Graphs (SSKG) for Faithful LLM Student Simulation

从掌握轮廓到模拟响应:用于忠实LLM学生模拟的随机学生知识图谱(SSKG)

Yuan An, Emily Wang, Benjamin Wang, Ruhma Hashmi

机构 * Drexel University(德雷塞尔大学) Nick Howley College of Engineering and Computing(尼克·豪利工程与计算学院) School of Computer and Information Sciences(计算机与信息科学学院)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有LLM学生模拟难以区分高低掌握水平的局限,提出基于SSKG的方法,通过抽样三元组掌握概率确定答题结果并生成理由,有效区分了不同掌握水平的学生。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07442 2026-08-25 cs.HC cs.IR 版本更新 91%

EchoTrace: Diagnosing Recursive Risks in LLM-Powered Recommender Systems

循环中的回声:在LLM推荐系统中反馈循环下的风险诊断

Donguk Park, Dongwon Lee, Yeon-Chang Lee

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出了一种角色感知的诊断框架,用于分析LLM推荐系统中反馈循环下的系统性风险,包括偏见、幻觉和自我强化的暴露模式。

Comments Accepted by ACM CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02824 2026-08-25 cs.CL 版本更新 91%

CALIBURN: Self-Calibrated LLM Unlearning Alignment

CATNIP:通过校准和令牌化的负偏好对齐实现LLM去学习

Zhengbang Yang, Yisheng Zhong, Junyuan Hong, Zhuangdi Zhu

机构 * George Mason University(乔治·马歇尔大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 预训练与数据 :LLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 CATNIP通过校准和令牌化的负偏好对齐方法,实现有效LLM去学习,无需保留数据或对比对,提升知识遗忘与保留的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22974 2026-08-25 cs.AI 新提交 90%

Toward Effective and Reliable LLM Agents via Dynamic Ontology

基于动态本体的有效可靠大语言模型智能体研究

Xiaohui Zhang, Zequn Sun, Chengyuan Yang, Yuanning Cui, Lingbing Guo, Wei Hu

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出OaK框架,通过动态构建优化面向任务的本体论,在TravelPlanner等数据集上验证其可提升LLM智能体的证据基础与多步推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22118 2026-08-25 cs.CL cs.IR 新提交 90%

RAG Collapse: LLM Responses Collapse When Retrieved Documents Are Self-Authored

RAG 坍缩:当检索到的文档为自主生成时,大语言模型(LLM)的响应会发生坍缩

Gregory Druck, Ethan Smith

机构 * Graphite Growth(石墨增长公司)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL

AI总结 该研究发现,当基于LLM的AI系统检索自身生成的参考资料时会发生RAG坍缩,经大量模拟实验证实79.6%的模拟会坍缩,且仅一份自主生成参考资料即可触发该现象。

Comments 36 pages, 31 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13976 2026-08-25 cs.CL cs.AI cs.CY cs.SI 版本更新 90%

Towards Safer Social Media Platforms: Scalable and Performant Few-Shot Harmful Content Moderation Using Large Language Models

打造更安全的社交媒体平台:基于大语言模型的可扩展且高效的少样本有害内容审核

Akash Bonagiri, Lucen Li, Rajvardhan Oak, Zeerak Babar, Magdalena Wojcieszak, Anshuman Chhabra

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 针对社交媒体有害内容审核的可扩展性与动态性不足问题,研究人员利用大语言模型通过上下文学习提出少样本审核方法,实验显示其优于现有基线与少样本方法,纳入视觉信息可提升性能,为线上审核提供新方案。

Comments Accepted to ICWSM 2027 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00209 2026-08-25 cs.LG cs.CL 版本更新 88%

Scaling Electronic Health Record Foundation Models for Population Health Management

面向人群健康管理的电子健康记录基础模型规模化研究

Liwen Sun, Hao-Ren Yao, Ophir Frieder, Xiang Qian, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgetown University(乔治城大学)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出面向人群健康管理的电子健康记录基础模型,跨500万患者数据预训练,在11项慢性病预测任务及EHRShot基准中表现优于同类模型,将开源代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21718 2026-08-25 cs.SE 新提交 88%

XRFix: Exploring Performance Bug Repair of Extended Reality Applications with Large Language Models

XRFix:利用大语言模型探索扩展现实应用的性能缺陷修复

Jingwen Wu, Hanyang Guo, Hong-Ning Dai, Xiapu Luo

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract)

AI总结 该研究针对XR应用性能缺陷修复的技术挑战,提出基于大语言模型的XRFix框架,构建缺陷数据集与定制检测工具,经实验验证其修复性能优于SOTA APR方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00013 2026-08-25 cs.CL cs.AI cs.CV 版本更新 87%

What Transfers from Text to Vision? Capability Scaling Laws and Transfer Dynamics for VLMs

从文本到视觉的可迁移性:视觉语言模型(VLM)的能力缩放定律与迁移动态

Ziran Li, Qiang Wang, Zhengyu Chen, Shanglin Lei, Borun Chen, Jingang Wang, Xunliang Cai

机构 * Meituan(美团) Tsinghua University(清华大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出首个跨家族的能力驱动多模态缩放定律,可通过LLM文本能力预测VLM性能,将主干选择从经验搜索转为定量决策,还揭示了LLM作为VLM主干的相关见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25698 2026-08-25 cs.LG cs.AI 版本更新 87%

How Should LLMs Consume High-Quality Data? Optimal Data Scheduling via Quality-Aware Functional Scaling Laws

LLM应如何消费高质量数据?通过质量感知的功能缩放定律实现最优数据调度

Zhitao Zhu, Xili Wang, Shizhe Wu, Jiawei Fu, Xiaoqing Liu

机构 * Peking University(北京大学) Meituan(美团)

专题命中 预训练与数据 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过引入数据质量维度扩展功能缩放定律,解析求解了联合数据质量和批次大小调度问题,揭示了高质量数据的双重角色,并提出了Drop-Stable-Rampup调度策略,在15B MoE模型上相比WSD和余弦衰减分别提升平均准确率+1.70和+2.98。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21462 2026-08-25 cs.CL cs.AI cs.LG 新提交 87%

CyrillicQA: The Influence of Phonetically Encoded Secret Language on LLM Performance

CyrillicQA:语音编码的秘密语言对大语言模型性能的影响

Erik Thureck, Leo S. Rdian

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学)

专题命中 预训练与数据 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究探讨大语言模型在处理拉丁字母标准语言时表现优异但对其他语言变体存在劣势的背景下,能否像人类一样解码语音编码的濒危语言,以评估其保护濒危语言的能力。

Comments 4 pages, in English; 4 pages, in German (original); German version originally published in: Rüdian, S. (2026). Prompt-Engineering in Education (1st ed., pp. 39-42). Humboldt-Universität zu Berlin. this https URL (https://doi.org/10.5281/zenodo.21413892)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23370 2026-08-25 cs.AI cs.LO 新提交 86%

Walking on the DARKSIDE

行走在DARKSIDE上

Aldo Gangemi, Emanuele Bottazzi

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出基于POLANYI++的DARKSIDE连贯性审计方法,以OWL2格式的扩展知识图谱为基础,通过凭证轴分类指称对象并设置升级规则,在BSBench上验证其可缩小LLM的模式与路径结构差距,提升对无意义输入的检测能力。

Comments 20 pages, 2 figures, several tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12149 2026-08-25 cs.CL 版本更新 86%

Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus

混合线性注意力大语言模型中的大规模激活:注意力前峰值与峰间平台期

Zunhai Su, Bohan Sun, Xialie Zhuang, Shuibai Zhang, He Xiao, Jing Xiong, Hengyuan Zhang, Zhongzhu Zhou, Tiantian Zhang, Ngai Wong, Chuan-Wei Kuo

机构 * Startlux(星创公司) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) The University of Hong Kong(香港大学) University of Sydney(悉尼大学) Columbia University(哥伦比亚大学)

专题命中 预训练与数据 :large language model(title);language model(title);pretraining(abstract);分类 cs.CL

AI总结 本研究系统揭示混合线性注意力大语言模型中大规模激活的两种形态,证实其在多架构、多配置等场景下的重复性,明确其对输出门控的响应规律及机制,为相关模型优化提供依据。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12811 2026-08-25 cs.CL 版本更新 86%

ConvergeWriter: Data-Driven Bottom-Up Article Construction

ConvergeWriter:数据驱动的自下而上文章构建

Binquan Ji, Jiaqi Wang, Ruiting Li, Xingchen Han, Yiyang Qi, Shichao Wang, Yifei Lu, Yuantao Han, Feiliang Ren

机构 * Binquan Ji, Jiaqi Wang, Ruiting Li, Xingchen Han, Yiyang Qi, Shichao Wang, Yifei Lu, Yuantao Han, Feiliang Ren(作者)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有LLM生成长篇文档的问题,提出自下而上的ConvergeWriter框架,通过检索聚类构建知识基础,减少幻觉,在14B、32B模型上性能优于或比肩基准,适用于高保真知识场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07669 2026-08-25 cs.CL cs.AI 版本更新 85%

DiaLLM: An Investigation into the Robustness-Generation Gap in English Dialect Adaptation

DiaLLM:英语方言适应中稳健性-生成差距的研究

Jordan Painter, Dipankar Srirag, Adarsh Kappiyath, Diptesh Kanojia, Aditya Joshi, Lu Yin

机构 * Institute for People-Centered AI, University of Surrey(萨里大学以人为本人工智能研究所) University of New South Wales(新南威尔士大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 研究英语方言适应中稳健性与生成的差距,通过DiaLLM持续预训练并结合多种策略对比不同英语变体。发现二者分离,特定变体适应产出受青睐但优化奖励方法未获评估者偏爱,缩小差距需丰富奖励设计和投入方言资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22796 2026-08-25 eess.AS cs.SD 新提交 85%

DiaScriber: A Speech LLM for Joint Diarization and Transcription in Multi-Speaker Scenarios

DiaScriber:面向多说话人场景的联合说话人 diarization(语音分割)与转录的语音大语言模型

Bingshen Mu, Xian Shi, Xiong Wang, Zhifang Guo, Ting He, Xize Cheng, Yu Xi, Jin Xu, Lei Xie

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本研究提出基于Qwen3.5-Omni的端到端多说话人 diarization与转录模型DiaScriber,通过构建多样数据流程与三阶段训练策略,在多说话人场景测试集上性能优于对比方法且泛化能力出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23358 2026-08-25 cs.CL 新提交 84%

The Geometry of Low-Resource Language Representations

低资源语言表示的几何特性

Francois Meyer, Jan Buys

机构 * University of Cape Town(开普敦大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);pretraining(abstract);分类 cs.CL

AI总结 本研究从表示几何角度探究LLM中低资源与高资源语言的性能差异,发现低资源语言存在表示退化,提出几何正则化方法,实验表明该方法可降低退化并提升性能,为低资源语言CPT提供可行策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21712 2026-08-25 cs.AI cs.MA 新提交 84%

ATHENA: Knowledge-guided agentic neural architecture search for AutoFormer-based electronic health record modeling

ATHENA:面向基于AutoFormer的电子健康记录建模的知识引导型智能体神经架构搜索

Deyi Li, Qi Xu, Lingyao Li, Tiansheng Wang, Muxuan Liang, Mei Liu

机构 * University of Florida(佛罗里达大学) University of Arizona(亚利桑那大学) University of Houston(休斯顿大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本研究提出知识引导型智能体NAS框架ATHENA,通过跨医院复用架构知识,在6项临床预测任务的12项评估中9项优于或匹配基线方法,可减少Transformer型EHR建模的手动架构调整。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21792 2026-08-25 cs.AI cs.CV cs.IR cs.LG 新提交 82%

HIRA: A Human-in-the-Loop Retrieval-Augmented Cascade for Document Classification in Regulated Industries

HIRA:面向受监管行业文档分类的人在回路检索增强级联模型

Shangxuan Tian, Yanhui Chen, Carlos Queiroz

机构 * Standard Chartered Bank(渣打银行) OCBC(华侨银行)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 HIRA是面向受监管行业的无训练本地检索增强级联文档分类模型,结合多模态检索与本地LLM及人工审核,仅需少量人工修正即可大幅提升Macro-F1,减少LLM调用,性能接近全标注神谕模型。

Comments CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18904 2026-08-25 cs.SD cs.AI cs.CL eess.AS 交叉投稿 82%

MetaSICL: Globalizing Auditory LLMs for Underserved Speakers and Languages via Meta Speech In-Context Learning

MetaSICL: 通过元语音上下文学习适应听觉大语言模型

Haolong Zheng, Siyin Wang, Zengrui Jin, Mark Hasegawa-Johnson

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出MetaSICL方法,利用高资源语音数据通过元学习增强听觉大语言模型的上下文学习能力,在低资源场景下优于直接微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23143 2026-08-25 cs.CV 新提交 82%

An end-to-end-trained vision-language model for native-language prostate pathology report generation

用于生成本土语言前列腺病理报告的端到端训练视觉-语言模型

Christian Grashei, Fabian Gülhan, Maximilian Legnar, Fabian Stögbauer, Cleo-Aron Weis, Carolin Mogler, Peter Schüffler

机构 * Technical University of Munich(慕尼黑工业大学) Munich Data Science Institute(慕尼黑数据科学研究所) Munich Center for Machine Learning(慕尼黑机器学习中心) University Hospital Heidelberg(海德堡大学医院) Heidelberg University(海德堡大学) Interdisciplinary Center for Scientific Computing (IWR)(跨学科科学计算中心(IWR))

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract)

AI总结 该研究提出语言独立的切片级视觉-语言框架,用自动化流水线生成17344对图像-文本对,实现德语前列腺病理报告生成,恶性肿瘤检测F1达96.2%,可支持机构用自有档案训练本土语言报告模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08649 2026-08-25 cs.LG cs.CE cs.CL cs.IR q-fin.CP 版本更新 81%

PRAGMA: Revolut Foundation Model

PRAGMA:Revolut 基础模型

Maxim Ostroukhov, Ruslan Mikhailov, Vladimir Iashin, Artem Sokolov, Andrei Akshonov, Vitaly Protasov, Andrey Goncharov, Dmitrii Beloborodov, Vince Mullin, Roman Yokunda Enzmann, Georgios Kolovos, Jason Renders, Pavel Nesterov, Anton Repushko

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.CL、cs.LG

AI总结 PRAGMA是一种多源银行事件序列的基础模型,通过预训练Transformer架构实现金融记录的自监督学习,适用于信用评分、欺诈检测等任务,提供通用金融应用的表示层。

Comments [v2]: adds extra ablations and results; related work improvements

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17187 2026-08-25 stat.ME stat.OT 版本更新 80%

Identifying Model Quality Effects on User Engagement: A Within-Version Causal Estimator with Synthetic Data Validation

识别模型质量对用户参与度的影响:一种结合合成数据验证的版本内因果估计器

John Tribbia

专题命中 预训练与数据 :LLM(summary_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM模型更新与用户参与度的因果识别难题,提出结合合成数据验证的版本内因果估计器,经衰减调整后可准确估计模型质量对参与度的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11250 2026-08-25 cs.CR cs.CV 版本更新 80%

Environmental Injection Attacks against GUI Agents in Realistic Dynamic Environments

针对现实动态环境中的GUI代理的环境注入攻击

Yitong Zhang, Ximo Li, Liyi Cai, Jia Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Computer Science, Peking University(北京大学计算机学院)

专题命中 预训练与数据 :LLM(summary_cn,abstract)

AI总结 本文提出Chameleon框架,通过LLM驱动的环境模拟和注意力黑洞机制,有效暴露GUI代理在动态环境中的隐藏漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20873 2026-08-25 cs.LG 版本更新 79%

In-Cell Learning: Deployed Language Models Can Learn New Knowledge Without Changing a Single Stored Bit

除模型外一切未变:CellFill——针对量化大语言模型的比特一致、可撤销更新的单元内受限学习

Zifeng Liu, Yaxin Lu, Xuanhan Wu, Zhiyong Du, Yiming Mao, Zhenhe Wang, Wenqi Shi, Zhengkun Jing, Linwei Liu

机构 * Institute for Frontier Interdisciplinary Research in Health Sciences and Technology, Sun Yat-sen University(中山大学健康科学与技术前沿交叉研究院) Guangdong Engineering Research Center of Medical Artificial Intelligence Multimodal System(广东省医学人工智能多模态系统工程研究中心) Sun Yat-sen University(中山大学) School of Business, Sun Yat-sen University(中山大学商学院) School of Computer Science, China University of Geosciences (Wuhan)(中国地质大学(武汉)计算机学院) School of Public Health, Sun Yat-sen University(中山大学公共卫生学院) Hospital of Stomatology, Sun Yat-sen University(中山大学口腔医院) Big Data and Artificial Intelligence Center, The Third Affiliated Hospital of Sun Yat-sen University(中山大学附属第三医院大数据与人工智能中心)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 CellFill方法通过在量化决策单元内写入残差实现量化大语言模型的比特一致、可撤销更新,实验显示其在召回率接近基准的同时降低跨域遗忘,且可迁移至27B混合线性注意力模型。

Comments 35 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16469 2026-08-25 cs.CL 版本更新 79%

Dialects of Translationese Shape Language Model Learning

在翻译语中训练模型显示了词汇多样性与源-目标句法相似性如何塑造学习

Jenny Kunz

机构 * Department of Computer and Information Science(计算机与信息科学系) Linköping University(林雪平大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本文研究了在不同源语言翻译的机器翻译数据上训练模型,探讨词汇多样性和源-目标句法相似性如何影响模型学习与语言建模。

Comments To appear at the Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23391 2026-08-25 cs.CL cs.AI 新提交 73%

Cross-Domain, Multi-Task Data-to-Text Generation without In-Domain Training Data

无域内训练数据的跨域多任务数据到文本生成

Yifei Song, Kun Efimov-Zhang, Claire Gardent

机构 * CNRS/LORIA(法国国家科学研究中心/洛林计算机科学与应用实验室) Université de Lorraine(洛林大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出数据驱动知识蒸馏(DDKD)及保结构增强方法,在无域内训练数据的跨域多任务数据到文本生成任务中,17亿参数的DDKD性能优于零样本推理与微调,且构建了QUINTD-5数据集。

Comments Accepted by EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22071 2026-08-25 cs.CL cs.AI 新提交 73%

Real-TurnTurk: A Multimodal Turkish Corpus for Turn-Taking Prediction

Real-TurnTurk:用于话轮转换预测的多模态土耳其语语料库

Ahmet Tuğrul Bayrak, Fatma Nur Korkmaz, Bekir Berker Türker, Mustafa Sertaç Türkel, Alper Kaplan

机构 * Data Science and Innovation Ata Technology Platforms(阿塔技术平台数据科学与创新部) Digital Operations and Data(数字运营与数据部)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究构建多模态土耳其语对话数据集,采用遗传算法优化规则,实现话轮转换预测,填补土耳其语相关自然对话语料库的空白。

Comments Accepted to INTCEC 2026. This is the author's pre-print version. The final authenticated version will be available through the conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21702 2026-08-25 cs.AI cs.CL 新提交 73%

From Association to Causation: Improving Retrieval Precision of Retrieval-Augmented Generation via Causal Relations and an Attention Mechanism

从关联到因果:通过因果关系与注意力机制提升检索增强生成的检索精度

Jing Liu, Yongxing Qi, Muchen Jiang, Chengnan Hu, Qingqing Peng, Haoming Wang, Yuqing Wang, Yang Yu, Xu Zhang, Ting Wu

机构 * Hangzhou Innovation Institute, Beihang University(北京航空航天大学杭州创新研究院)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究针对RAG检索阶段仅捕捉关联关系的问题,通过建模检索过程的因果结构,提出一种无需训练的注意力式重评分规则,在企业知识库和关键词堆砌语料库上显著提升了检索精度。

Comments 16 pages, 2 figures, 4 tables, 1 algorithm. Code available at this https URL (https://github.com/Silk-Road/causal-rag-rerank)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12750 2026-08-25 cs.CL cs.AI cs.HC 版本更新 73%

PatientAct: Theory-Grounded Mental Health Client Simulation

PatientAct:基于理论的心理健康来访者模拟

Sahand Sabour, TszYam NG, Yaqian Chen, Guanqun Bi, Jialu Zhao, Minlie Huang

机构 * Tsinghua University(清华大学) Beijing Normal University(北京师范大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 PatientAct是基于临床理论的来访者模拟框架,通过整合5Ps临床案例 formulation与带信任阈值的动态记忆层,生成高临床合理性的多样化来访者,在40种临床情境中较基线方法显著提升了抗拒质量与行为真实性。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏