arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 391 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 391 篇

2411.07175 2026-06-29 cs.CL 版本更新 83%

Continual Memorization of Factoids in Language Models

语言模型中事实的持续记忆

Howard Chen, Jiayi Geng, Adithya Bhaskar, Dan Friedman, Danqi Chen

机构 * Princeton Language and Intelligence (PLI), Princeton University(普林斯顿大学普林斯顿语言与智能研究所)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 提出持续记忆任务,发现语言模型在后续微调中严重遗忘事实,并提出REMIX方法(混合随机词序列或预训练语料)缓解遗忘,优于回放等方法。

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12306 2026-06-16 cs.CL 版本更新 83%

A large-scale pipeline for LLM-assisted corpus annotation: variation and change in the English consider construction

基于大语言模型的大规模语料标注流水线:英语consider构式的变异与变化

Cameron Morin, Matti Marttinen Larsson

机构 * Université Paris-Cité(巴黎-城市大学) University of Gothenburg(哥德堡大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一种利用大语言模型自动标注大规模语料的四阶段流水线,在历史英语语料库中标注14万条consider构式,准确率超98%,揭示未记录的体裁特异性变化轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08920 2026-06-09 q-bio.BM cs.AI 版本更新 83%

AMix-1: A Pathway to Test-Time Scalable Protein Foundation Model

AMix-1: 迈向测试时可扩展的蛋白质基础模型

Changze Lv, Jiang Zhou, Siyu Long, Lihao Wang, Jiangtao Feng, Dongyu Xue, Yu Pei, Hao Wang, Zherui Zhang, Yuchen Cai, Zhiqiang Gao, Ziyuan Ma, Jiakai Hu, Chaochen Gao, Jingjing Gong, Yuxuan Song, Shuyi Zhang, Xiaoqing Zheng, Deyi Xiong, Lei Bai, Wanli Ouyang, Ya-Qin Zhang, Wei-Ying Ma, Bowen Zhou, Hao Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Generative Symbolic Intelligence Lab (GenSI), Tsinghua University(生成符号智能实验室(GenSI),清华大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) Tsinghua University(清华大学) Fudan University(复旦大学) Tianjin University(天津大学) Georgia Institute of Technology(佐治亚理工学院) Beijing University of Posts and Telecommunications(北京邮电大学) University of Chinese Academy of Sciences(中国科学院大学) City University of Hong Kong(香港城市大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 提出基于贝叶斯流网络的蛋白质基础模型AMix-1,通过预训练缩放律、涌现能力分析、上下文学习机制和测试时缩放算法,实现1.7B参数模型,并设计出活性提高50倍的AmeR变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00541 2026-06-08 cs.LG 版本更新 83%

One Loss to Rule Them All: Marked Time-to-Event for Structured EHR Foundation Models

一个损失统治一切:结构化EHR基础模型的标记时间到事件

Zilin Jing, Vincent Jeanselme, Yuta Kobayashi, Simon A. Lee, Chao Pang, Aparajita Kashyap, Yanwei Li, Xinzhuo Jiang, Shalmali Joshi

机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系) Department of Biomedical Informatics, Columbia University(哥伦比亚大学生物医学信息学系) Department of Computational Medicine, UCLA(洛杉矶大学计算医学系) Formation Bio

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 提出ORA预训练目标,联合建模事件时间和关联测量,相比下一词预测和忽略连续测量的损失,在多个数据集和下游任务上产生更通用的表示,提升回归和时间到事件预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16023 2026-06-08 cs.LG cond-mat.mtrl-sci 版本更新 83%

A Conformation-Centric Generative Foundation Model for Linear Polymer Modeling and Design

面向线性聚合物建模与设计的构象中心生成式基础模型

Fanmeng Wang, Ruochao Wang, Shan Mei, Wentao Guo, Hongshuai Wang, Qi Ou, Zhifeng Gao, Hongteng Xu

机构 * Gaoling School of Artificial Intelligence(人工智能学院) Renmin University of China(中国人民大学) DP Technology(DP技术) SINOPEC Research Institute of Petroleum Processing Co., Ltd.(中石油加工研究院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 提出PolyConFM基础模型,通过构象中心生成预训练(条件生成、掩码自回归建模和方向变换)来建模线性聚合物,在多种下游任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22533 2026-08-19 cs.LG cs.AI quant-ph 版本更新 82%

TabularQGAN: A quantum generative model for tabular data synthesis

TabularQGAN:一种用于表格数据合成的量子生成模型

Pallavi Bhardwaj, Caitlin Jones, Lasse Dierich, Aleksandar Vučković

机构 * SAP SE(SAP公司) BASF Digital Solutions(巴斯夫数字解决方案) QUTAC Quantum Technology and Application Consortium(QUTAC量子技术与应用联盟) Technical University of Munich CIT(慕尼黑技术大学CIT) Ludwig-Maximilians-Universität München(慕尼黑路德维希-马克西米利安大学) Merck KGaA(默克公司)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出新型量子生成对抗网络TabularQGAN,针对异构表格数据建模,在MIMIC-III等数据集上与经典及LLM方法对比,取得有竞争力甚至领先的合成性能,验证了其泛化能力。

Comments 19 pages,8 figures and 4 tables

Journal ref Sci. Rep. 16, 23555 (2026)1-19

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18904 2026-08-10 cs.SD cs.AI cs.CL 版本更新 82%

MetaSICL: Globalizing Auditory LLMs for Underserved Speakers and Languages via Meta Speech In-Context Learning

MetaSICL: 通过元语音上下文学习适应听觉大语言模型

Haolong Zheng, Siyin Wang, Zengrui Jin, Mark Hasegawa-Johnson

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出MetaSICL方法,利用高资源语音数据通过元学习增强听觉大语言模型的上下文学习能力,在低资源场景下优于直接微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09504 2026-07-24 cs.CR cs.AI cs.LG 版本更新 82%

AI Security Policy Should Assess Systems, Not Only Models

位置:AI安全政策应针对系统,而非模型

Michael A. Riegler, Inga Strümke

机构 * AI Safety Department(人工智能安全部门) SimulaMet and OsloMet(SimulaMet和奥斯陆计量)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出swarm-attack框架,展示通过协调轻量级LLM代理发现系统漏洞和绕过安全机制的可能性,证明在低成本硬件上可实现零成本安全测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01736 2026-06-09 cs.CL cs.AI 版本更新 82%

Argument Collapse: LLMs Flatten Long-Form Public Debate

论点坍缩:LLMs 扁平化长篇公共辩论

Yekyung Kim, Yapei Chang, Chau Minh Pham, Mohit Iyyer

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 研究大型语言模型在生成公共辩论文本时导致论点坍缩的现象,即不同模型生成的论文在主要论点、子论点和段落结构上趋于收敛,通过对比人类与LLM生成文本发现LLM的论点多样性显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06647 2026-06-08 cs.IR cs.AI cs.LG 版本更新 82%

Superintelligent Retrieval Agent: The Next Frontier of Agentic Retrieval

超级智能检索代理:代理检索的下一个前沿

Zeyu Yang, Qi Ma, Jason Chen, Anshumali Shrivastava

机构 * Meta Superintelligence Labs(Meta超级智能实验室) Rice University(里士满大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出SIRA,通过单次语料判别性检索压缩多轮探索,利用LLM丰富文档词汇、预测查询缺失词汇并基于语料统计过滤,在BEIR基准上取得最强平均检索性能,并在下游QA任务中超越RL训练的代理系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00691 2026-08-21 cs.CV 版本更新 82%

Silhouette-based Gait Foundation Model

基于轮廓的步态基础模型

Dingqiang Ye, Chao Fan, Kartik Narayan, Bingzhe Wu, Chengwen Luo, Jianqiang Li, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) Shenzhen University(深圳大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 FoundationGait是首个可扩展的自监督预训练框架,用于步态理解,通过大规模预训练在多个数据集上实现稳健的步态识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20817 2026-08-19 cs.CL cs.AI cs.LG 版本更新 82%

Convergent Evolution: How Different Language Models Learn Similar Number Representations

趋同进化:不同语言模型如何学习相似的数字表示

Deqing Fu, Tianyi Zhou, Mikhail Belkin, Vatsal Sharan, Robin Jia

机构 * University of Southern California(南加州大学) UC San Diego(圣地亚哥大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了不同语言模型如何通过不同训练信号学习相似的数字表示,揭示了特征学习中的趋同进化现象。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05903 2026-08-10 cs.CV cs.RO 版本更新 82%

Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models

Robust-WAM:桥接生成式预训练与世界-动作模型中的语义前瞻

Haodong Yan, Junfeng Li, Junjie He, Zhide Zhong, MingMing Yu, Wenxuan Song, Jiaguan Zhu, Yangyang Zheng, Yuqiao Du, Jiadi You, Yingjie Cai, Xu Yan, Guanyi Zhao, Bingbing Liu, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beihang University(北京航空航天大学) Huawei Foundation Model Department(华为基础模型部门)

专题命中 预训练与数据 :pretraining(title,abstract);post-training(abstract)

AI总结 Robust-WAM是一种通用后训练方法,在保留VAE生成路径的同时添加语义前瞻对齐,可提升多个WAM基线在分布外条件下的动作预测成功率且不损失分布内性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08164 2026-07-28 cs.CV 版本更新 82%

How Much MRI Preprocessing Is Enough? A Cost-Utility Study for Brain MRI Foundation Models

MRI预处理需要多少才够?脑MRI基础模型的成本效用研究

Jiangshuan Pang, Wangyang Tang, Jing Yan, Zhixuan Cheng, Youzhe He, Yiting Deng, Zhenkun Zhuang, Shiping Liu

机构 * University of the Chinese Academy of Sciences(中国科学院大学) BGI Research(华大研究院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本研究通过比较P0-P7预处理级别对自监督3D MRI预训练的影响,发现并非预处理越强越好,P2是最低成本可行级别,更强预处理仅在特定任务中带来有限提升,且下游可补偿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18821 2026-07-24 cs.PL 版本更新 82%

VirtualSet: Typed Ontology Worlds as an LLM Generation Target for Grounded Queries and Guarded Decisions

虚拟集:作为大语言模型生成目标的类型化本体世界,用于有根据的查询和有保障的决策

Qunhui Zhang

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract)

AI总结 针对大语言模型操作企业数据时SQL错误信号延迟的问题,提出VirtualSet,通过集合表达式、通用约束投影等技术实现有根据的查询和有保障的决策,在实验中展现出优势,在SQL基准测试中保持竞争力。

Comments 21 pages, 13 figures, 1 table; added a reference to the companion GCP paper (arXiv:2607.19693) and aligned GCP terminology; results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08639 2026-07-17 cs.RO cs.CV 版本更新 82%

Native Video-Action Pretraining for Generalizable Robot Control

用于可泛化机器人控制的原生视频动作预训练

Qihang Zhang, Lin Li, Luyao Zhang, Shuai Yang, Yiming Luo, Shuaiting Li, Ruilin Wang, Junke Wang, Jiahao Shao, Gangwei Xu, Jiaming Zhou, Yishu Shen, Yudong Jin, Fangyi Xu, Shuailei Ma, Jiaqi Liao, Guanxing Lu, Zifan Shi, Yongkun Wen, Yujie Zhao, Weixuan Tang, Xinyang Wang, Chaojian Li, Jiapeng Zhu, Ka Leong Cheng, Nan Xue, Xing Zhu, Yujun Shen, Yinghao Xu

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract)

AI总结 研究针对机器人控制中视频动作模型应用于物理环境的不足,提出LingBot-VA 2.0,通过语义视觉动作分词器等四个核心设计原则构建基础模型,经真实世界部署验证其在复杂操作任务中的少样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08949 2026-07-16 cs.CR cs.SE 版本更新 82%

SeedSmith: LLM-Driven Seed Synthesis for Directed Fuzzing

SeedSmith:用于定向模糊测试的基于大语言模型的种子合成

Junmin Zhu, Siyu Liu, Jie Hu, Fabio Gritti, Ati Priya Bajaj, Hulin Wang, Wenbo Guo, Tiffany Bao, Christopher Kruegel, Giovanni Vigna

专题命中 预训练与数据 :LLM(title,abstract);prompting(abstract)

AI总结 研究针对定向模糊测试常无法触发崩溃的问题,提出SeedSmith这一基于大语言模型的管道,通过复制分析师工作流程合成种子,提升模糊器性能,在Magma和ARVO上取得显著加速和发现新漏洞的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19802 2026-07-16 cs.CV 版本更新 82%

Evaluating Vision Foundation Models for Pixel and Object Classification in Microscopy

评估显微镜中用于像素和物体分类的视觉基础模型

Carolin Teuber, Anwai Archit, Tobias Boothe, Peter Ditte, Jochen Rink, Constantin Pape

机构 * Georg-August-University Göttingen, Institute of Computer Science Department of Tissue Dynamics Regeneration, Max Planck Institute for Multidisciplinary Sciences, Göttingen Georg-August-University Göttingen, Faculty of Biology Psychology CAIMed - Lower Saxony Center for AI \& Causal Methods in Medicine, Göttingen Cluster of Excellence Multiscale Bioimaging (MBExC), Georg-August-University Göttingen

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文评估了视觉基础模型在显微镜像素和物体分类中的应用,探讨了其在提升分类性能方面的潜力,并建立了相关基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17390 2026-07-09 cs.CV 版本更新 82%

FMMC: Harnessing the Power of Foundation Models for Accurate Material Classification

利用基础模型提升材料分类的准确性

Qingran Lin, Fengwei Yang, Chaolun Zhu

机构 * Georgia Institute of Technology(佐治亚理工学院) Duke University(杜克大学) Waseda University(早稻田大学)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract)

AI总结 本文提出一种利用基础模型克服数据限制并提升分类准确性的新框架,通过生成高质量数据集和融合视觉语言模型先验知识,有效提高材料分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10547 2026-07-08 cs.SD 版本更新 82%

HeartMuLa: A Family of Open Sourced Music Foundation Models

HeartMuLa:一个开源音乐基础模型家族

Dongchao Yang, Yuxin Xie, Yuguo Yin, Zheyu Wang, Xiaoyu Yi, Gongxi Zhu, Xiaolong Weng, Zihan Xiong, Yingzhe Ma, Dading Cong, Jingliang Liu, Zihang Huang, Jinghan Ru, Rongjie Huang, Haoran Wan, Peixu Wang, Kuoxi Yu, Helin Wang, Liming Liang, Xianwei Zhuang, Yuanyuan Wang, Dingdong Wang, Haohan Guo, Junjie Cao, Zeqian Ju, Songxiang Liu, Yuewen Cao, Heming Weng, Yuexian Zou

机构 * HeartMuLa Teams(HeartMuLa团队)

专题命中 预训练与数据 :foundation model(title,abstract);LLM(abstract)

AI总结 介绍开源音乐基础模型家族HeartMuLa,含四个组件及两种特殊模式,能跨任务和模态推动音乐理解与生成,扩展到7B参数时有显著改进,可重现商业级系统,为未来研究提供基线并促进多模态应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27465 2026-06-18 q-bio.GN 版本更新 82%

Poisoning the Genome: Targeted Backdoor Attacks on DNA Foundation Models

基因组投毒:针对DNA基础模型的目标后门攻击

Charalampos Koilakos, Ioannis Mouratidis, Ilias Georgakopoulos-Soares

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract)

AI总结 本研究首次系统研究基因组语言模型的训练数据投毒,通过在预训练和微调阶段注入少于1%的对抗序列,可选择性破坏目标基因组上下文的生成性能,并实现条件后门攻击和下游任务分类破坏。

Comments 23 pages, double column format

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12678 2026-06-16 cs.CV cs.CY 版本更新 82%

No One Knows the State of the Art in Geospatial Foundation Models

没有人知道地理空间基础模型的现状

Isaac Corley, Nils Lehmann, Caleb Robinson, Gabriel Tseng, Anthony Fuller, Hamed Alemohammad, Evan Shelhamer, Jennifer Marcus, Hannah Kerner

机构 * Taylor Geospatial(泰勒地理空间公司) Technical University of Munich(慕尼黑技术大学) Microsoft AI for Good Research Lab(微软AI for Good研究实验室) Allen Institute for AI(艾伦人工智能研究所) Vector Institute(向量研究所) Carleton University(卡尔顿大学) Clark University(克拉克大学) University of British Columbia(不列颠哥伦比亚大学) Arizona State University(亚利桑那州立大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文指出地理空间基础模型缺乏标准化评估和训练协议,提出六项具体期望以促进社区共识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04061 2026-06-16 cs.RO cs.CV 版本更新 82%

CLAP: Contrastive Latent Action Pretraining for Learning Vision-Language-Action Models from Human Videos

CLAP: 从人类视频中学习视觉-语言-动作模型的对比潜在动作预训练

Chubin Zhang, Jianan Wang, Zifeng Gao, Yue Su, Tianru Dai, Cai Zhou, Jiwen Lu, Yansong Tang

机构 * Tsinghua University(清华大学) Astribot University of Hong Kong(香港大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :pretraining(title,abstract);post-training(abstract)

AI总结 提出CLAP框架,通过对比学习将人类视频与机器人动作词汇对齐,利用伪标签训练VLA模型,实现从人类视频到机器人执行的有效技能迁移。

Comments The code is available at: https://github.com/LinShan-Bin/OpenCLAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01747 2026-06-11 eess.SP 版本更新 82%

AnyPPG: An ECG-Guided PPG Foundation Model Trained on Over 100,000 Hours of Recordings for Holistic Health Profiling

AnyPPG:基于心电引导的PPG基础模型,在超过10万小时记录上训练,用于全面健康分析

Guangkun Nie, Xiaocheng Fang, Gongzheng Tang, Yujie Xiao, Jun Li, Bo Liu, Hongyan Li, Shenda Hong

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 提出AnyPPG,一种基于心电引导预训练的光电容积描记(PPG)基础模型,在超10万小时数据上训练,首次开展覆盖1468种疾病表型的全表型关联研究,证明PPG可超越传统心血管应用,对307种表型(含230种非循环系统疾病)实现有效判别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26661 2026-08-14 cs.AI 版本更新 81%

AgenticCANN: Automated Ascend C Operator Generation via Knowledge-Augmented Agentic Evolution

AgenticCANN:基于知识增强的智能体演化的自动昇腾C算子生成

Junhao Qiu, Zidong Wang, Yansong Sun, Zhitong Ma, Ping Guo, Qingfu Zhang

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对昇腾C算子生成的独特挑战,提出AgenticCANN知识增强智能体演化框架,在昇腾910B实验中实现高可行性与加速效果,验证了知识注入的通用性优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21597 2026-08-11 cs.SE cs.CL cs.IR 版本更新 81%

ATLAS: Agentic Taxonomy of Large-Scale Software Ecosystems

ATLAS: 大规模软件生态系统的智能体分类体系

Junyi Lu, Mengyao Lyu, Jiahui Wu, Lei Yu, Chengwei Liu, Fengjun Zhang, Li Yang, Chun Zuo, Yang Liu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Nankai University(南开大学) Sinosoft Company Limited(中软国际有限公司)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出ATLAS框架,结合LLM全局知识与实际仓库分布,通过智能体协作和自修正循环自动构建软件仓库的层次化分类体系,在54,387个GitHub仓库上评估,分类质量F1达83.13%,优于基线15个百分点。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04884 2026-08-07 cs.CL 版本更新 81%

Building Open-Retrieval Conversational Question Answering Systems by Generating Synthetic Data and Decontextualizing User Questions

通过生成合成数据和去语境化用户问题构建开放检索式对话问答系统

Christos Vlachos, Nikolaos Stylianou, Alexandra Fiotaki, Spiros Methenitis, Elisavet Palogiannidi, Themos Stafylakis, Ion Androutsopoulos

机构 * Department of Informatics, Athens University of Economics and Business(雅典经济与商业大学信息学院) Omilia - Conversational Intelligence(Omilia-对话智能) Archimedes, Athena Research Center(雅典研究中心Archimedes) NCSR Demokritos(德摩斯蒂斯国家研究中心)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 针对开放检索式对话问答数据集获取困难的问题,提出基于组织纯文本文档生成合成带标注对话的流程,训练问题重写器去语境化用户问题,结合LLM构建OR-CONVQA系统。

Comments Accepted at SIGDIAL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06835 2026-08-06 cs.CL 版本更新 81%

Translate-R1: Cost-Aware Translation Tool Use via Reinforcement Learning

Translate-R1:通过强化学习实现成本感知的翻译工具使用

Pratik Jayarao, Chaitanya Dwivedi, Himanshu Gupta, Neeraj Varshney, Adithya M Devraj, Meet Vadera, Priyanka Nigam, Bing Yin

机构 * Amazon Stores Foundation AI(亚马逊商店基金会人工智能)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);pretraining(abstract);分类 cs.CL

AI总结 提出一种基于强化学习的门控策略,让LLM自主评估理解能力,仅在必要时调用翻译工具,在22种语言上提升奖励并降低翻译成本。

Comments 14 pages main text plus appendix, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24941 2026-07-28 cs.SD cs.AI 版本更新 81%

EmotionAI: A Privacy-Preserving Computational Intelligence Pipeline for Speech-Emotion-Grounded Conversational Analysis

EmotionAI:一种面向语音情感驱动的对话分析的隐私保护计算智能流水线

Wai Laam Mak, Isibor Kennedy Ihianle, Pedro Machado

机构 * School of Science and Technology, Nottingham Trent University(诺丁汉特伦特大学科学与技术学院)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种完全本地的计算智能流水线,结合语音情感识别与生成式推理,实现隐私保护的对话情感分析,在RAVDESS数据集上达到48.8%准确率,零外部调用。

Comments 12 pages, 4 figures. Submitted to UK Workshop on Computational Intelligence (UKCI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00462 2026-07-23 cs.CV cs.AI 版本更新 81%

LatentLens: Revealing Highly Interpretable Visual Tokens in LLMs

LatentLens: 揭示大语言模型中高度可解释的视觉标记

Benno Krojer, Shravan Nayak, Oscar Mañas, Vaibhav Adlakha, Desmond Elliott, Siva Reddy, Marius Mosbach

机构 * University of Cambridge(剑桥大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出 LatentLens 方法,通过将视觉标记与文本语料库中的上下文标记表示进行最近邻匹配,实现视觉标记的可解释性,发现大多数视觉标记在各层均具有可解释性。

Comments ICML 2026 (Camera Ready)

详情

展开后加载摘要…

URL PDF HTML 收藏