arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-19 至 2026-08-19 共收录 294 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 30 篇

2608.17947 2026-08-19 cs.AI cs.LG cs.NE 新提交 73%

Procedural Content Metageneration via Program Search and Continual Abstraction Discovery

通过程序搜索与持续抽象发现实现过程式内容元生成

Matthew Siper, Ahmed Khalifa, Julian Togelius

机构 * New York University(纽约大学) University of Malta(马耳他大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究在推箱子等4款游戏中,提出持续抽象发现(CAD)方法,结合2×2实验,证实其可提升进化程序搜索的适应度,且学习到的库能被后续程序复用。

Comments Accepted for publication in IEEE Conference on Games 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17330 2026-08-19 cs.AI cs.CL cs.CY 新提交 73%

LLMs for Medical Consultation Are Evaluated Too Late: The Preformulation Gap

用于医疗咨询的大语言模型评估时机过晚:预 formulation 差距

Yining Hua, Cyrus Ayubcha, Hongbin Na, Levi Lian, Alon Gorenshtein, Yiftach Barash, Eyal Klang

机构 * Harvard T.H. Chan School of Public Health(哈佛陈曾熙公共卫生学院) Harvard Medical School(哈佛医学院) Australian Artificial Intelligence Institute, University of Technology Sydney(悉尼科技大学澳大利亚人工智能研究所) Raycaster Beth Israel Deaconess Medical Center(贝斯以色列女执事医疗中心)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究指出医疗咨询LLMs评估时机过晚的预 formulation 差距,通过实验发现指导条件可调整咨询流程与记录,建议直接以首次接触行为评估该差距。

Comments 17 pages, 3 tables. Code, cases, prompts, complete transcripts, and results: https://github.com/ningkko/preformulation-gap

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25459 2026-08-19 cs.CL cs.LG 版本更新 73%

SimulRAG: Simulator-based RAG for Grounding LLMs in Long-form Scientific QA

SimulRAG:基于模拟器的检索增强生成(RAG)框架,用于将大型语言模型(LLMs)落地到长篇科学问答任务中

Haozhou Xu, Dongxia Wu, Matteo Chinazzi, Ruijia Niu, Rose Yu, Yi-An Ma

机构 * University of California San Diego(加州大学圣迭戈分校) Stanford University(斯坦福大学) Northeastern University(东北大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对LLMs在长篇科学问答中易幻觉的问题,本文提出SimulRAG框架,引入UE+SBA机制,发布相关基准,实验表明其信息量与事实性较基线分别提升30.4%、16.3%

Comments Haozhou Xu and Dongxia Wu are co-first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16919 2026-08-19 cs.IR cs.AI 新提交 70%

CARA: Cognitive Adaptive Recommendation Agent

CARA:认知自适应推荐智能体

Weijun Gao, Jinyang Dong, Chuanru Ren, Hengxiao Li

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有推荐方法未明确建模用户偏好转化为决策的局限,提出认知自适应推荐框架CARA,经亚马逊评论实验,其多数指标性能最优,较基线相对提升最高达10.15%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26369 2026-08-19 cs.LG 版本更新 70%

ClockRoPE: Random Fourier Rotations for Temporal Routine Modeling

ClockRoPE:用于时序常规建模的随机傅里叶旋转

Yiwen Chen, Joshua Ainslie, Krzysztof Choromanski, Xiang Gao, Su-Lin Wu, Yiping Yuan, Qian Sun

机构 * Google DeepMind(谷歌DeepMind) YouTube(优兔)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 ClockRoPE基于随机傅里叶旋转理论提出,用于序列推荐的时序常规建模,经在线A/B测试可提升参与度指标,已部署于大型视频平台的生成式检索系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06458 2026-08-19 cs.IR cs.CV cs.LG 70%

PixRec: Leveraging Visual Context for Next-Item Prediction in Sequential Recommendation

PixRec: 利用视觉上下文进行序列推荐中的下一项预测

Sayak Chakrabarty, Souradip Pal

机构 * Department of Computer Science, Northwestern University(北western大学计算机科学系) Elmore Family School of Electrical and Computer Engineering(电气与计算机工程学院)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 PixRec通过整合视觉信息提升序列推荐的准确性,利用视觉-语言模型在电子商务中实现更精准的下一项预测。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17075 2026-08-19 cs.CL cs.AI 新提交 62%

Foundation Agents Meet Agentic Deep Research: Evidence-Grounded Clinical Code Forecasting

基础智能体与智能型深度研究结合:基于证据的临床代码预测

Junda Wang, Meysam Ghaffari, Akshat Choube, Mohsen Sharifi Renani, Hong Yu, Carlos Morato

专题命中 领域大模型 :foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ICD-Deepresearch工作流,结合EHR基础模型、语言基础模型与医学搜索工具,在MIMIC-III、MIMIC-IV数据集上实现ICD编码预测,其检索证据的医生有用性评分优于对比系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03553 2026-08-19 cs.AI cs.CL cs.DL 版本更新 62%

Chronos: The AI Co-Historian

迈向AI历史学家:从原始资料中进行代理信息提取

Lorenz Hufe, Niclas Griesshaber, Gavin Greif, Sebastian Oliver Eck, Pieter Francois, Wojciech Samek, Christian Schroeder de Witt, Philip Torr

机构 * Torr Vision Group, Department of Engineering Science, University of Oxford(牛津大学工程科学系托尔视觉组) Oxford Centre for Economic and Social History, University of Oxford(牛津大学牛津经济与社会史中心) Faculty of Music, University of Oxford(牛津大学音乐学院) Fraunhofer HHI(弗劳恩霍夫海因里希·赫兹研究所)

专题命中 领域大模型 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文介绍Chronos项目首个模块,通过自然语言交互将历史文献图像转化为数据,允许历史学家自定义流程、评估模型性能并迭代优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11210 2026-08-19 cs.AI cs.MA cs.SE 版本更新 57%

Distribird: Literature-Informed Prior Distribution Design for Bayesian Model Calibration

Distribird:用于贝叶斯模型校准的文献先验分布设计

Patrik P. Süli, György Eigner, Roland Hollós

机构 * Obuda University(欧布达大学) Biomatics and Applied Artificial Intelligence Institute, John von Neumann Faculty of Informatics, Obuda University(欧布达大学约翰·冯·诺依曼信息学院生物信息学与应用人工智能研究所) Physiological Controls Research Center, Obuda University(欧布达大学生理控制研究中心) HUN-REN Centre for Agricultural Research(HUN-REN农业研究中心) Czech Academy of Sciences(捷克科学院)

专题命中 领域大模型 :LLM(abstract);分类 cs.AI

AI总结 Distribird是一款自动化文献先验分布设计的智能体网络应用,通过多智能体流程生成贝叶斯模型校准所需先验,在24个跨领域参数上验证,其先验质量与单提示基线相当,且具备可追溯性、拒绝越权请求及本地运行的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17451 2026-08-19 cs.HC 新提交 50%

From Substitution to Scaffolding: Breaking the Self-Reinforcing Harm Cycle of AI in Education (and Beyond)

从替代到支架:打破教育领域(及其他领域)中AI的自我强化伤害循环

Lucile Favero, Juan Antonio Pérez-Ortiz, Tanja Käser, Nuria Oliver

专题命中 领域大模型 :prompting(abstract)

AI总结 本文针对AI在教育领域的自我强化伤害风险,提出“支架,而非替代”的设计原则,其诉求与学习科学原则契合,该原则或可推广至其他领域,旨在开发培养人类能力的AI系统。

Comments accepted to ACM AI Leadership Summit

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17427 2026-08-19 cs.CV 新提交 50%

Counterfactual Anatomy-guided Spatial-Temporal Decoding for Annotation-Free Hallucination Mitigation in Medical VLMs

用于医学视觉语言模型无注释幻觉缓解的反事实解剖学引导时空解码

Yifan Lu, Adinath Dukre, Abhijit Das, Ziyun Zou, Haolin Yang, Yutong Xie, Imran Razzak

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) MedOS

专题命中 领域大模型 :language model(abstract)

AI总结 该研究提出无需人工注释的CAST框架,通过自动选择解剖区域结合对比解码,在SLAKE和MIMIC-CXR数据集上针对三种Med-VLMs实现优于基线的幻觉缓解,提升了医学视觉语言模型的空间接地性。

Comments Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16899 2026-08-19 cs.CY cs.LO 新提交 50%

DOMtutor: Automated Autograding for Logic in Computer Science

DOMtutor:面向计算机科学逻辑的自动自动评分系统

Tobias Meggendorfer

专题命中 领域大模型 :prompting(abstract)

AI总结 本文针对理论计算机科学课程作业人工评分反馈滞后、缺乏实践检验的问题,提出将自动评分系统DOMjudge用于理论课程,开发了DOMtutor,可提供即时反馈与实践经验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15583 2026-08-19 cs.HC 版本更新 50%

Process-Oriented Evaluation of AI-Assisted Scientific Writing

面向过程的AI辅助科学写作评估

Patrick Queiroz Da Silva, Sanchaita Hazra, Doeun Lee, Sachin Kumar, Bodhisattwa Prasad Majumder

专题命中 领域大模型 :language model(abstract)

AI总结 通过分析869次击键级编辑日志,研究人类在激励下修改AI生成与人类撰写的摘要时的编辑行为,发现AI摘要句子层面能动性高但全局连贯性差,专家在知晓AI来源时表现出污名化行为,语言模型改进编辑但全局连贯性仍不足。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 知识编辑与模型理解 18 篇

2608.17084 2026-08-19 cs.CL 新提交 90%

Uncertainty-Aware Decision Making in Multimodal Large Language Models

多模态大语言模型中的不确定性感知决策

Abderrahmene Boudiaf, Irfan Hussain, Sajid Javed

机构 * Khalifa University of Science and Technology(哈利法科技大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本调查围绕决策中心框架,综述多模态大语言模型(MLLMs)的不确定性感知决策相关研究,对比同类调查并指出源感知分解等开放问题,核心是不确定性需改善多模态证据下的系统行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13333 2026-08-19 cs.AI 版本更新 89%

LLM-Guided Graph Generation for Structure-Based Local Improvement Methods

基于大语言模型引导的图生成的基于结构的局部改进方法

Hai Xia, Vaidyanathan Peruvemba Ramaswamy, Stefan Szeider

机构 * TU Wien(维也纳技术大学)

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);prompting(abstract);分类 cs.AI

AI总结 该研究构建了适用于MiniZinc格式问题的自动流程,引导LLM生成图生成器以辅助SLIM框架,在20个MiniZinc竞赛问题上使算法选择胜率大幅提升,证明LLM语义生成可实现高效的约束优化自动特征提取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16470 2026-08-19 cs.CL cs.AI 88%

Machine Translation Hallucination Detection for Low and High Resource Languages using Large Language Models

Kenza Benkirane, Laura Gongas, Shahar Pelles, Naomi Fuchs, Joshua Darmon, Pontus Stenetorp, David Ifeoluwa Adelani, Eduardo Sánchez

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Authors Kenza Benkirane and Laura Gongas contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17287 2026-08-19 cs.SE 版本更新 88%

RBCTest: Leveraging LLMs to Mine and Verify Oracles of API Response Bodies for RESTful API Testing

RBCTest: 利用LLMs挖掘和验证RESTful API响应体的Oracle

Hieu Huynh, Tri Le, Tu Nguyen, Viet Nguyen, Vu Nguyen, Tien N. Nguyen

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 RBCTest利用LLM挖掘RESTful API响应体约束并验证Oracle,提高API测试的自动化和准确性。

Comments ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13538 2026-08-19 cs.CL 版本更新 86%

SAEVerbalizer: Generating Explanations for Sparse Autoencoder Features via Representation Verbalization

SAEVerbalizer:通过表示 verbalization 为稀疏自编码器特征生成解释

Weihan Meng, Hongzhu Guo, Yi Jing, Dewen Liu, Zijun Yao, Xiaozhi Wang, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学) Peking University(北京大学) Fudan University(复旦大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出 SAEVerbalizer 框架,通过微调 LLM 下游层生成 SAE 特征的自然语言解释,解决了传统解释方法的表面性与低效率问题,其 verbalization 能力可泛化、迁移并扩展到不同 LLM 的 SAE 特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17848 2026-08-19 cs.LG cs.SI 新提交 83%

MoRAX: Mobility-based Representation Augmentation for Geospatial Foundation Models

MoRAX:面向地理空间基础模型的基于移动性的表示增强方法

Ya Wen, Jixuan Cai, Yulun Zhou, Alec Kirkley

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 MoRAX是增强地理空间基础模型的轻量级框架,利用人类移动性数据补充区域功能结构,其教师模型在多国多城市的八项预测任务中优于基线,学生模型性能接近教师,可实现零样本部署与跨国家迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16970 2026-08-19 cs.CR cs.AI cs.LG 新提交 82%

Probing the Prefill: Detecting Code Vulnerabilities via Latent Activations

探测预填充:通过潜在激活检测代码漏洞

Alizishaan Khatri

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 该研究从四个LLM提取预填充标记激活训练MLP探测器,在四个代码漏洞基准上实现平均F1值41.7%,证明LLM自身代码表示含漏洞信息,为轻量原生筛查提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17544 2026-08-19 eess.SP 新提交 82%

Channel2World: A Wireless Foundation Model for RF Environment Representation

Channel2World:一种用于射频环境表征的无线基础模型

Hyung-Joo Moon, Joonkyu Jang, Kwang Soon Kim, Seong-Lyun Kim, Robert W. Heath, Chan-Byoung Chae

专题命中 知识编辑与模型理解 :foundation model(title,abstract);pretraining(abstract)

AI总结 该研究提出无线基础模型Channel2World,用Transformer编码器聚合多环境MIMO信道数据,预训练后作为环境条件模块,在UE定位等任务中能有效适配未见环境,性能优于或媲美特定站点微调。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17524 2026-08-19 cs.LG 新提交 81%

Evaluating RL Explainability Methods by How Much They Help Fix Bugs in Agents

通过可解释强化学习(XRL)方法对修复智能体Bug的帮助程度来评估XRL方法

Ram Rachum, Yotam Amitai, Bálint Gyevnár, Reuth Mirsky, Cameron Allen

机构 * University of California, Berkeley(加州大学伯克利分校) Tufts University(塔夫茨大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出EvalXRL基准,通过大型语言模型编码智能体结合XRL方法诊断修复RL智能体故障的效果,实现对多种XRL方法的首次闭环直接对比评估。

Journal ref Proceedings of the Workshop on Explainable Artificial Intelligence (XAI) at IJCAI-ECAI 2026, Bremen, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07531 2026-08-19 cs.CL cs.AI 版本更新 79%

Search-G1: Grounded Search Agents via Representation-Based Intrinsic Rewards

Search-G1:基于表征内在奖励的接地搜索智能体

Ruoxi Cheng, Haoxuan Ma, Hongyi Zhang, Junming Zhang, Ranjie Duan, Qiaolin Xia, Hao Wang, Yu Lu, Haibo Shi, Xingjun Ma

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);language agent(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出Search-G1框架,通过两个经干预校准的读数构成的表征内在奖励,改善了搜索增强语言智能体的接地性与搜索成本的权衡,在多基准和模型规模上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17099 2026-08-19 cs.HC cs.CY 新提交 75%

Appearing Legitimate is Not Enough: Interrogating Synthetic Agents in Representational Processes through a Participatory Design Lens

看似合法还不够:通过参与式设计视角审视表征过程中的合成智能体

Aditya Nayak, Aditi Vashistha, Alissa Centivany, Aakash Gautam

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);foundation model(abstract)

AI总结 本文从参与式设计视角,结合三个不同规模的案例,探讨用合成智能体替代人类参与表征过程的合法性与人格关联,指出其风险并提出监督边界。

Comments 13 pages total, 4 figures, accepted to the 9th AAAI Conference on AI, Ethics, and Society (AIES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17550 2026-08-19 cs.CV cs.CL 新提交 70%

Code as Representation: A Compilable Parsing Paradigm for Academic Documents

代码作为表示:学术文档的可编译解析范式

Rihui Jin, Jun Wang, chengyuan zhu, Liang Mingyu, Yue Gao, Li Yunxuan, Kuicai Dong, Guilin Qi, Lin Ren, Yongrui Chen, Xinbang Dai, Jiaqi Li, Tongtong Wu, Gholamreza Haffari

机构 * Southeast University(东南大学) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对学术PDF难以被机器处理的问题,提出CADP可编译解析范式,构建CADP-Bench基准并测试SOTA MLLMs,发现前沿模型仍难生成高保真可执行重构,该基准已开放供研究。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01297 2026-08-19 cs.AI 版本更新 70%

MoRA: Mobility as the Backbone for Geospatial Representation Learning at Scale

MoRA:以移动性为核心的大规模地理空间表示学习

Ya Wen, Jixuan Cai, Qiyao Ma, Linyan Li, Xinhua Chen, Chris Webster, Yulun Zhou

机构 * The University of Hong Kong(香港大学) WeChat, Tencent(微信、腾讯) City University of Hong Kong(城市大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 MoRA通过移动图为核心骨架,融合多种数据模态,实现大规模地理空间表示学习,提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07398 2026-08-19 cs.CY cs.CL cs.SI 版本更新 70%

Measuring Narrative Polarization in Online Discourse

关于叙述:在线极化的修辞机制

Jan Elfes, Marco Bastos, Luca Maria Aiello

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过分析YouTube视频和评论,探讨了在线极化中叙述如何通过修辞机制影响群体间的观点塑造与交流。

Comments 31 pages, 9 figures, 8 tables

Journal ref PNAS Nexus, pgag270 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01460 2026-08-19 cs.CV 版本更新 67%

Reinforcing Consistency in Video MLLMs with Structured Rewards

通过结构化奖励强化视频MLLMs的一致性

Yihao Quan, Zeru Shi, Jinman Zhao, Ruixiang Tang

机构 * Rutgers University(罗格斯大学) University of Toronto(多伦多大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 研究通过结构化奖励提升视频MLLMs的一致性,发现传统监督不足,提出结合事实和时间单元的奖励机制,提升视频理解准确性。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16931 2026-08-19 cs.LG 新提交 57%

SW-ProxyCE: Zero-Query Adversarial Transfer from Public EEG Encoders to Private Downstream Models

SW-ProxyCE:从公开EEG编码器到私有下游模型的零查询对抗迁移

Linhua Cong, Dingkun Liu, Dongrui Wu

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 本文针对公开编码器与私有下游模型场景,提出无查询的任务感知攻击框架SW-ProxyCE,实验表明其生成的对抗样本可有效迁移至下游模型,且性能优于任务无关攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17203 2026-08-19 stat.ML cs.LG math.ST stat.TH 新提交 57%

Expressivity In Multimodal Contrastive Learning

多模态对比学习中的表达能力

Andrew Stuart, Florian Wolf

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 该研究针对多模态对比学习的表达能力展开分析,明确CLIP架构的表达能力随模态数量变化,提出Hadamard-CLIP模型,实现任意数量模态联合分布的通用近似且保留CLIP的检索优势。

详情

展开后加载摘要…

URL PDF HTML 收藏