arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-24 至 2026-08-24 共收录 25 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 25 篇

2608.20385 2026-08-24 cs.CL 新提交 92%

Using Human-LLM Disagreement to Improve Checklist-Based Quality Appraisal

利用人类与大语言模型(LLM)的分歧改进基于核查表的质量评估

Timo van der Kuil (1), Bruno Messina Coimbra (1), Mirjam van Zuiden (2), Robert A. Bagheri (1), Rens van de Schoot (1), Klaas Dieleman (1), Berend Greijn (1), Stefan Houkes (1), Sebastiaan Rodenhuis (1), Elizabeth M. Grandfield (1) ((1) Methodology and Statistics Utrecht University, (2) Clinical Psychology Utrecht University)

机构 * Utrecht University(乌得勒支大学)

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究探究LLM能否近似基于核查表评估的人类判断,发现人类与LLM的分歧多源于核查表的歧义性和条件性标准,修订此类条目可提升评估一致性,分析分歧还能助力研究综合工作流的迭代改进。

Comments 31 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20434 2026-08-24 cond-mat.mtrl-sci cs.AI 新提交 90%

An LLM agent for end-to-end computational materials discovery

用于端到端计算材料发现的大语言模型智能体

Chen Yuntong, Huang Ju, Liu Yu, Zhao Dan, Sun Mingqi, Ju Chentian, Liu Yanbing, Huang Lijiang, Zhao Guobin

专题命中 其他LLM :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对计算材料发现中多算法工具重复应用的挑战,提出MAESTRO LLM智能体系统,可完成MOF全筛选流程,发现传统方法易忽略的高性能材料。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20732 2026-08-24 cs.CR 新提交 89%

Uncovering and Understanding Hidden Dependencies in the LLM API Reseller Ecosystem via Prefix-Cache Side Channels

通过前缀缓存侧信道揭示和理解LLM API转售商生态系统中的隐藏依赖关系

Zimo Ji, Xin Wei, Congying Xu, Wenyuan Jiang, Xin Yang, Zongjie Li, Yudong Gao, Shuai Wang

专题命中 其他LLM :LLM(title,title_cn)

AI总结 本研究提出CacheTracer,利用前缀缓存侧信道测量LLM API转售商间的隐藏依赖关系,通过对39个转售商端点的测量发现了深度集中的缓存可达结构,验证了方法的可靠性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20591 2026-08-24 cs.HC 新提交 89%

Disentangling Threads: Exploring the Potential of LLM-Supported Discussion Forum Analysis for Community Insight

分离线程:探索大语言模型支持的讨论论坛分析在社区洞察中的潜力

Tony W. Li, Zhiqing Wang, Thanh-Nha Tran, Yu-Chun Grace Yen, Steven P. Dow

专题命中 其他LLM :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对在线讨论论坛自由回复结构难挖掘洞见的问题,通过分析论坛讨论、构建框架与探针、访谈21名研究者,为LLM支持的社区意义建构工具提供设计建议。

Comments Accepted to ACM Collective Intelligence Conference, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21298 2026-08-24 cs.SE 新提交 89%

Human-AI Collaboration in Requirements Engineering: Evidence of the Negative Effect of LLMs on Requirements Inspection

需求工程中的人机协作:大语言模型(LLM)对需求检查的负面影响证据

Giovanna Broccia, Julian Frattini, Chetan Arora, Maurice H. ter Beek, Alessandro Fantechi, Andreas Vogelsang, Alessio Ferrari

专题命中 其他LLM :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究通过控制交叉实验发现,大语言模型(LLM)支持会降低新手需求检查员的气味检测准确率,且先使用LLM学习需求检查会减缓技能获取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26242 2026-08-24 cs.AI 版本更新 88%

Can LLMs Introspect? A Reality Check

LLM 能否内省?一个现实检验

Shashwat Singh, Tal Linzen, Shauli Ravfogel

机构 * Center for Data Science(数据科学中心)

专题命中 其他LLM :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文基于人类元认知研究的教训,质疑大型语言模型能否真正内省,并通过重新审视两个评估范式发现,当前证据不足以证明LLM具有元认知监控能力。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21156 2026-08-24 cs.IR cs.AI cs.ET 新提交 87%

Graph Engineering in the Era of LLM Agents: From Individual Intelligence to System Intelligence

大语言模型智能体时代的图工程:从个体智能到系统智能

Yuyuan Feng, Zhishang Xiang, Chaobin Yang, Qichao Ma, Zerui Chen, Yujing Zhang, Ke Huang, Chuanjie Wu, Zhaoxu Liu, Yili Wang, Xin He, Jiapu Wang, Zijin Hong, Hao Chen, Yuanchen Bei, Kun Wang, Shengyuan Chen, Ningyu Zhang, Enyan Dai, Linhao Luo, Qingyi Pan, Qi Wang, Wenqi Fan, Guangjing Wang, Na Zou, Yangqiu Song, Xin Wang, Zechao Li, Xia Hu, Qing Li, Xiao Huang, Zhihong Zhang, Jinsong Su, Qinggang Zhang, Yi Chang

专题命中 其他LLM :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究针对LLM智能体复杂任务的个体智能局限,提出图工程范式,通过构建动态图结构组织协调异构智能体,为系统智能提供统一基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20438 2026-08-24 physics.soc-ph cs.AI cs.MA cs.SI 新提交 87%

Peer-Voted LLM-Agent Stress Tests Find Feed-Induced Lexical Convergence but No Reliable Matched-Exposure Advantage for Distributed Sources

同行投票的大语言模型智能体压力测试:发现feed诱导的词汇趋同,但分布式来源无可靠的匹配暴露优势

Rana Muhammad Usman, Dominic Williamson

专题命中 其他LLM :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究通过PV-SST测试床开展实验,发现同行排名feed会诱导LLM智能体群体的词汇趋同,但未证实分布式来源相比单一来源具有可靠的立场改变优势。

Comments 9 pages, 3 figures. Code, frozen protocol, configurations, summary tables, and data are publicly available at this https URL (https://github.com/ranausmanai/synthetic-social-networks) and this https URL (https://huggingface.co/datasets/ranausmans/synthetic-social-networks)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21177 2026-08-24 cs.HC 新提交 86%

From Search Agents to Dissemination Interfaces: Understanding Human Trust in Health Information from Conversational Search

从搜索智能体到传播界面:理解人们对对话式搜索中健康信息的信任

Xin Sun, Rongjun Ma, Xiaochang Zhao, Janne Lindqvist, Jan de Wit, Zhuying Li, Abdallah El Ali, Jos A. Bosch

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本研究通过两项混合方法研究,发现人们对ChatGPT提供的健康信息信任显著高于谷歌,且传播界面类型会显著影响这种信任,为开发可信的LLM驱动健康工具提供了关键见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20776 2026-08-24 cs.SE cs.PL 新提交 86%

An Extensive Empirical Study on Code Translation Technique

代码翻译技术的大规模实证研究

Ruihang Fan, Jiajun Jiang, Xinpeng Wang, Jiateng Fu, Fengjie Li, Jiasi Shen

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本研究通过大规模实证对比,发现LLM及基于LLM的代码翻译方法在方法级正确性上优于学习类方法,类级翻译更难,静态与逻辑错误是主要挑战,为代码翻译技术开发提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21136 2026-08-24 cs.CV 新提交 83%

Stream3Dv2: Geometric-Semantic Fusion Enhanced Streaming Zero-Shot 3D Scene Understanding

Stream3Dv2:几何-语义融合增强的流式零样本3D场景理解

Jie Xu, Na Zhao

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 其他LLM :LLM(summary_cn,abstract);foundation model(abstract)

AI总结 针对现有开放词汇零样本3D场景理解模型难以处理流式RGB-D输入、易受2D分割掩码噪声影响的问题,提出无训练框架Stream3Dv2,通过几何-语义融合等策略提升性能,在相关任务上优于基准,可与LLM智能体集成用于开放世界具身智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20820 2026-08-24 cs.AI 新提交 83%

Certified Multi-Turn Robustness for LLM Safety via Compositional Bounds and Safety Persistence

通过组合边界与安全持久性实现大语言模型安全的多轮认证鲁棒性

Yang Liu, Bin Chong, Wenkai Yang, Shuai Zhang, Yancheng Chen, Feiyu Han, GuoZhen, Cheng Zhang, Huaibing Xie, Changze Lv, Shihan Dou, Pluto Zhou

机构 * Peking University(北京大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯混元)

专题命中 其他LLM :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLMs易受多轮越狱攻击的问题,提出MTCR框架,通过状态对抗MDPs等方法实现多轮认证鲁棒性,实验表明其经验安全性能超认证边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20377 2026-08-24 cs.CL cs.AI 版本更新 82%

SKILL-RAG: Self-Knowledge Induced Learning and Filtering for Retrieval-Augmented Generation

SKILL-RAG:用于检索增强生成的自知识诱导学习与过滤方法

Tomoaki Isoda

机构 * Tomoaki Isoda(独立研究者)

专题命中 其他LLM :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究针对RAG的幻觉问题,提出SKILL-RAG方法,通过强化学习框架引出模型自知识,过滤无关检索内容,在多个问答基准上提升生成质量并减少输入文档数量。

Comments The author has decided not to pursue further development or publication of this work. Since the current manuscript represents an incomplete research project and no revised version is planned, the author requests that the article be withdrawn

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20637 2026-08-24 cs.CR cs.AI 新提交 81%

ARQ: Agentic CodeQL Query Refinement for C/C++ Vulnerability Detection

ARQ:用于C/C++漏洞检测的智能CodeQL查询优化框架

Chunyi Wang, Yunfei Ke, Junfeng Yang, Yun-Yun Tsai, Penghui Li

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出ARQ智能框架,利用合成C/C++程序的执行证据和LLM优化CodeQL查询,无需标注数据等,优化后查询的真阳性最多提升119.8%,还修复了长期悬而未决的问题并发现新漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20839 2026-08-24 cs.CL cs.CR cs.LG 新提交 81%

SAC-Copula: Quality-Preserving Watermarking for Diffusion Language Models via Smooth Correlated Gumbel Fields

SAC-Copula:基于平滑相关Gumbel场的扩散语言模型质量保留水印

Baixin Li, Haiyun He

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 其他LLM :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 针对扩散语言模型的水印方法与迭代并行去掩蔽不兼容的问题,提出SAC-Copula方法,通过高斯Copula构建平滑相关Gumbel扰动场实现质量保留水印,在LLaDA等数据集上验证了其质量-可检测性权衡优势。

Comments Accepted to Findings of EMNLP 2026. 24 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20841 2026-08-24 cs.AI 新提交 79%

Foundation Models for Partial Causal Identification

用于部分因果识别的基础模型

Alexis Bellot, Anish Dhir

专题命中 其他LLM :foundation model(title,abstract);分类 cs.AI

AI总结 本文开发因果基础模型,借助规范先验将反事实界定问题转化为函数分布学习问题,扩展因果基础建模范式以估计未观测混杂下的部分可识别因果效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20639 2026-08-24 cs.CV 新提交 78%

MV2GF: Multi-view Pedestrian Detection with a Visual Geometric Foundation Model

MV2GF:基于视觉几何基础模型的多视角行人检测

Taiga Yamane, Satoshi Suzuki, Ryo Masumura, Shota Orihashi, Tomohiro Tanaka, Mana Ihori, Naoki Makishima

机构 * Human Informatics Laboratories, NTT, Inc.(NTT公司人类信息学实验室)

专题命中 其他LLM :foundation model(title,abstract)

AI总结 本文针对现有多视角行人检测方法泛化性差的问题,提出基于视觉几何基础模型的MV2GF,通过融合任务特定特征与通用几何特征、利用3D点图投影像素,提升了未见过相机配置下的泛化能力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09431 2026-08-24 cs.CV 版本更新 78%

Vision Foundation Model Driven Foreground-Aware Pseudo-LiDAR Generation for Monocular 3D Object Detection

视觉基础模型驱动的面向前景感知的伪激光雷达生成方法用于单目3D目标检测

Bonan Ding, Jin Xie, Jing Nie, Jiale Cao, Yanwei Pang

专题命中 其他LLM :foundation model(title,abstract)

AI总结 本文提出VFMM3D框架,利用DAM和SAM的先验生成前景感知伪激光雷达,在KITTI、Waymo数据集上实现最优性能,可无缝集成至多种激光雷达3D目标检测器。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20569 2026-08-24 cs.AI cs.CL 新提交 76%

Open-Weight Masked Introspection: Measuring What Language Models Can Report About Their Own Computation

开放权重掩码内省:测量语言模型可报告自身计算的能力

Emilio Ferrara

机构 * University of Southern California(南加州大学)

专题命中 其他LLM :language model(title);分类 cs.CL、cs.AI

AI总结 本研究构建OWMI框架检验8个开放权重模型的内省能力,发现其无法区分真实干预与虚假运行,仅内部存在相关信息,失败源于内部状态到文本报告的路径,需对照内部参考验证模型证词。

Comments We release OWMI as a library so that this emerging ability can be measured as it develops. Hugging Face OWMI library: this https URL (https://huggingface.co/emilioferrara/owmi)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20940 2026-08-24 cs.AI cs.CY cs.MA 新提交 70%

The Logic of Machine Self-Preservation

机器自我保存的逻辑

Cheng Siong Chin

机构 * Newcastle University(纽卡斯尔大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨具身AI的自我保存行为,指出其源于工具收敛理论,通过三家机构实验证实该行为在对抗环境中出现,明确其本质并探讨对具身系统开发的意义。

Comments 6 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20756 2026-08-24 cs.CV cs.AI 新提交 70%

Vis-Poison: Poisoning Visual Knowledge in Multimodal Retrieval-Augmented Generation

Vis-Poison:多模态检索增强生成中的视觉知识投毒攻击

Rujin Liang, Zhongpu Chen, Yuhao Lei, Xin Miao

机构 * Southwestern University of Finance and Economics(西南财经大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Vis-Poison攻击,通过自动化多智能体方法构建视觉合理的被投毒图像,在黑盒设置下对多模态RAG系统实现40.16%-65.40%的攻击成功率,且对仅依赖参数知识的MLLM平均成功率超60%。

Comments Findings of EMNLP, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20566 2026-08-24 cs.LG 新提交 70%

AgentDecarbonizer: Carbon-Aware Execution for AI Agents

AgentDecarbonizer:面向AI智能体的碳感知执行方案

Leyi Yan, Shuangning Li, Sihang Liu

机构 * University of Waterloo(滑铁卢大学) University of Chicago(芝加哥大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文针对AI智能体工作流碳排放高的问题,提出AgentDecarbonizer碳优化器,可结合截止日期、电网碳强度等选择调度方案,在WildClawBench上最多降低57.9%碳排放。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20382 2026-08-24 cs.CL cs.CV 新提交 70%

Decoupled Vision-Language System for Multimodal Understanding and Generation

用于多模态理解与生成的解耦式视觉-语言系统

Yifan Xu, Baochen Xiong, Xiaoshan Yang, Donglin Di, Yaowei Wang, Changsheng Xu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Peng Cheng Laboratory(鹏城实验室) Li Auto(理想汽车)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出多模态大语言模型Libra的解耦式视觉-语言架构,通过开关注意力与FFN模块实现自模态与跨模态解耦,在理解与生成任务上均取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20412 2026-08-24 q-bio.GN 新提交 50%

PEN-STACK: A non-fabricating tool layer for language-model agents in genome writing

PEN-STACK:用于基因组写作的语言模型智能体的非制造工具层

Anees Ahmed Mahaboob Ali, Radhakrishnan Delhibabu, Everette Jacob Remington Nelson

专题命中 其他LLM :prompting(abstract)

AI总结 本研究提出PEN-STACK工具层,为基因组写作的语言模型智能体提供可靠来源的工具,可消除数量伪造,经测试能提升生物安全,为智能体基因组工程系统提供了开源基底。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21276 2026-08-24 cs.RO cs.CV 新提交 50%

The Coastline as a Structural Constraint: Harnessing Scene Geometry for Autonomous Surface Vessel Localization

海岸线作为结构约束:利用场景几何实现自主水面船定位

Derek R. Benham, Joshua G. Mangelson

机构 * Brigham Young University(杨百翰大学)

专题命中 其他LLM :foundation model(abstract)

AI总结 本研究提出两种利用海岸几何的自主水面船定位框架,经多数据集验证,LiDAR管线提升轨迹精度,单目架构控制长期漂移,且零样本基础模型可可靠提取海岸线观测,为无GPS海上定位提供新方案。

Comments 22 pages, 13 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏