arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12266 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 12266 篇

2607.28576 2026-07-31 cs.CL cs.AI cs.LG 新提交 67%

Sample More, Reflect Less: Self-Refine and Reflexion Lose to Repeated Sampling at Equal Token Cost, from 1.5B to 7B

更多采样,更少反思:在相同 token 成本下,自改进(Self-Refine)和反思(Reflexion)不敌重复采样,模型规模从 15 亿到 70 亿参数

Iliya Mirzaei

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究发现,在相同 token 成本下,自改进、反思等含自我检查的语言模型方法均不敌重复采样,且模型规模增长会使自我检查方法的性能优势减弱,70 亿参数模型上的改写方法仍显著弱于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28550 2026-07-31 cs.CY 新提交 67%

Correcting Mode Collapse in Silicon Sampling with Semantic Similarity Rating

用语义相似度评分修正硅采样中的模式崩溃问题

Oscar Heath, Rohan Alexander

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 该研究针对硅采样中LLMs生成回复的模式崩溃问题,提出语义相似度评分法,通过文本嵌入将LLMs生成的文本回复映射为数值尺度,提升了回复分布保真度且校准参数少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28285 2026-07-31 cs.CV 新提交 67%

Beyond Visual Ambiguity: Guiding Robust Monocular Depth Estimation in Challenging Scenarios via Detailed Long Captions

超越视觉歧义:通过详细长文本引导具有挑战性场景下的鲁棒单目深度估计

Junrui Zhang, Jiaqi Li, Yiran Wang, Liao Shen, Zhiguo Cao

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 其他LLM :language model(abstract,abstract_cn)

AI总结 该研究针对单目深度估计的视觉歧义问题,提出CapDepth框架,通过详细长文本引导,在非朗伯表面和恶劣天气下的深度误差较现有最优方法分别降低25.0%和22.0%。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27275 2026-07-31 cs.CR 版本更新 67%

Prevalence of Security and Privacy Risk-Inducing Usage of AI-based Conversational Agents

基于人工智能的对话式代理的安全与隐私风险诱导使用的普遍性

Kathrin Grosse, Nico Ebert

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 该研究调查3270名英国成年人发现,三分之一每周使用ChatGPT等CA,三分之一常规用户有攻击相关行为,四分之一尝试越狱,多数人不知数据可用于模型训练,建议CA配备AI护栏并提升数据使用透明度。

Comments 10 pages, 3 figures, 5 tables, accepted at IEEE Access

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18699 2026-07-30 cs.DS cs.SC 版本更新 67%

A more accurate rational non-commutative algorithm for multiplying 4x4 matrices using 48 multiplications

一种更精确的有理非交换算法用于使用48次乘法的4x4矩阵乘法

Jean-Guillaume Dumas, Clément Pernet, Alexandre Sedoglavic

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 本文提出一种更精确的4x4矩阵乘法算法,使用48次非交换乘法,改进了误差界指数并提升了实际精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08951 2026-07-30 cs.SE 版本更新 67%

GenAI Is No Silver Bullet for Qualitative Research in Software Engineering

生成式AI并非软件工程定性研究的万能钥匙

Neil A. Ernst, Christoph Treude

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 本文探讨生成式AI在软件工程定性研究中的应用,分析其优缺点及对研究质量的影响,旨在为研究人员提供关于该技术的全面理解。

Comments accepted to ACM TOSEM. Replication: https://doi.org/10.5281/zenodo.21631436

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25019 2026-07-29 econ.TH cs.GT cs.MA 新提交 67%

Interactive Alignment

交互式对齐

Sylvain Chassang

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 研究交互式主体与人类福祉的长期对齐问题,采用人工智能主体模拟和进化博弈论框架两种方法,结果显示进化博弈论可近似宪法主体经济动态,实用规范执行能更有效维持长期对齐。

Comments 53 pages, 18 Figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22610 2026-07-29 cs.HC 67%

Everything Counts: The Managed Omnirelevance of Speech in Human-Voice Agent Interaction

一切都有价值:人类与语音代理互动中语音的受控全相关性

Damien Rudaz, Mathias Broth, Jakub Mlynar

专题命中 其他LLM :LLM(abstract,abstract_cn)

AI总结 研究探讨了人类与语音代理互动中语音的全相关性问题,分析了人类如何管理代理的轮流发言行为,以及技术进步对这一现象的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24194 2026-07-28 cs.CV 新提交 67%

Face Age Verification Vulnerabilities Under Simple Appearance Manipulations

简单外观操纵下的面部年龄验证漏洞

Ioannis Sarridis, Ioannis Kompatsiaris, Symeon Papadopoulos

机构 * Information Technologies Institute, Centre for Research and Technology Hellas(信息技术研究所,希腊研究与技术中心)

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 研究简单外观操纵下面部年龄验证的漏洞,评估七个模型在三个数据集及四种操纵类型下的情况,发现胡茬操纵影响大,不同人口统计特征受影响有差异,还探索了用偏差缓解方法减轻偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21967 2026-07-27 stat.AP 新提交 67%

When Machines Lie Differently: Detecting AI vs Human Fake News

当机器说谎方式不同时:检测人工智能与人类制造的假新闻

Canliv Ibenye, Aya-Vera Jimenez, Samuel Jaeger, Dhrubajyoti Ghosh

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 研究通过两个二元分类任务,用词汇、可读性等特征及多种机器学习模型,区分真实新闻与人类及人工智能生成的假新闻,发现检测人工智能生成的假新闻准确率高,而人类撰写的较难区分,揭示了错误信息检测的不对称性。

Comments Accepted at ICMLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22406 2026-07-27 cs.SE 新提交 67%

Vibe Coding: An Experiment with Test-Driven Development

Vibe编码:一项测试驱动开发的实验

Moritz Mock, Barbara Russo

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 研究探索人类与CLLMs通过vibe编码对等协作,设计四个交互模型并实现相应TDD工作流程。通过实验发现交互模型选择取决于开发目标,智能工作流程利于快速开发但有复杂性,协作工作流程产生更高质量测试套件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21769 2026-07-27 cs.HC 新提交 67%

From Grasping to Speaking: Generative AI-Based Environment-Grounded VR Communication Training for Autistic Individuals

从抓握到说话:基于生成式人工智能的自闭症个体环境基础VR沟通训练

Ziming Li, Roshan L. Peiris

专题命中 其他LLM :LLM(abstract);prompting(abstract)

AI总结 研究探索基于生成式人工智能的VR沟通训练对自闭症个体的作用,通过9名受训者和7名教练参与的三种模式实验发现,C+O+G模式更受青睐,可用性和工作量相当,有助于沟通实践融入任务执行,还讨论了相关设计考量。

Comments 14 pages, ASSETS2026

Journal ref The 28th International ACM SIGACCESS Conference on Computers and Accessibility (ASSETS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19131 2026-07-27 cs.SI 版本更新 67%

Conspiracy Theory Rabbit Holes Emerge via Interacting Contagions

阴谋论兔子洞通过相互作用的传播出现

Fabian Tschofenig, Paul Vicinanza, Henrich Greve, Hayagreeva Rao, Douglas Guilbeault

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 研究探讨人们陷入阴谋论兔子洞的原因,通过分析推文用序列风险模型等揭示阴谋论间相互作用及定居者效应,比较多种模型,发现传染病生态模型能重现相关动态,还表明防止阴谋论首次公开认可有重要作用。

Comments 49 pages, 13 figures, 5 tables, including supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15114 2026-07-24 cs.MA 版本更新 67%

From Who They Are to How They Act: Behavioral Traits in Generative Agent-Based Models of Social Media

从他们是谁到他们如何行动:生成式基于代理的社会媒体模型中的行为特征

Valerio La Gatta, Gian Marco Orlando, Marco Perillo, Ferdinando Tammaro, Vincenzo Moscato

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 本文提出通过行为特征显式表征代理行为,以生成更真实的社交媒体参与模式和内容传播动态。

Comments Accepted at The International AAAI Conference on Web and Social Media (ICWSM) 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19275 2026-07-23 cs.CY 版本更新 67%

From Assistance to Autonomy -- A Researcher Study on the Potential of AI Support for Qualitative Data Analysis

从协助到自主——一项研究AI对定性数据分析潜力的探讨

Elisabeth Kirsten, Annalina Buckmann, Leona Lassak, Nele Borgert, Abraham Mhaidli, Steffen Becker

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 本文通过研究AI在定性数据分析中的应用潜力,提出一个从最小到高度AI参与的框架,旨在促进AI支持QDA的发展并建立负责任的人机协作标准。

Comments Published at NordiCHI '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17005 2026-07-21 cs.AR cs.DS 新提交 67%

Provably Good Prim-Dijkstra Revisited: New Theory and a Practical Algorithm for a Classical VLSI Routing Problem with LLMs

重温可证明良好的Prim-Dijkstra算法:针对经典VLSI路由问题的新理论及基于大语言模型的实用算法

Keren Zhu

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 针对经典VLSI路由问题,通过Prim-Dijkstra算法,证明弱NP完全性,推导成本-半径权衡,构建多模式求解器HP-RCRST,在开发实例上表现出色,重新开启被忽视问题,展现大语言模型对算法研究的推动作用。

Comments 23 pages, 6 figures. Code and reproducibility materials: https://github.com/CODA-Team/hp-rcrst

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14011 2026-07-20 cs.NE cs.RO 版本更新 67%

EGO: a Recursive and Self-Referential Cognitive Architecture for Artificial General Intelligence

EGO:一种用于通用人工智能的递归和自指认知架构

Alberto Mangiante, Paolo Totaro, Domenico Ninno

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 该研究将通用人工智能视为自主自组织系统的涌现属性,介绍了基于形式E语言的EGO软件架构,它能自指并维持内部组织,实现自创生,为人工智能与生物认知理论搭建桥梁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13443 2026-07-16 cs.CY cs.DC 新提交 67%

The Environmental Cost of Digital Sovereignty: Water, Energy, and Emissions Impacts of Sovereign AI Infrastructure in the Global South

数字主权的环境成本:全球南方主权人工智能基础设施的水、能源和排放影响

Muntaser Syed, Marius C. Silaghi, Sheikh Abujar, Sharun Akter Khushbu, Amal El Ahmad

专题命中 其他LLM :language model(abstract);small language model(abstract)

AI总结 研究全球南方主权人工智能基础设施的环境成本,通过对四个案例分析,模拟其水、能源消耗及碳排放,发现存在主权-可持续性困境,进而提出对环境负责的主权人工智能设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21477 2026-07-15 cs.CR 版本更新 67%

MCP Pitfall Lab: Exposing Developer Pitfalls in MCP Tool Server Security under Multi-Vector Attacks

MCP陷阱实验室:在多向攻击下暴露MCP工具服务器安全漏洞的开发人员陷阱

Run Hao, Zhuoran Tan

专题命中 其他LLM :LLM(abstract,abstract_cn)

AI总结 本文提出MCP Pitfall Lab框架,通过可复现的场景验证开发人员陷阱,评估MCP工具服务器在多向攻击下的安全性和修复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11859 2026-07-14 cs.CY cs.AR cs.MA 新提交 67%

Can LLMs Perform Deep Technical Comprehension of Computer Architecture Papers?

大语言模型能否对计算机体系结构论文进行深度技术理解?

Nishant Aggarwal, Ayushi Dubal, Sreeraj Kannakarankodi, Ian McDougall, Adarsh Mittal, Vishnu Ramadas, Noah Scott, Ranganath Selagamsetty, Weichu Yang, Karthikeyan Sankaralingam

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 研究大语言模型对计算机体系结构论文的深度理解,通过开源管道Gauntlet进行分析,经与人类分析对比及消融实验,发现其多智能体结构有优势,尤其合成阶段,还将相关资源作为社区资源发布。

Comments 4 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09766 2026-07-14 cs.AI cs.CL cs.LG cs.MA 新提交 67%

Norm Enforcement for AI Agents: Robustly Shaping Behavior in Multi-Agent Systems

人工智能代理的规范执行:在多智能体系统中稳健塑造行为

Yaowen Ye, Jacob Steinhardt

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究多智能体系统中语言模型代理的规范执行机制,针对简单机制易被利用的问题,确定估计代理可靠性及加重惩罚更新估计这两个关键要素,所构建机制可抵御利用且低成本惩罚违规,是塑造智能体行为的可扩展手段。

Comments ICML2026 Trustworthy AI for Good Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20285 2026-07-14 econ.GN q-fin.EC 版本更新 67%

Bank Runs With and Without Bank Failure

银行挤兑:有与无银行倒闭的情况

Sergio Correia, Stephan Luck, Emil Verner

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 本文利用历史报纸数据研究美国1863-1934年间银行挤兑原因及影响,发现弱银行更易发生挤兑,但强银行在负面经济新闻下也易受影响,但只有基本面差的银行才会倒闭,强银行通过合作和暂停兑换避免失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16112 2026-07-14 cs.CV 版本更新 67%

AutoV: Loss-Oriented Ranking for Visual Prompt Retrieval in LVLMs

AutoV:面向视觉提示检索的损失导向排名用于大视觉-语言模型

Yuan Zhang, Chun-Kai Fan, Sicheng Yu, Junwen Pan, Tao Huang, Ming Lu, Kuan Cheng, Qi She, Shanghang Zhang

机构 * School of Computer Science, Peking University(北京大学计算机学院) ByteDance Inc.(字节跳动公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 AutoV通过损失导向的提示检索提升大视觉-语言模型在图像理解等任务中的性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01862 2026-07-14 cs.CY 67%

Charting the Landscape of Nefarious Uses of Generative Artificial Intelligence for Online Election Interference

绘制生成式人工智能恶意用途在在线选举干扰中的图景

Emilio Ferrara

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 本文研究了生成式人工智能在在线选举干扰中的恶意用途,分析了深度伪造、僵尸网络等技术对民主进程的威胁,并呼吁加强国际合作以应对相关风险。

Comments First Monday, 2025

Journal ref First Monday 30(1), June 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06654 2026-07-13 quant-ph physics.atom-ph 新提交 67%

Localized control of large ion crystals in a Penning trap using a spatial light modulator

使用空间光调制器对彭宁阱中的大离子晶体进行局部控制

Allison L. Carter, Jennifer F. Lilieholm, Bryce B. Bullock, Kurt Thompson, Diep Nguyen, John J. Bollinger

专题命中 其他LLM :SLM(abstract,abstract_cn)

AI总结 研究利用空间光调制器对彭宁阱中大离子晶体进行局部控制,通过施加可编程交流斯塔克位移图案实现,验证了该技术并为彭宁阱中单个离子寻址提供途径。

Comments Main text: 5 pages, 3 figures; End matter: 2 pages, 2 figures; Supplemental material: 10 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07007 2026-07-09 cs.CR cs.SE 新提交 67%

Thinking More, Harnessing Better: State Machine Guided Harness Automatic Generation with Project Digestion and Workflow Decomposition

思考更多,利用更好:通过项目剖析和工作流分解实现状态机引导的测试 harness 自动生成

Xing Zhang, Zikang Huang, Gang Yang, CongChong Wang, Lu Liu, Bin Yin, Mingyi Wang, Ziquan Zhao, Min Li, Zhenyu Chen, Bo Wu, Lingyun Ying

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 研究针对现有大语言模型单轮生成模糊测试 harness 的局限,提出 SynapseFlow,通过数据流感知函数聚合和分阶段回滚算法,经四阶段过程合成 harness,在 25 个开源项目上评估,效果超现有工具,还发现多个未报告错误。

Comments 20 pages, accepted by CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28469 2026-07-09 cs.RO cs.HC 版本更新 67%

When May I Help You? On The Effect of Proactivity on Group Human-Robot Collaboration

我何时能帮你?主动性对群体人机协作的影响

Thomas Vitry, Vanessa Maeder, Kieran von Valeburg, Asihati Hazaiti, Doga Deniz Ates, Connor Gäde, Jan-Gerrit Habekost, Dennis Becker, Stefan Wermter

机构 * Knowledge Technology, University of Hamburg(汉堡大学知识技术研究所) Ecole Normale Superieure de Rennes(里昂大学)

专题命中 其他LLM :LLM(abstract,abstract_cn)

AI总结 研究在多人协作逃生室中,机器人采用反应式(仅被叫时响应)与主动式(持续监听并自主贡献)交互模型对协作效果的影响,发现主动模型增加交互频率但反应模型成功率更高,且用户先前经验和性格显著调节效果。

Comments Published at the RO-MAN 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05149 2026-07-07 cs.SE 新提交 67%

Intent-Based Mutation Testing: From Naturally Written Programming Intents to Mutants

基于意图的变异测试:从自然编写的编程意图到变异体

Asma Hamidi, Ahmed Khanfir, Mike Papadakis

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 提出基于意图的变异测试,通过改变被测程序实现的编程意图来生成变异体,与传统测试不同,能捕获不同类型故障,用大语言模型实现并评估,可补充传统变异测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29429 2026-07-07 cs.CV 版本更新 67%

One Click per Cell Type Suffices: Training-free Group Interaction for Cell Instance Segmentation

每细胞类型一次点击足矣:无需训练的组交互用于细胞实例分割

Sanghyun Jo, Seo Jin Lee, Seohyung Hong, Yoorim Gang, Hyeongsub Kim, Hyungseok Seo, Kyungsu Kim

机构 * OGQ, Korea(韩国OGQ) Seoul National University, Korea(韩国首尔国立大学) LG CNS, Korea(韩国LG CNS)

专题命中 其他LLM :foundation model(abstract);prompting(abstract)

AI总结 提出组提示范式,通过每细胞类型一次点击即可分割所有该类型实例,基于SAM冻结编码器的特征聚类性质,设计无需训练的Chain-of-Prompts框架递归扩展点击,在多个基准上保持高性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01760 2026-07-03 cs.SE 新提交 67%

Refploit: Facilitating Exploit Construction via Code-Agent Trajectory Repair

Refploit: 通过代码代理轨迹修复促进漏洞利用构建

Zirui Chen, Zhipeng Xue, Jiayuan Zhou, Xing Hu, Xin Xia, Xiaohu Yang

专题命中 其他LLM :LLM(abstract,abstract_cn)

AI总结 提出Refploit框架,利用大语言模型修复代码代理生成的失败轨迹,通过差分执行验证和约束引导恢复,在Java漏洞数据集上实现80.2%的复现率,相对初始轨迹提升64.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏