arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12266 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 12266 篇

2601.09680 2026-01-15 cs.AI 70%

Automating Supply Chain Disruption Monitoring via an Agentic AI Approach

通过代理AI方法自动化供应链中断监控

Sara AlMahri, Liming Xu, Alexandra Brintrup

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过代理AI方法,实现对供应链中断的自动化监控与响应,提升供应链的主动韧性和抗风险能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09000 2026-01-15 cs.LG 70%

Universal Dynamics of Warmup Stable Decay: understanding WSD beyond Transformers

Warmup Stable Decay 的普遍动态:在 Transformer 之外理解 WSD

Annalisa Belloni, Lorenzo Noci, Antonio Orvieto

机构 * MPI-IS Tübingen, Germany, ETH Zürich, Switzerland and Politecnico di Torino, Italy(马克斯·普朗克研究所(MPI-IS)图宾根,德国,瑞士苏黎世联邦理工学院(ETH Zürich)和意大利托里诺理工大学(Politecnico di Torino)) ETH Zürich, Switzerland(瑞士苏黎世联邦理工学院(ETH Zürich)) MPI-IS, ELLIS Institute Tübingen, Tübingen AI Center, Germany(马克斯·普朗克研究所(MPI-IS)图宾根,德国,图宾根人工智能中心(Tübingen AI Center))

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究通过比较 Transformer 和 CNN 在 WSD 调度下的训练动态,揭示了非凸优化问题中损失景观的共同几何特征。

Comments Accepted at the 2025 HiLD and MOSS Workshops at ICML

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08673 2026-01-14 cs.AI cs.CY 70%

Why AI Alignment Failure Is Structural: Learned Human Interaction Structures and AGI as an Endogenous Evolutionary Shock

为何AI对齐失败是结构性的:学习的人类互动结构与AGI作为内生性演化冲击

Didier Sornette, Sandro Claudio Lera, Ke Wu

机构 * Institute of Risk Analysis, Prediction and Management (Risks-X)(风险分析、预测与管理研究所) Southern University of Science and Technology (SUSTech)(南方科技大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨AI对齐失败的结构性问题,指出AGI作为内生性演化冲击,其风险源于放大人类智能、权力与矛盾,而非对抗意图。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06781 2026-01-13 cs.HC cs.AI cs.CV 70%

AutoTour: Automatic Photo Tour Guide with Smartphones and LLMs

AutoTour:基于智能手机和LLMs的自动照片导览系统

Huatao Xu, Zihe Liu, Zilin Zeng, Baichuan Li, Mo Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AutoTour利用智能手机和LLMs自动为用户照片生成细粒度地标注释和描述,实现可扩展且上下文感知的交互式探索体验。

Comments 21

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06235 2026-01-13 cs.SD cs.AI cs.HC 70%

An Intelligent AI glasses System with Multi-Agent Architecture for Real-Time Voice Processing and Task Execution

基于多智能体架构的智能AI眼镜系统:用于实时语音处理与任务执行

Sheng-Kai Chen, Jyh-Horng Wu, Ching-Yao Lin, Yen-Ting Lin

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于多智能体架构的AI眼镜系统,实现实时语音处理与多语言任务执行。

Comments Published in NCS 2025 (Paper No. N0180)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09663 2026-01-13 cs.LG econ.EM math.ST stat.ML stat.TH 70%

Ordinary Least Squares as an Attention Mechanism

普通最小二乘法作为注意力机制

Philippe Goulet Coulombe

机构 * Université du Québec à Montréal(魁北克大学蒙特利尔分校)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 将普通最小二乘法解释为一种注意力机制,通过变换回归空间中的相似性方法,重新定义OLS的优化目标,连接注意力机制与时间序列计量经济学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01042 2026-01-12 cs.CV cs.CR cs.LG 70%

Transferability of Adversarial Attacks in Video-based MLLMs: A Cross-modal Image-to-Video Approach

视频基于多模态大语言模型中的对抗攻击可迁移性:一种跨模态图像到视频的方法

Linhao Huang, Xue Jiang, Zhiqiang Wang, Wentao Mo, Xi Xiao, Yong-Jie Yin, Bo Han, Feng Zheng

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种跨模态图像到视频的对抗攻击方法,用于研究视频多模态大语言模型的可迁移性,实验表明该方法在多个视频-文本多模态任务中表现出强对抗转移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15490 2026-01-09 cs.CL 70%

Collaborative Problem-Solving in an Optimization Game

优化游戏中的协作问题解决

Isidora Jeknic, Alex Duchnowski, Alexander Koller

机构 * Saarland University(萨尔兰大学)

专题命中 其他LLM :LLM(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出了一种新的对话游戏,通过协作解决双人旅行商问题,结合大语言模型与符号机制,实现了在自我对战中45%的最优解率,并展示了与人类用户协作和泛化能力。

Comments 23 pages, 16 figures

Journal ref Proceedings of the 26th Annual Meeting of the Special Interest Group on Discourse and Dialogue (2025) 780-799

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04525 2026-01-09 cs.CL 70%

GRACE: Reinforcement Learning for Grounded Response and Abstention under Contextual Evidence

GRACE:基于上下文证据的强化学习用于 grounded 响应和回避

Yibo Zhao, Jiapeng Zhu, Zichen Ding, Xiang Li

机构 * School of Data Science and Engineering, East China Normal University(数据科学与工程学院,东华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 GRACE通过强化学习框架整合证据基础和可靠回避,解决检索增强生成中的准确性和回避性问题,实现高准确率与低标注成本的平衡。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04251 2026-01-09 cs.SI cs.AI cs.HC 70%

Using Grok to Avoid Personal Attacks While Correcting Misinformation on X

利用Grok避免人身攻击以纠正X平台上的虚假信息

Kevin Matthe Caramancion

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究发现,使用Grok纠正X平台上的虚假信息可显著减少人身攻击,表明AI中介可能改善公共争议的社会互动

Comments 5 pages, 2 columns, 2 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21799 2026-01-08 cs.AI 70%

D-Artemis: A Deliberative Cognitive Framework for Mobile GUI Multi-Agents

D-Artemis:一种用于移动GUI多智能体的 deliberative 认知框架

Hongze Mi, Yibo Feng, Wenjie Lu, Yuqi Wang, Jinyuan Li, Song Cao, He Cui, Tengfei Tian, Xuelin Zhang, Haotian Luo, Di Sun, Jun Fang, Hua Chai, Naiqiang Tan, Gang Pan

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 D-Artemis通过引入细粒度提示检索和主动对齐机制,提升移动GUI多智能体任务的执行成功率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20910 2026-01-07 cs.CL 70%

Emergence and Localisation of Semantic Role Circuits in LLMs

在大语言模型中语义角色电路的涌现与局部化

Nura Aljaafari, Danilo S. Carvalho, André Freitas

机构 * Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Idiap Research Institute(Idiap研究 institute) National Biomarker Centre, CRUK-MI, Univ. of Manchester(国家生物标志物中心,CRUK-MI,曼彻斯特大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过分析大语言模型内部机制,揭示了语义角色电路的集中分布、渐进式结构细化及跨尺度的保守性,表明LLM在抽象语义处理中具有紧凑且部分可转移的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09280 2026-01-07 cs.DC cs.LG cs.NA math.NA 70%

TTrace: Lightweight Error Checking and Diagnosis for Distributed Training

TTrace: 轻量级的分布式训练错误检查与诊断

Haitian Jiang, Shaowei Zhu, Zhen Zhang, Zhenyu Song, Xinwei Fu, Zhen Jia, Yida Wang, Jinyang Li

机构 * New York University(纽约大学) Amazon Web Services(亚马逊网络服务)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 TTrace通过系统性的差分测试方法,有效检测和定位分布式训练中的无声bug,提升调试效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00634 2026-01-07 cs.CL 70%

Social Construction of Urban Space: Using LLMs to Identify Neighborhood Boundaries From Craigslist Ads

城市空间的社会建构:利用大语言模型从Craigslist广告中识别社区边界

Adam Visokay, Ruth Bagley, Ian Kennedy, Chris Hess, Kyle Crowder, Rob Voigt, Denis Peskoff

机构 * University of Washington, Department of Sociology(华盛顿大学社会学系) Northwestern University, Department of Linguistics(西北大学语言学系) University of Illinois Chicago, Department of Sociology(伊利诺伊大学芝加哥分校社会学系) Kennesaw State University, Department of Sociology and Criminal Justice(凯斯韦尔州立大学社会学与犯罪学系)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文利用大语言模型分析Craigslist广告,揭示城市社区边界的社交建构及空间定义的争议

Comments 8 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04458 2026-01-07 cs.CL 70%

Predicting Failures of LLMs to Link Biomedical Ontology Terms to Identifiers Evidence Across Models and Ontologies

预测大型语言模型在跨模型和本体学链接生物医学本体术语到标识符时的失败证据

Daniel B. Hier, Steven Keith Platt, Tayo Obafemi-Ajayi

机构 * Department of Neurology(神经学系) Rehabilitation University of Illinois at Chicago Chicago, IL, USA(伊利诺伊大学芝加哥分校康复学院) Lab for Applied Artificial Intelligence(应用人工智能实验室) Engineering Program(工程学院)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究探讨了大型语言模型在跨本体链接生物医学术语与标识符时的失败原因,发现对本体标识符的暴露是预测链接成功的关键因素。

Comments Accepted for Presentation, IEEE-EMBS International Conference on Biomedical and Health Informatics (BHI 25), Atlanta GA USA, October 26-29, 2025

Journal ref 2025 IEEE EMBS International Conference on Biomedical and Health Informatics (BHI), Atlanta, GA, USA, 2025, pp. 1-7

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01473 2026-01-07 cs.CL 70%

TreeDiff: AST-Guided Code Generation with Diffusion LLMs

TreeDiff: 基于扩散大语言模型的AST引导代码生成

Yiming Zeng, Jinghan Cao, Zexin Li, Yiming Chen, Tao Ren, Zhuochun Li, Dawei Xiang, Xidong Wu, Shangqian Gao, Tingting Yu

机构 * University of Connecticut(康涅狄格大学) San Francisco State University(旧金山州立大学) University of California, Riverside(加州大学河滨分校) National University of Singapore(新加坡国立大学) University of Pittsburgh(匹兹堡大学) Florida State University(佛罗里达州立大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TreeDiff通过整合AST结构先验,改进扩散模型在代码生成中的语法精确性和长距离依赖捕捉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00105 2026-01-05 cs.AI 70%

Mortar: Evolving Mechanics for Automatic Game Design

Mortar:自动游戏设计中的机制演化

Muhammad U. Nasir, Yuchen Li, Steven James, Julian Togelius

机构 * University of the Witwatersrand(沃尔特·冯·斯特拉特大学) New York University(纽约大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Mortar通过结合质量-多样性算法和大语言模型,自主演化游戏机制,以生成多样且可玩的游戏,并提升玩家技能排序的得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23300 2025-12-30 cs.CL 70%

AI4Reading: Chinese Audiobook Interpretation System Based on Multi-Agent Collaboration

AI4Reading: 基于多智能体协作的中文有声书解读系统

Minjiang Huang, Jipeng Qiang, Yi Zhu, Chaowei Zhang, Xiangyu Zhao, Kui Yu

机构 * Yangzhou University(扬州大学) City University of Hong Kong(香港城市大学) Hefei University of Technology(合肥工业大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 AI4Reading通过多智能体协作,利用大语言模型和语音合成技术,生成更简洁准确的有声书解读内容。

Comments ACL 2025 demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20649 2025-12-25 cs.AI cs.CR 70%

AIAuditTrack: A Framework for AI Security system

AIAuditTrack:AI安全系统的框架

Zixun Luo, Yuhang Fan, Yufei Li, Youzhi Zhang, Hengyu Lin, Ziqi Wang

机构 * organization= Huazhong University of Science organization= Lingnan University organization= Centre for Artificial Intelligence Robotics (CAIR) Hong Kong Institute of Science \& Innovation, Chinese Academy of Sciences Tsinghua University Fujian Jiangxia University

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AIAuditTrack通过区块链技术实现AI交互轨迹记录与治理,提供可扩展的AI安全审计与责任追溯方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02080 2025-12-25 cs.CR cs.AI 70%

Evolving Security in LLMs: A Study of Jailbreak Attacks and Defenses

LLM安全性的演变:对劫持攻击及防御的研究

Zhengchun Shang, Wenlan Wei, Weiheng Bai

机构 * Cornell University Ithaca, NY Department of Computer Science \& Engineering University of Minnesota -- Twin Cities Minneapolis, MN

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了LLM安全性的演变,分析了劫持攻击的检测技术,并探讨了模型版本、大小及多防御策略对安全性的综合影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19937 2025-12-24 cs.AI 70%

Interpolative Decoding: Exploring the Spectrum of Personality Traits in LLMs

插值解码:探索大语言模型中人格特质的光谱

Eric Yeh, John Cadigan, Ran Chen, Dick Crouch, Melinda Gervasio, Dayne Freitag

机构 * SRI Menlo Park, CA 94025, USA(SRI研究院)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过插值解码技术,研究者探索了大语言模型中人格特质的光谱,展示了如何通过插值参数模拟不同人格维度的行为,从而在经济游戏中复现人类决策行为。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03476 2025-12-23 cs.CL 70%

Delta-KNN: Improving Demonstration Selection in In-Context Learning for Alzheimer's Disease Detection

Delta-KNN: 提高阿尔茨海默病检测中基于上下文学习的演示选择

Chuyuan Li, Raymond Li, Thalia S. Field, Giuseppe Carenini

机构 * Department of Computer Science(计算机科学系) Vancouver Stroke Program and Division of Neurology, Faculty of Medicine(温哥华卒中计划和神经病学系,医学院) The University of British Columbia(不列颠哥伦比亚大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Delta-KNN通过Delta评分和KNN检索器提升基于上下文学习的阿尔茨海默病检测性能,实现新状态的最先进结果。

Journal ref In Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00457 2025-12-23 cs.CL 70%

Non-native speakers of English or ChatGPT: Who thinks better?

非英语母语者或ChatGPT:谁更擅长思考?

Mohammed Q. Shormani

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过比较非英语母语者与ChatGPT在处理中心嵌套英语结构的能力,发现人类大脑在语言处理上仍具独特优势。

Comments 16 pages, 2 figures

Journal ref F1000Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19855 2025-12-23 cs.CL 70%

Artificial intelligence contribution to translation industry: looking back and forward

人工智能对翻译行业的影响:回顾与展望

Mohammed Q. Shormani, Yehia A. Al-Sohbani

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究回顾了人工智能在翻译行业45年的发展历程,分析了机器翻译、低资源语言等热点问题,并指出需进一步研究以解决多方言和文化语域等挑战。

Comments 30 pages, 13 figures

Journal ref Discover Artificial Intelligence, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18445 2025-12-23 cs.LG 70%

On the Universality of Transformer Architectures; How Much Attention Is Enough?

Transformer架构的通用性;注意力是否足够?

Amirreza Abbasi, Mohsen Hooshmand

机构 * Department of Computer Science and Information Technology(计算机科学与信息技术系) Institute for Advanced Studies in Basic Sciences (IASBS)(基础科学高级研究所)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文探讨Transformer架构的通用性问题,分析其表达能力及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18362 2025-12-23 cs.CL 70%

SRS-Stories: Vocabulary-constrained multilingual story generation for language learning

SRS-Stories: 词汇受限的多语言故事生成用于语言学习

Wiktor Kamzela, Mateusz Lango, Ondrej Dusek

机构 * Poznan University of Technology, Institute of Computer Science(波兹南技术大学计算机科学学院) Charles University, Faculty of Mathematics and Physics(查尔斯大学数学与物理系)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SRS-Stories通过间隔重复系统生成多语言故事,利用已知词汇教授新词并复习旧词,提升语言学习效果。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16954 2025-12-22 cs.CV cs.AI 70%

Lights, Camera, Consistency: A Multistage Pipeline for Character-Stable AI Video Stories

灯光,摄像机,一致性:一种多阶段管道用于角色稳定的AI视频故事

Chayan Jain, Rishant Sharma, Archit Garg, Ishan Bhanuka, Pratik Narang, Dhruv Kumar

机构 * BITS Pilani, Pilani Campus, India(印度比斯汉尼学院帕利尼校区)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种多阶段管道,通过生成详细剧本并利用视觉锚点来提升AI生成视频故事中角色的一致性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16598 2025-12-19 math.OC cs.LG 70%

Muon is Provably Faster with Momentum Variance Reduction

Muon 通过动量方差缩减得以证明更快

Xun Qian, Hussein Rammal, Dmitry Kovalev, Peter Richtárik

机构 * KAUST(王国立大学) Center of Excellence for Generative AI(生成人工智能卓越中心) Yandex Research(Yandex研究)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过将动量方差缩减引入Gluon框架,证明Muon等优化器在非凸和星凸情况下收敛速度的提升。

Comments 31 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16439 2025-12-19 cs.CR cs.CL 70%

From Essence to Defense: Adaptive Semantic-aware Watermarking for Embedding-as-a-Service Copyright Protection

从本质到防御:面向嵌入即服务版权保护的自适应语义感知水印技术

Hao Li, Yubing Ren, Yanan Cao, Yingjie Li, Fang Fang, Xuebin Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SemMark是一种基于语义的嵌入即服务版权保护水印技术,通过语义感知水印和自适应权重机制提升防护效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14491 2025-12-19 cs.LG cs.MM 70%

Multimodal Methods for Analyzing Learning and Training Environments: A Systematic Literature Review

多模态方法用于分析学习与训练环境:系统文献综述

Clayton Cohn, Eduardo Davalos, Caleb Vatral, Joyce Horn Fonteles, Hanchen David Wang, Austin Coursey, Surya Rayala, Ashwin T S, Meiyi Ma, Gautam Biswas

机构 * Vanderbilt University(范德比大学) Tennessee State University(田纳西州立大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文综述了多模态方法在学习与训练环境中的应用,提出分类法和框架,揭示了多模态整合对行为分析的价值及现存挑战。

Comments Submitted to ACM Computing Surveys. Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏