arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-30 至 2026-01-30 共收录 258 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 59 篇

2507.03147 2026-01-30 cs.HC cs.CL cs.LG cs.SD eess.AS 73%

A conversational gesture synthesis system based on emotions and semantics

基于情感和语义的对话手势合成系统

Thanh Hoang-Minh

机构 * Department of Information Technology, VNUHCM -- University of Science(越南科学大学信息科技系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出DeepGesture,一种基于扩散的 gesture 合成系统,通过多模态信号生成具有情感和语义条件的手势,提升数字人类的自然表达能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22050 2026-01-30 cs.CL 70%

MasalBench: A Benchmark for Contextual and Cross-Cultural Understanding of Persian Proverbs in LLMs

MasalBench: 一个用于评估大语言模型对波斯谚语的上下文和跨文化理解的基准

Ghazal Kalhor, Behnam Bahrak

机构 * School of Electrical and Computer Engineering, College of Engineering, University of Tehran(德黑兰大学电气与计算机工程学院,工程学院) Tehran Institute for Advanced Studies, Khatam University(德黑兰高级研究 institute,Khatam 大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MasalBench评估大语言模型对波斯谚语的上下文和跨文化理解,发现其在识别波斯谚语准确率高,但在识别等效英语谚语时表现下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21605 2026-01-30 cs.SE cs.HC cs.LG 70%

Age Matters: Analyzing Age-Related Discussions in App Reviews

年龄至关重要:分析应用评论中的年龄相关讨论

Shashiwadana Nirmania, Garima Sharma, Hourieh Khalajzadeh, Mojtaba Shahin

机构 * Deakin University(德肯大学) RMIT University(皇家墨尔本理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过分析应用评论中的年龄相关讨论,利用RoBERTa模型发现92.46%的准确率,揭示了不同年龄段用户在使用移动应用时的主要挑战和需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21128 2026-01-30 cs.AI 70%

Beyond a Single Reference: Training and Evaluation with Paraphrases in Sign Language Translation

超越单一参考:在手语翻译中使用同义词进行训练和评估

Václav Javorek, Tomáš Železný, Alessa Carbo, Marek Hrúz, Ivan Gruber

机构 * University of West Bohemia(西波希米亚大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出通过生成同义词参考提升手语翻译评估的准确性,引入BLEUpara度量标准并验证其与人类判断的一致性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21070 2026-01-30 cs.SE cs.AI 70%

Towards Comprehensive Benchmarking Infrastructure for LLMs In Software Engineering

面向软件工程中大语言模型的全面基准测试基础设施

Daniel Rodriguez-Cardenas, Xiaochang Li, Marcos Macedo, Antonio Mastropaolo, Dipin Khati, Yuan Tian, Huajie Shao, Denys Poshyvanyk

机构 * Queen's University(女王大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出BEHELM,一个面向软件工程的大语言模型全面基准测试基础设施,旨在解决现有评估体系在数据集、指标和数据管道方面的不足,提升评估的全面性和可重复性。

Comments Short paper from bechmarking for software engineering workshop FSE2025

Journal ref Forge Benchmarking 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20230 2026-01-30 cs.CL cs.HC 70%

Unit-Based Agent for Semi-Cascaded Full-Duplex Dialogue Systems

基于单元的代理用于半级联全双工对话系统

Haoyuan Yu, Yuxuan Chen, Minjie Cai

机构 * Hunan University(湖南大学) Gongdao Technology(公道科技) Jilin University(吉林大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于单元的半级联全双工对话系统,利用多模态大语言模型和辅助模块实现高效对话处理,实验显示其在挑战赛中表现优异。

Comments ICASSP 2026 (Grant Challenge). https://github.com/yu-haoyuan/fd-badcat

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18874 2026-01-30 cs.HC cs.AI cs.CR cs.CY 70%

When Ads Become Profiles: Uncovering the Invisible Risk of Web Advertising at Scale with LLMs

当广告成为资料:利用LLMs揭示大规模网络广告中的隐形风险

Baiyu Chen, Benjamin Tag, Hao Xue, Daniel Angus, Flora Salim

机构 * The University of New South Wales(新南威尔士大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Queensland University of Technology(昆士兰理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 利用LLMs揭示广告流中的隐私信息泄露风险,展示其在大规模数据中的高精度推断能力。

Comments The ACM Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22059 2026-01-30 physics.ins-det physics.med-ph 67%

AIRPET: Virtual Positron Emission Tomography

AIRPET:虚拟正电子发射计算机断层扫描

J. Renner, J. J. Gómez-Cadenas, R. Soleti

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 AIRPET是一种基于网络的平台,利用人工智能辅助设计和重建PET扫描仪,整合了PET设计的三大阶段,以简化医疗影像技术的开发流程。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21694 2026-01-30 cs.CV 67%

ChartE$^{3}$: A Comprehensive Benchmark for End-to-End Chart Editing

ChartE$^{3}$: 一个全面的端到端图表编辑基准

Shuo Li, Jiajun Sun, Zhekai Wang, Xiaoran Fan, Hui Li, Dingwen Yang, Zhiheng Xi, Yijun Wang, Zifei Shan, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Tencent(腾讯)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 ChartE$^{3}$提出一个端到端图表编辑基准,通过多模态大语言模型评估,揭示了现有技术在全局编辑任务上的性能差距。

Comments Our benchmark will be publicly available at https://github.com/galactic123/ChartE3

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21586 2026-01-30 cs.CR 67%

ICL-EVADER: Zero-Query Black-Box Evasion Attacks on In-Context Learning and Their Defenses

ICL-EVADER: 零查询黑盒对抗攻击及对In-Context学习及其防御

Ningyuan He, Ronghong Huang, Qianqian Tang, Hongyu Wang, Xianghang Mi, Shanqing Guo

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 ICL-Evader提出零查询黑盒对抗攻击方法,揭示ICL的脆弱性并提供防御方案。

Comments 32 pages, Accepted by The Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21379 2026-01-30 cs.SE 67%

Predicting Developer Acceptance of AI-Generated Code Suggestions

预测开发者对AI生成代码建议的接受度

Jing Jiang, Liehao Li, Jinyun Hou, Xin Tan, Li Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文通过分析工业数据,提出CSAP模型预测开发者对AI生成代码建议的接受度,提升了过滤效果和开发者体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14743 2026-01-30 cs.SE 67%

ARISE -- Adaptive Refinement and Iterative Scenario Engineering

ARISE -- 自适应细化与迭代场景工程

Konstantin Poddubnyy, Igor Vozniak, Ivan Burmistrov, Nils Lipp, Davit Hovhannisyan, Christian Mueller, Philipp Slusallek

专题命中 评测与基准 :LLM(abstract);prompting(abstract)

AI总结 ARISE通过迭代LLM引导细化将自然语言提示转换为可执行的Scenic脚本,提高合成交通场景生成的准确性和鲁棒性。

Comments Accepted for publication at the IEEE Intelligent Vehicles Symposium (IV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09150 2026-01-30 cs.HC 67%

World Craft: Agentic Framework to Create Visualizable Worlds via Text

World Craft: 一种通过文本创建可视化世界的代理框架

Jianwen Sun, Yukang Feng, Kaining Ying, Chuanhao Li, Zizhen Li, Fanrui Zhang, Jiaxin Ai, Yifan Chang, Yu Dai, Yifei Huang, Kaipeng Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 World Craft通过文本描述创建可视化世界,结合结构化模块和多代理框架,提升环境构建的效率和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21096 2026-01-30 cs.AI cs.LG cs.PL 62%

Magellan: Autonomous Discovery of Novel Compiler Optimization Heuristics with AlphaEvolve

Magellan:利用AlphaEvolve自主发现新型编译器优化启发式方法

Hongzheng Chen, Alexander Novikov, Ngân Vũ, Hanna Alam, Zhiru Zhang, Aiden Grossman, Mircea Trofin, Amir Yazdanbakhsh

机构 * Google(谷歌) Google DeepMind(谷歌DeepMind) Cornell University(康奈尔大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 Magellan通过AlphaEvolve自主发现新型编译器优化启发式方法,提升编译器优化效率与性能。

Comments Accepted to C4ML@CGO'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21750 2026-01-30 cs.LG 57%

FISMO: Fisher-Structured Momentum-Orthogonalized Optimizer

FISMO:基于Fisher信息几何的结构化动量正交化优化器

Chenrui Xu, Wenjing Yan, Ying-Jun Angela Zhang

机构 * Department of Information Engineering, The Chinese University of Hong Kong, Hong Kong(信息工程系,香港中文大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 FISMO优化器通过结合Fisher信息几何和正交化动量更新,在非凸优化中实现结构化预处理,提升训练效率和最终性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14210 2026-01-30 cs.CL 57%

DRIFT: Detecting Representational Inconsistencies for Factual Truthfulness

DRIFT:用于事实真实性检测的表征不一致检测

Rohan Bhatnagar, Youran Sun, Chi Andrew Zhang, Yixin Wen, Haizhao Yang

机构 * University of Maryland, College Park, MD, USA(马里兰大学) University of Chicago, Chicago, IL, USA(芝加哥大学) University of Florida, Gainesville, FL, USA(佛罗里达大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 DRIFT通过分析LLM中间层的置信度信号,提出轻量级探针和路由器,实现高效事实真实性检测,提升多个基准测试的AUROC性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17799 2026-01-30 cs.LG cs.CV 57%

A Coreset Selection of Coreset Selection Literature: Introduction and Recent Advances

关于核心集选择文献的综述:介绍与最新进展

Brian B. Moser, Arundhati S. Shanbhag, Stanislav Frolov, Federico Raue, Joachim Folz, Andreas Dengel

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) RPTU Kaiserslautern-Landau(科隆大学(RPTU)凯斯堡-兰道)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文综述了核心集选择的最新进展,统一了无训练、有训练和无标签方法,并探讨了剪枝策略对泛化能力的影响及未来挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08488 2026-01-30 cs.LG 57%

One-Shot Federated Learning with Classifier-Free Diffusion Models

单次联邦学习与无分类器扩散模型

Obaidullah Zaland, Shutong Jin, Florian T. Pokorny, Monowar Bhuyan

机构 * Linköping University(_linköping大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 OSCAR通过无分类器扩散模型实现单次联邦学习,减少通信开销并提升性能。

Comments Published in IEEE ICME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20890 2026-01-30 cs.SD cs.CL eess.AS 57%

SW-ASR: A Context-Aware Hybrid ASR Pipeline for Robust Single Word Speech Recognition

SW-ASR:一种面向鲁棒单字语音识别的上下文感知混合ASR流水线

Manali Sharma, Riya Naik, Buvaneshwari G

机构 * Tetranetics Private Limited(特兰尼克斯私人有限公司)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 SW-ASR通过结合上下文感知和轻量验证机制,提升单字语音识别在噪声和压缩信道中的鲁棒性,适用于实时通信场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20883 2026-01-30 cs.SD cs.CR cs.LG eess.AS 57%

VoxMorph: Scalable Zero-shot Voice Identity Morphing via Disentangled Embeddings

VoxMorph: 通过解耦嵌入实现可扩展的零样本语音身份变形

Bharath Krishnamurthy, Ajita Rattani

机构 * University of North Texas, Denton, Texas, USA(德克萨斯大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 VoxMorph通过解耦嵌入实现零样本语音身份变形,提升音频质量并降低可懂性错误,显著提高语音变形攻击成功率。

Comments Accepted to IEEE ICASSP 2026 (51st International Conference on Acoustics, Speech, and Signal Processing, ICASSP 2026). 5 pages, 1 figure, 3 tables. Project page: https://vcbsl.github.io/VoxMorph/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01764 2026-01-30 cs.LG 57%

A Trainable Optimizer

可训练优化器

Ruiqi Wang, Diego Klabjan

机构 * Industrial Engineering and Management Sciences, Northwestern University, Evanston, IL, USA, 60201(西北大学工业工程与管理科学学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 本文提出可训练优化器,通过联合训练梯度估计器和模型权重,实现比ADAM更快的收敛速度,并在强凸和非凸设置中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04969 2026-01-30 cs.CL 57%

EVA-Score: Evaluating Abstractive Long-form Summarization on Informativeness through Extraction and Validation

EVA-Score:通过提取与验证评估抽象长形式摘要的信息性

Yuchen Fan, Yazhe Wan, Xin Zhong, Haonan Cheng, Ning Ding, Bowen Zhou

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出EVA-Score,通过提取和验证评估抽象长形式摘要的信息性,发现其与人类评价的关联性最高,揭示了LLM在长形式摘要任务中的不足。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.09629 2026-01-30 cs.CL 57%

HiStruct+: Improving Extractive Text Summarization with Hierarchical Structure Information

HiStruct+: 通过层次结构信息提升基于提取的文本摘要

Qian Ruan, Malte Ostendorff, Georg Rehm

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 HiStruct+通过显式注入层次结构信息,提升提取式摘要的ROUGEs指标,在PubMed和arXiv数据集上取得显著效果。

Comments 17 pages, 3 figures, to be published in Findings ACL 2022

Journal ref Findings of the Association for Computational Linguistics ACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21022 2026-01-30 cs.CV 50%

AI-based Prediction of Biochemical Recurrence from Biopsy and Prostatectomy Samples

基于AI的生物化学复发预测:从活检和前列腺切除样本

Andrea Camilloni, Chiara Micoli, Nita Mulliqi, Erik Everett Palm, Thorgerdur Palsdottir, Kelvin Szolnoky, Xiaoyi Ji, Sol Erika Boman, Andrea Discacciati, Henrik Grönberg, Lars Egevad, Tobias Nordström, Kimmo Kartasalo, Martin Eklund

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出基于AI的模型,利用活检和前列腺切除样本预测生物化学复发风险,展示了AI在前列腺癌预后评估中的应用价值。

Comments 39 pages, 6 tables, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20354 2026-01-30 cs.CV 50%

Everything in Its Place: Benchmarking Spatial Intelligence of Text-to-Image Models

万物皆有其位:文本到图像模型空间智能基准测试

Zengbin Wang, Xuecai Hu, Yong Wang, Feng Xiong, Man Zhang, Xiangxiang Chu

机构 * AMAP, Alibaba Group(AMAP、阿里巴巴集团)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出SpatialGenEval基准测试,通过信息密集的提示评估文本到图像模型的空间智能,揭示高阶空间推理的瓶颈,并构建SpatialT2I数据集提升模型性能。

Comments Accepted by ICLR 2026, URL: https://github.com/AMAP-ML/SpatialGenEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25731 2026-01-30 cs.CV 50%

LaTo: Landmark-tokenized Diffusion Transformer for Fine-grained Human Face Editing

LaTo:基于地标token化的扩散变换器用于精细的人脸编辑

Zhenghao Zhang, Ziying Zhang, Junchao Liao, Xiangyu Meng, Qiang Hu, Siyu Zhu, Xiaoyun Zhang, Long Qin, Weizhi Wang

机构 * Alibaba Cloud Computing(阿里云计算) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 评测与基准 :language model(abstract)

AI总结 LaTo通过地标token化扩散变换器实现精细的人脸编辑,提升身份保持与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 70 篇

2601.22030 2026-01-30 cs.LG 89%

Per-parameter Task Arithmetic for Unlearning in Large Language Models

针对大语言模型中遗忘的参数任务运算

Chengyi Cai, Zesheng Ye, Jiangchao Yao, Jianzhong Qi, Bo Han, Xiaolu Zhang, Feng Liu, Jun Zhou

机构 * The University of Melbourne(墨尔本大学) Shanghai Jiao Tong University(上海交通大学) Hong Kong Baptist University(香港 Baptist 大学) Ant Group(蚂蚁集团)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 PerTA通过参数级调整优化大语言模型的遗忘过程,提升遗忘效果和模型实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21822 2026-01-30 cs.AI 89%

CORE:Toward Ubiquitous 6G Intelligence Through Collaborative Orchestration of Large Language Model Agents Over Hierarchical Edge

CORE:通过分层边缘的协作编排实现无处不在的6G智能

Zitong Yu, Boquan Sun, Yang Li, Zheyan Qu, Xing Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 CORE通过协作编排多个LLM代理在分层边缘网络中实现高效任务处理,提升6G环境下的系统效率和任务完成率。

Comments Accepted by IEEE Communications Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21132 2026-01-30 cs.CL 89%

Large Language Models Naively Recover Ethnicity from Individual Records

大语言模型盲目从个人记录中推断种族

Noah Dasanaike

机构 * Harvard University(哈佛大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 大语言模型通过分析姓名推断种族,准确率高于BISG,且适用于多种地区和分类场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17868 2026-01-30 cs.CV cs.AI 89%

VidLaDA: Bidirectional Diffusion Large Language Models for Efficient Video Understanding

VidLaDA:双向扩散大型语言模型用于高效视频理解

Zhihao He, Tieyuan Chen, Kangyu Wang, Ziran Qin, Yang Shao, Chaofan Gan, Shijie Li, Zuxuan Wu, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) ZhongguanCun Academy(中关村学院) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 VidLaDA通过双向注意力和MARS-Cache技术,提升视频理解效率,实现比现有方法更优的性能与速度

详情

展开后加载摘要…

URL PDF HTML 收藏