arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-14 至 2026-01-14 共收录 188 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 41 篇

2601.05371 2026-01-14 cs.LG stat.ME 77%

The Kernel Manifold: A Geometric Approach to Gaussian Process Model Selection

核流形:一种基于核的高斯过程模型选择的几何方法

Md Shafiqul Islam, Shakti Prasad Padhy, Douglas Allaire, Raymundo Arróyave

机构 * organization= Department of Materials Science Engineering, Texas A\&M University , city= College Station , postcode= 77843 , state= TX , country= USA organization= J. Mike Walker '66 Department of Mechanical Engineering, Texas A\&M University , city= College Station , postcode= 77843 , state= TX , country= USA

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于核几何的贝叶斯优化框架,通过多维标度嵌入实现核空间的高效探索,提升高斯过程模型的预测准确性和不确定性校准。

Comments Included a subsection named "Budgetary impact of inline kernel optimization during BO", and corrected label of a figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09243 2026-01-14 cs.CL cs.AI 76%

CrisiText: A dataset of warning messages for LLM training in emergency communication

CrisiText: 一个用于LLM训练的紧急通讯警示信息数据集

Giacomo Gonella, Gian Maria Campedelli, Stefano Menini, Marco Guerini

机构 * Fondazione Bruno Kessler(布雷诺克瑟拉基金会) University of Trento(特伦托大学)

专题命中 评测与基准 :LLM(title);分类 cs.CL、cs.AI

AI总结 CrisiText是首个大规模危机警示信息数据集,通过生成13种危机场景下的警示信息,提升LLM在紧急通讯中的训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23824 2026-01-14 cs.SE 75%

SolContractEval: A Benchmark for Evaluating Contract-Level Solidity Code Generation

SolContractEval: 一个用于评估合同级Solidity代码生成的基准

Zhifan Ye, Jiachi Chen, Zhenzhe Shao, Lingfeng Bao, Xiaohu Yang, Zhongxin Liu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SolContractEval是一个用于评估Solidity代码生成的合同级基准,发现Claude-3.7-Sonnet在整体表现最佳,但模型在复杂逻辑和Solidity特定功能上仍有不足。

Comments Accepted by ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18882 2026-01-14 cs.CY 75%

Personalized Safety in LLMs: A Benchmark and A Planning-Based Agent Approach

大语言模型中的个性化安全:一个基准和基于规划的代理方法

Yuchen Wu, Edward Sun, Kaijie Zhu, Jianxun Lian, Jose Hernandez-Orallo, Aylin Caliskan, Jindong Wang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出个性化安全框架PENGUIN和RAISE,通过获取用户背景信息提升LLM的安全性,实验显示安全评分提升达31.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08634 2026-01-14 cs.CL cs.AI 73%

Moral Lenses, Political Coordinates: Towards Ideological Positioning of Morally Conditioned LLMs

道德透镜,政治坐标:迈向道德条件化大语言模型的意识形态定位

Chenchen Yuan, Bolei Ma, Zheyu Zhang, Bardh Prenkaj, Frauke Kreuter, Gjergji Kasneci

机构 * Technical University of Munich(慕尼黑技术大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过道德条件化大语言模型,探索道德价值观与政治倾向之间的因果关系,揭示道德取向对政治坐标的影响,并提出更社会化的对齐方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08509 2026-01-14 cs.AI cs.CL 73%

What If TSF: A Benchmark for Reframing Forecasting as Scenario-Guided Multimodal Forecasting

如果TSF:一个用于将预测重新框架化为基于场景的多模态预测的基准

Jinkwan Jang, Hyunbin Jin, Hyungjin Park, Kyubyung Chae, Taesup Kim

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 What If TSF是一个用于评估模型是否能根据上下文文本,特别是未来场景,进行多模态预测的基准。

Comments 30 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10326 2026-01-14 cs.AI cs.GT cs.LG cs.MA 73%

VGC-Bench: Towards Mastering Diverse Team Strategies in Competitive Pokémon

VGC-Bench: 向掌握多样化团队策略的竞技宝可梦迈进

Cameron Angliss, Jiaxun Cui, Jiaheng Hu, Arrasy Rahman, Peter Stone

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 VGC-Bench通过提供标准化评估和人类对战数据集,研究如何让AI代理在多样化团队策略的竞技宝可梦中实现稳健适应与泛化。

Comments AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08748 2026-01-14 cs.CV cs.AI 70%

UR-Bench: A Benchmark for Multi-Hop Reasoning over Ultra-High-Resolution Images

UR-Bench:面向超高清图像的多跳推理基准

Siqi Li, Xinyu Cai, Jianbiao Mei, Nianchen Deng, Pinlong Cai, Licheng Wen, Yufan Shen, Xuemeng Yang, Botian Shi, Yong Liu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 UR-Bench是一个针对超高清图像多跳推理的基准,通过引入代理框架和语义工具,评估大语言模型在极端视觉信息下的推理能力。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07972 2026-01-14 cs.CL 70%

Knowing But Not Doing: Convergent Morality and Divergent Action in LLMs

知晓而不做:在大语言模型中收敛的道德与发散的行为

Jen-tse Huang, Jiantong Qin, Xueli Qiu, Sharon Levy, Michelle R. Kaufman, Mark Dredze

机构 * Johns Hopkins University(约翰霍普金斯大学) Chinese University of Hong Kong(香港中文大学) Rutgers University(罗格斯大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究揭示了大语言模型在价值对齐训练下仍存在知识与行为之间的不一致,通过ValAct-15k数据集发现模型在情境决策上高度一致,但自我报告与实际行为关联较弱。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06663 2026-01-14 cs.AI 70%

SafePro: Evaluating the Safety of Professional-Level AI Agents

SafePro:评估专业级AI代理的安全性

Kaiwen Zhou, Shreedhar Jangam, Ashwin Nagarajan, Tejas Polu, Suhas Oruganti, Chengzhi Liu, Ching-Chen Kuo, Yuting Zheng, Sravana Narayanaraju, Xin Eric Wang

机构 * UCSC(加州大学圣塔 Cruz 分校) UCSB(加州大学圣塔 Barbara 分校) eBay(eBay 公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SafePro通过高复杂度专业任务数据集评估专业级AI代理的安全性,揭示了现有模型在安全判断和对齐方面的不足,并提出了改进安全性的策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15718 2026-01-14 cs.CL 70%

Beyond the Turn-Based Game: Enabling Real-Time Conversations with Duplex Models

超越回合制游戏:通过双工模型实现实时对话

Xinrong Zhang, Yingfa Chen, Shengding Hu, Xu Han, Zihang Xu, Yuanwei Xu, Weilin Zhao, Maosong Sun, Zhiyuan Liu

机构 * NLP Group, DCST, IAI, BNRIST, Tsinghua University, Beijing, China(自然语言处理组、国防科技大学、人工智能研究院、北京理工大学、清华大学、北京、中国) Quan Cheng Laboratory, Jinan, China(泉城实验室、济南、中国) Modelbest Inc.(Modelbest公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出双工模型,通过时间分割复用策略实现实时对话,提升用户与AI交互的自然度和满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00634 2026-01-14 cs.SE cs.HC 67%

Does GenAI Make Usability Testing Obsolete?

生成式AI会使可用性测试过时吗?

Ali Ebrahimi Pourasad, Walid Maalej

专题命中 评测与基准 :LLM(abstract);language model(abstract)

AI总结 本文提出UX-LLM,一种基于大视觉语言模型的可用性问题预测工具,虽无法完全替代传统测试,但可作为补充,尤其适用于资源有限的小型团队。

Comments Accepted for publication at The 47th IEEE/ACM International Conference on Software Engineering ICSE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08682 2026-01-14 cs.CL cs.AI 62%

Lessons from the Field: An Adaptable Lifecycle Approach to Applied Dialogue Summarization

领域经验:一种适用于应用对话摘要的可适应生命周期方法

Kushal Chawla, Chenyang Zhu, Pengshan Cai, Sangwoo Cho, Scott Novotney, Ayushman Singh, Jonah Lewis, Keasha Safewright, Alfy Samuel, Erin Babinsky, Shi-Xiong Zhang, Sambit Sahu

机构 * Capital One

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种适用于应用对话摘要的可适应生命周期方法,通过行业案例研究探讨了在动态需求下构建可靠摘要系统的挑战与解决方案。

Comments EACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07309 2026-01-14 cs.CL cs.LG 62%

PIE: Performance Interval Estimation for Free-Form Generation Tasks

PIE:用于自由形式生成任务的性能区间估计

Chi-Yang Hsu, Alexander Braylan, Yiheng Su, Matthew Lease, Omar Alonso

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Amazon(亚马逊)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 PIE提出了一种用于自由形式生成任务的性能区间估计方法,通过回归实现更准确的指标评分和校准的不确定性区间。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12056 2026-01-14 cs.CV cs.AI cs.LG eess.IV 62%

Kuro Siwo: 33 billion $m^2$ under the water. A global multi-temporal satellite dataset for rapid flood mapping

Kuro Siwo:33十亿平方米水下区域。一个全球多时相卫星数据集,用于快速洪水制图

Nikolaos Ioannis Bountos, Maria Sdraka, Angelos Zavras, Ilektra Karasante, Andreas Karavias, Themistocles Herekakis, Angeliki Thanasou, Dimitrios Michail, Ioannis Papoutsis

机构 * Orion Lab National Observatory of Athens & National Technical University of Athens(奥里昂实验室 希腊国家天文台 & 希腊技术大学) Harokopio University of Athens(哈罗基奥大学 希腊)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 Kuro Siwo是一个全球多时相卫星数据集,用于快速洪水制图,包含33十亿平方米的洪水和永久水域数据,并提供优化的SAR数据产品和基准测试。

Comments Accepted at the 38th Conference on Neural Information Processing Systems (NeurIPS 2024) Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08156 2026-01-14 cs.AI 61%

Project Synapse: A Hierarchical Multi-Agent Framework with Hybrid Memory for Autonomous Resolution of Last-Mile Delivery Disruptions

Project Synapse:一种具有混合记忆的分层多智能体框架,用于自主解决最后一公里配送中断

Arin Gopalan Yadav, Varad Dherange, Kumar Shivam

机构 * Department of Computer Science Engineering(计算机科学与工程系) Vellore Institite of Technology University(韦洛尔理工学院)

专题命中 评测与基准 :LLM(abstract,comments);分类 cs.AI

AI总结 Project Synapse通过混合记忆的分层多智能体框架,实现对最后一公里配送中断的自主解决,利用LangGraph管理复杂工作流,并通过基准数据集和LLM-as-a-Judge协议验证性能。

Comments We propose and evaluate a hierarchical LLM-driven multi-agent framework for adaptive disruption management in last-mile logistics, integrating planning, coordination, and natural-language reasoning. The system is validated through simulation-based experiments and qualitative analysis. Includes figures and tables. 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08342 2026-01-14 cs.CL 57%

Detecting Mental Manipulation in Speech via Synthetic Multi-Speaker Dialogue

通过合成多说话对话检测心理操控

Run Chen, Wen Liang, Ziwei Gong, Lin Ai, Julia Hirschberg

机构 * Columbia University(哥伦比亚大学) Red Hat(红帽公司)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出首个通过合成多说话对话检测心理操控的研究,揭示语音与文本在检测准确性上的差异,强调多模态对话系统中模态意识的重要性。

Comments Accepted to IWSDS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08333 2026-01-14 cs.AI 57%

Semantic Laundering in AI Agent Architectures: Why Tool Boundaries Do Not Confer Epistemic Warrant

人工智能代理架构中的语义清洗:为什么工具边界不赋予认知证成

Oleg Romanchuk, Roman Bondar

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文指出基于LLM的代理架构中存在语义清洗问题,即缺乏证成的命题通过架构信任接口被接受,导致认知证成无法消除。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08105 2026-01-14 cs.CL 57%

Query Suggestion for Retrieval-Augmented Generation via Dynamic In-Context Learning

通过动态上下文学习实现检索增强生成的查询建议

Fabian Spaeh, Tianyi Chen, Chen-Hao Chiang, Bin Shen

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出通过动态上下文学习实现检索增强生成的查询建议,以提升用户交互的安全性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17875 2026-01-14 cs.CV cs.LG 57%

Visually Prompted Benchmarks Are Surprisingly Fragile

通过视觉提示的基准测试出人意料地脆弱

Haiwen Feng, Long Lian, Lisa Dunlap, Jiahao Shu, XuDong Wang, Renhao Wang, Trevor Darrell, Alane Suhr, Angjoo Kanazawa

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :prompting(abstract);分类 cs.LG

AI总结 研究发现视觉提示基准测试对细节敏感,通过创建VPBench减少不稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04295 2026-01-14 cs.SE cs.AI 57%

EvoC2Rust: A Skeleton-guided Framework for Project-Level C-to-Rust Translation

EvoC2Rust:一个指导骨架的项目级C到Rust翻译框架

Chaofan Wang, Tingrui Yu, Beijun Shen, Jie Wang, Dong Chen, Wenrui Zhang, Yuling Shi, Chen Xie, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 EvoC2Rust通过结合规则和LLM方法,提升项目级C到Rust翻译的准确性和安全性

Comments Accepted by ICSE 2026 SEIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08657 2026-01-14 cs.NE 50%

NEVO-GSPT: Population-Based Neural Network Evolution Using Inflate and Deflate Operators

NEVO-GSPT:基于 Inflate 和 Deflate 操作符的群体神经网络进化

Davide Farinati, Frederico J. J. B. Santos, Leonardo Vanneschi, Mauro Castelli

专题命中 评测与基准 :SLM(abstract)

AI总结 NEVO-GSPT通过引入 Inflate和Deflate操作符,实现高效神经网络进化,生成性能优异的紧凑型网络。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08470 2026-01-14 cs.CV 50%

Towards Safer Mobile Agents: Scalable Generation and Evaluation of Diverse Scenarios for VLMs

迈向更安全的移动代理:为视觉语言模型(VLMs)可扩展生成和评估多样化场景

Takara Taniguchi, Kuniaki Saito, Atsushi Hashimoto

机构 * OMRON SINIC X

专题命中 评测与基准 :language model(abstract)

AI总结 本研究提出HazardForge框架,用于生成多样化场景以评估VLM在复杂环境中的安全决策能力,构建MovSafeBench基准测试并验证VLM在异常场景下的性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08420 2026-01-14 cs.CV 50%

MMLGNet: Cross-Modal Alignment of Remote Sensing Data using CLIP

MMLGNet: 利用CLIP实现遥感数据的跨模态对齐

Aditya Chaudhary, Sneha Barman, Mainak Singha, Ankit Jha, Girish Mishra, Biplab Banerjee

专题命中 评测与基准 :language model(abstract)

AI总结 MMLGNet通过CLIP实现遥感数据的跨模态对齐,利用多模态语言引导网络有效融合光谱、空间和几何信息,提升语义理解能力。

Comments Accepted at InGARSS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08155 2026-01-14 cs.CV 50%

Instance-Aligned Captions for Explainable Video Anomaly Detection

实例对齐的描述用于可解释的视频异常检测

Inpyo Song, Minjun Joo, Joonhyung Kwon, Eunji Jeon, Jangwon Lee

机构 * SungKyunKwan University(顺 Kyun 峰大学)

专题命中 评测与基准 :LLM(abstract)

AI总结 本文提出实例对齐的描述方法,用于提升视频异常检测的可解释性和可信度,通过空间定位和实例关联增强解释的可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 29 篇

2601.07878 2026-01-14 cs.LG cs.AI cs.CL 90%

Sliced-Wasserstein Distribution Alignment Loss Improves the Ultra-Low-Bit Quantization of Large Language Models

切片瓦瑟斯坦分布对齐损失提高了大语言模型的超低比特量化

Deyu Cao, Yixin Yin, Samin Aref

机构 * Department of Information and Communication Engineering, The University of Tokyo(信息与通信工程系,东京大学) Department of Computer Science, University of Toronto(计算机科学系,多伦多大学) Department of Mechanical and Industrial Engineering, University of Toronto(机械与工业工程系,多伦多大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 切片瓦瑟斯坦分布对齐损失通过提升超低比特量化性能,有效恢复模型准确性。

Comments Post-peer-review accepted manuscript, 17 pages including the supplementary information

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08490 2026-01-14 cs.CL cs.AI 90%

BenchOverflow: Measuring Overflow in Large Language Models via Plain-Text Prompts

BenchOverflow: 通过纯文本提示测量大语言模型中的溢出现象

Erin Feiglin, Nir Hutnik, Raz Lapid

机构 * Deepkeep(深保持)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 BenchOverflow通过纯文本提示策略评估大语言模型的溢出现象,揭示长度控制对可靠性、成本和可持续性的影响,提供标准化比较框架以优化部署和防御措施。

Comments Accepted at TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08089 2026-01-14 cs.LG cs.AI 89%

Q-realign: Piggybacking Realignment on Quantization for Safe and Efficient LLM Deployment

Q-realign: 量化驱动的对齐以实现安全高效的LLM部署

Qitao Tan, Xiaoying Song, Ningxi Cheng, Ninghao Liu, Xiaoming Zhai, Lingzi Hong, Yanzhi Wang, Zhen Xiang, Geng Yuan

机构 * University of Georgia(佐治亚大学) University of North Texas(北卡罗来纳州立大学) Hong Kong Polytechnic University(香港理工大学) Northeastern University(东北大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 Q-realign通过量化驱动的对齐方法,在部署流程中实现安全高效的LLM部署,有效减少不安全行为并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22315 2026-01-14 cs.CY 89%

Large Language Models Are Democracy Coders with Attitudes

大型语言模型是带有偏见的民主编码器

Nils B. Weidmann, Mats Faulborn, David García

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文利用大型语言模型对民主指标进行编码,发现其在某些情况下存在偏见,但结合两种模型可缓解问题,但仍难以完全替代人类编码者。

Journal ref APSC 59 (2026) 17-23

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15807 2026-01-14 cs.CL cs.AI 87%

Vocabulary Expansion of Large Language Models via Kullback-Leibler-Based Self-Distillation

通过Kullback-Leibler基于的自蒸馏实现大语言模型词汇扩展

Max Rehman Linder

专题命中 效率与部署 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

AI总结 本研究通过基于KL散度的知识蒸馏方法,实现大语言模型在不改变原有词汇的情况下扩展新领域术语,提升代码生成任务性能。

Comments Master's Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏