arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-06 至 2026-01-06 共收录 264 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 71 篇

2601.01751 2026-01-06 cs.IR cs.AI cs.CL 86%

Query-Document Dense Vectors for LLM Relevance Judgment Bias Analysis

用于LLM相关性判断偏差分析的查询-文档密集向量

Samaneh Mohtadi, Gianluca Demartini

机构 * The University of Queensland, Brisbane, Australia(昆士兰大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于聚类的框架,用于分析LLM在相关性判断中的系统性偏差,通过语义空间嵌入识别分歧模式,提升IR评估的可靠性。

Comments Accepted for presentation at the ECIR 2026 Full Papers track

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09082 2026-01-06 cs.CL cs.AI 86%

CoSER: A Comprehensive Literary Dataset and Framework for Training and Evaluating LLM Role-Playing and Persona Simulation

CoSER:一个综合的文学数据集和框架,用于训练和评估LLM角色扮演和人设模拟

Xintao Wang, Heng Wang, Yifei Zhang, Xinfeng Yuan, Rui Xu, Jen-tse Huang, Siyu Yuan, Haoran Guo, Jiangjie Chen, Shuchang Zhou, Wei Wang, Yanghua Xiao

机构 * Fudan University(复旦大学) StepFun Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);language agent(abstract)

AI总结 CoSER通过高质量文学数据集和开放模型,训练和评估LLM角色扮演能力,其70B模型在多个基准测试中超越GPT-4o。

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00912 2026-01-06 cs.IR cs.AI 85%

The Discovery Gap: How Product Hunt Startups Vanish in LLM Organic Discovery Queries

发现鸿沟:产品猎奇初创企业如何在LLM有机发现查询中消失

Amit Prakash Sharma

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究发现,初创企业在LLM有机发现查询中难以被识别,传统SEO信号比AI优化更有效。

Comments 20 pages, 7 figures. Based on M.Tech thesis research, Indian Institute of Technology Patna, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24052 2026-01-06 cs.SD cs.AI cs.CL cs.MM 84%

AHA: Aligning Large Audio-Language Models for Reasoning Hallucinations via Counterfactual Hard Negatives

AHA: 通过反事实硬负样本对齐大音频-语言模型以缓解推理幻觉

Yanxi Chen, Wenhui Zhu, Xiwen Chen, Zhipeng Wang, Xin Li, Peijie Qiu, Hao Wang, Xuanzhao Dong, Yujian Xiong, Anderson Schneider, Yuriy Nevmyvaka, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆斯大学) Washington University in St.Louis(圣路易斯华盛顿大学) Rice University(Rice 大学) Morgan Stanley(摩根大通)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 AHA通过反事实硬负样本对齐大音频-语言模型,有效减少推理幻觉,提升时间推理能力,并在多个基准测试中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25743 2026-01-06 cs.LG cs.CL 84%

Rotation Control Unlearning: Quantifying and Controlling Continuous Unlearning for LLM with The Cognitive Rotation Space

旋转控制反学习:量化和控制LLM连续反学习的连续反学习的认知旋转空间

Xiang Zhang, Kun Wei, Xu Yang, Jiahua Li, Su Yan, Cheng Deng

机构 * School of Electronic Engineering, Xidian University(电子工程学院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出旋转控制反学习方法,通过认知旋转空间量化和控制连续反学习过程,有效解决累积灾难性效用损失问题,并在无保留数据集的情况下实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09665 2026-01-06 cs.SI cs.CL 83%

Tales of the 2025 Los Angeles Fire: Hotwash for Public Health Concerns in Reddit via LLM-Enhanced Topic Modeling

2025年洛杉矶火灾故事:通过LLM增强的专题建模在Reddit上进行公共健康担忧的热洗

Sulong Zhou, Qunying Huang, Shaoheng Zhou, Yun Hang, Xinyue Ye, Aodong Mei, Kathryn Phung, Yuning Ye, Uma Govindswamy, Zehan Li

机构 * Department of Landscape Architecture and Urban Planning & Urban Artificial Intelligence Lab, Texas A&M University(景观建筑与城市规划系及城市人工智能实验室,德克萨斯农工大学) Geography, University of Wisconsin-Madison(地理系,威斯康星大学麦迪逊分校) Google(谷歌) Department of Environmental and Occupational Health Sciences, School of Public Health, University of Texas Health Science Center at Houston(环境与职业健康科学系,公共卫生学院,德克萨斯健康科学中心休斯顿分部) McWilliams School of Biomedical Informatics, University of Texas Health Science Center at Houston(麦克威廉斯生物医学信息学学院,德克萨斯健康科学中心休斯顿分部)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过LLM增强的专题建模分析2025年洛杉矶野火期间Reddit上的公众言论,识别出公共健康担忧和心理健康风险,构建了分层框架用于危机话语分析。

Comments Fix typos in Method Section. Add data/code availability

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01366 2026-01-06 cs.AI 83%

KGCE: Knowledge-Augmented Dual-Graph Evaluator for Cross-Platform Educational Agent Benchmarking with Multimodal Language Models

KGCE:基于多模态语言模型的跨平台教育代理基准评估知识增强双图评估器

Zixian Liu, Sihao Liu, Yuqi Zhao

机构 * Faculty of the School of Computer Science, Central China Normal University(中央财经大学计算机学院)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 KGCE提出一种基于多模态语言模型的跨平台教育代理基准评估框架,通过知识库增强和双图评估方法提升对特定学校软件任务的执行效率和评估精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02337 2026-01-06 cs.CL 81%

Robust Persona-Aware Toxicity Detection with Prompt Optimization and Learned Ensembling

基于提示优化和学习集成的鲁棒人格感知毒性检测

Berk Atil, Rebecca J. Passonneau, Ninareh Mehrabi

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Resolution

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究提出了一种基于提示优化和学习集成的鲁棒人格感知毒性检测方法,通过系统评估和元集成技术提升不同人格下的毒性检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01844 2026-01-06 cs.AI 81%

Clinical Knowledge Graph Construction and Evaluation with Multi-LLMs via Retrieval-Augmented Generation

基于多语言模型的临床知识图谱构建与评估:通过检索增强生成

Udiptaman Das, Krishnasai B. Atmakuri, Duy Ho, Chi Lee, Yugyung Lee

机构 * University of Missouri–Kansas City(密苏里大学-堪萨斯城分校) California State University, Fullerton(加州州立大学弗雷斯诺分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出基于多语言模型的临床知识图谱构建与评估框架,通过检索增强生成策略实现从自由文本到可解释、临床相关知识图谱的端到端构建与持续优化。

Comments 13 pages, 5 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01825 2026-01-06 cs.CL 81%

CSCBench: A PVC Diagnostic Benchmark for Commodity Supply Chain Reasoning

CSCBench: 一种用于商品供应链推理的PVC诊断基准

Yaxin Cui, Yuanqiang Zeng, Jiapeng Yan, Keling Lin, Kai Ji, Jianhui Zeng, Sheng Zhang, Xin Luo, Binzhu Su, Chaolai Shen, Jiahao Yu

机构 * Xiamen SmartChain Innovations Co., Ltd.(厦门智能链创新有限公司) Xiamen ITG Digital Technology Co., Ltd.(厦门ITG数字科技有限公司) Xiamen C&D Co., Ltd.(厦门C&D有限公司) Xiamen Xiangyu Co., Ltd.(厦门翔宇有限公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 CSCBench通过PVC 3D评估框架,为商品供应链推理提供诊断基准,评估LLMs在过程、品种和认知轴上的表现,发现其在品种轴上尤其存在显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01062 2026-01-06 cs.LG cs.AI cs.CV 81%

SPoRC-VIST: A Benchmark for Evaluating Generative Natural Narrative in Vision-Language Models

SPoRC-VIST:评估视觉语言模型生成自然叙述能力的基准

Yunlin Zeng

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 SPoRC-VIST基准通过合成到现实训练策略评估视觉语言模型生成多说话者播客对话的自然性和深度。

Comments 14 pages, 3 figures. Accepted to WVAQ 2026, WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02215 2026-01-06 cs.SE cs.AI 79%

LLM-Empowered Functional Safety and Security by Design in Automotive Systems

基于大语言模型的汽车系统功能安全与安全设计

Nenad Petrovic, Vahid Zolfaghari, Fengjunjie Pan, Alois Knoll

机构 * European Chips Joint Undertaking(欧洲芯片联合计划) Federal Ministry of Research, Technology and Space of Germany(德国联邦科研、技术和空间 ministry)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出利用大语言模型提升汽车系统功能安全与安全设计的方法,通过事件链模型和MDE方法实现安全拓扑设计和代码分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01373 2026-01-06 cs.SD cs.AI eess.AS 79%

UltraEval-Audio: A Unified Framework for Comprehensive Evaluation of Audio Foundation Models

UltraEval-Audio: 一个用于音频基础模型全面评估的统一框架

Qundong Shi, Jie Zhou, Biyuan Lin, Junbo Cui, Guoyang Zeng, Yixuan Zhou, Ziyang Wang, Xin Liu, Zhen Luo, Yudong Wang, Zhiyuan Liu

机构 * ModelBest Inc.(ModelBest公司) Tsinghua University(清华大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 UltraEval-Audio提出一个统一框架,解决音频模型评估的统一性、编解码器评估和中文基准问题,提供多语言支持和实时排行榜。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01094 2026-01-06 cs.HC cs.AI cs.IR 79%

SoulSeek: Exploring the Use of Social Cues in LLM-based Information Seeking

SoulSeek:探索在基于大语言模型的信息检索中利用社会线索的使用

Yubo Shu, Peng Zhang, Meng Wu, Yan Chen, Haoxuan Zhou, Guanming Liu, Yu Zhang, Liuxin Zhang, Qianying Wang, Tun Lu, Ning Gu

机构 * Fudan University(复旦大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 SoulSeek通过整合社会线索到基于大语言模型的信息检索中,提升用户感知和反思性信息行为,揭示当前LLM搜索的局限性,并提出设计改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14133 2026-01-06 cs.CL 79%

Performance Gap in Entity Knowledge Extraction Across Modalities in Vision Language Models

视觉语言模型中实体知识提取跨模态性能差距

Ido Cohen, Daniela Gottesman, Mor Geva, Raja Giryes

机构 * Tel Aviv University(特拉维夫大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 研究视觉语言模型在跨模态实体知识提取中的性能差异,揭示信息流动限制及模型推理效率问题。

Comments Accepted to ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00868 2026-01-06 cs.LG cs.AI 79%

SmartFlow Reinforcement Learning and Agentic AI for Bike-Sharing Optimisation

SmartFlow 强化学习与代理AI用于自行车共享优化

Aditya Sreevatsa K, Arun Kumar Raveendran, Jesrael K Mani, Prakash G Shigli, Rajkumar Rangadore, Narayana Darapaneni, Anwesh Reddy Paduri

机构 * Department of Data Science, Machine Learning \& Artificial Intelligence, PES University, Bengaluru, Karnataka - 560100, India 1 Sunrise Setting Ltd, 12a Fore Street, St. Marychurch, Torquay, Devon, TQ1 4NE, UK 2 European Alliance for Innovation (EAI), Gent, Belgium

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SmartFlow 通过整合强化学习与代理AI,实现城市自行车共享系统的高效再平衡,显著减少网络不平衡并提升运营效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00998 2026-01-06 cs.CV 78%

DVGBench: Implicit-to-Explicit Visual Grounding Benchmark in UAV Imagery with Large Vision-Language Models

DVGBench: 面向无人机影像的隐式到显式视觉 grounding 评估基准

Yue Zhou, Jue Chen, Zilun Zhang, Penghui Huang, Ran Ding, Zhentao Zou, PengFei Gao, Yuchen Wei, Ke Li, Xue Yang, Xue Jiang, Hongxin Yang, Jonathan Li

机构 * Hinton STAI Institute(Hinton STAI研究所) Key Laboratory of Geographic Information Science (Ministry of Education), East China Normal University(地理信息科学重点实验室(教育部)) School of Geospatial Artificial Intelligence, East China Normal University(地理空间人工智能学院) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Information Engineering University(信息工程大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 DVGBench 是一个面向无人机影像的隐式到显式视觉 grounding 评估基准,通过设计 DroneVG-R1 模型提升 LVLM 的推理能力。

Comments 20 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09385 2026-01-06 cs.CV 78%

Towards Vision-Language Geo-Foundation Model: A Survey

迈向视觉-语言地理基础模型:一种综述

Yue Zhou, Zhihang Zhong, Xue Yang

机构 * School of GeoAI(地理人工智能学院) Hindon STAI Institute(Hindon STAI研究所) Key Laboratory of Geographic Information Science (Ministry of Education)(地理信息科学重点实验室) East China Normal University(华东师范大学) School of AI(人工智能学院) Shanghai Jiao Tong University(上海交通大学) School of Automation and Intelligent Sensing(自动化与智能感知学院)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文综述了视觉-语言地理基础模型(VLGFMs),探讨其背景、核心技术和应用,旨在构建具备多样化地理感知能力的智能模型。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10954 2026-01-06 cs.SE cs.AI 77%

SWE-Factory: Your Automated Factory for Issue Resolution Training Data and Evaluation Benchmarks

SWE-Factory: 你的自动化问题解决训练数据和评估基准工厂

Lianghong Guo, Yanlin Wang, Caihua Li, Wei Tao, Pengyu Yang, Jiachi Chen, Haoyu Song, Duyu Tang, Zibin Zheng

机构 * Sun Yat-sen University(中山大学) Independent Researcher(独立研究者) Huawei Technologies Co, Ltd(华为技术有限公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SWE-Factory通过自动化流程解决GitHub问题解决数据构建中的关键限制,实现高效且准确的评估环境构建与验证。

Comments To appear at FSE'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01786 2026-01-06 cs.LG cs.CR 77%

UnPII: Unlearning Personally Identifiable Information with Quantifiable Exposure Risk

UnPII: 通过可量化暴露风险实现个人可识别信息的删除

Intae Jeon, Yujeong Kwon, Hyungjoon Koo

机构 * Samsung Research(三星研究院) Sungkyunkwan University(松均大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.LG

AI总结 UnPII通过量化PII暴露风险,实现对个人可识别信息的高效删除,提升模型准确性和泛化能力,同时降低训练开销。

Comments 11 pages, 7 Tables, 6 Figures To appear in the Software Engineering in Practice (SEIP) track of ICSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00588 2026-01-06 cs.CL 77%

CSSBench: Evaluating the Safety of Lightweight LLMs against Chinese-Specific Adversarial Patterns

CSSBench: 评估轻量级大语言模型对中文特定对抗模式的安全性

Zhenhong Zhou, Shilinlu Yan, Chuanpu Liu, Qiankun Li, Kun Wang, Zhigang Zeng

机构 * Nanyang Technological University(南洋理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CSSBench通过评估中文特定对抗模式,揭示轻量级大语言模型在中文环境下的安全挑战,为实际应用提供安全评估框架。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18829 2026-01-06 cs.AI 77%

HARBOR: Holistic Adaptive Risk assessment model for BehaviORal healthcare

HARBOR:面向行为医疗的综合自适应风险评估模型

Aditya Siddhant

机构 * Aditya Siddhant(独立研究者)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HARBOR模型通过整合多模态数据,有效预测行为医疗中的情绪和风险评分,实现69%的准确率,优于传统方法和现有LLMs。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01271 2026-01-06 cs.SE 75%

CatchAll: Repository-Aware Exception Handling with Knowledge-Guided LLMs

CatchAll: 基于知识引导的LLM仓库感知异常处理

Qingxiao Tao, Xiaodong Gu, Hao Zhong, Beijun Shen

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 CatchAll通过引入三种互补的异常处理知识层,提升LLM在仓库级别异常处理的准确性与上下文感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21811 2026-01-06 cs.DB cs.GR 75%

Revisiting Graph Analytics Benchmark

重新审视图分析基准

Lingkai Meng, Yu Shao, Long Yuan, Longbin Lai, Peng Cheng, Xue Li, Wenyuan Yu, Wenjie Zhang, Xuemin Lin, Jingren Zhou

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种新的图分析基准,通过选择核心算法、设计数据生成器和引入LLM评估框架,全面评估平台性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23065 2026-01-06 cs.CL 74%

TabiBERT: A Large-Scale ModernBERT Foundation Model and A Unified Benchmark for Turkish

TabiBERT: 一种大规模的现代BERT基础模型及土耳其语统一基准

Melikşah Türker, A. Ebrar Kızıloğlu, Onur Güngör, Susan Üsküdarlı

机构 * Department of Computer Engineering, Boğaziçi University, Türkiye(计算机工程系,博雅大学,土耳其) VNGRS, Istanbul, Türkiye(VNGRS,伊斯坦布尔,土耳其)

专题命中 评测与基准 :foundation model(title);分类 cs.CL

AI总结 TabiBERT是一种基于ModernBERT架构的土耳其语基础模型,通过大规模预训练在多领域语料库上实现高效推理和跨领域泛化,其在多个任务上优于现有模型。

Comments 33 pages, 2 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01543 2026-01-06 cs.CL cs.AI 73%

Bridging the Data Gap: Creating a Hindi Text Summarization Dataset from the English XSUM

弥合数据鸿沟:从英语XSUM创建印地语文本摘要数据集

Praveenkumar Katwe, RakeshChandra Balabantaray, Kaliprasad Vittala

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过利用英语XSUM数据集,开发了低成本自动化框架,生成印地语文本摘要数据集,以弥补低资源语言在高质量数据集方面的不足。

Comments Book chapter for River publications

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01401 2026-01-06 cs.CL cs.LG 73%

LANCET: Neural Intervention via Structural Entropy for Mitigating Faithfulness Hallucinations in LLMs

LANCET: 通过结构熵进行神经干预以缓解大语言模型中的忠实幻觉

Chenxu Wang, Chaozhuo Li, Pengbo Wang, Litian Zhang, Songyang Liu, Ji Qi, Jiahui Hu, Yushan Cai, Hao Zhao, Rui Pu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) China National Petroleum Corporation(中国石油天然气集团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 Lancet通过结构熵和幻觉差异比率实现精确神经干预,有效缓解大语言模型中的忠实幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01878 2026-01-06 cs.AI cs.CY 70%

Theory Trace Card: Theory-Driven Socio-Cognitive Evaluation of LLMs

理论追溯卡:基于理论的社认知评估方法

Farzan Karimi-Malekabadi, Suhaib Abdurahman, Zhivar Sourati, Jackson Trager, Morteza Dehghani

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出理论追溯卡(TTC)以解决LLMs社会认知评估中理论基础缺失的问题,通过明确理论依据和能力组件,提升评估的可解释性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01836 2026-01-06 cs.AI cs.CY 70%

COMPASS: A Framework for Evaluating Organization-Specific Policy Alignment in LLMs

COMPASS:一个评估大语言模型在组织特定政策对齐性的框架

Dasol Choi, DongGeon Lee, Brigitta Jesica Kartono, Helena Berndt, Taeyoun Kwon, Joonwon Jang, Haon Park, Hwanjo Yu, Minsuk Kahng

机构 * AIM Intelligence(AIM智能科技) BMW Group(宝马集团) Yonsei University(延世大学) POSTECH Seoul National University(首尔国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 COMPASS框架通过评估大语言模型在组织特定政策下的对齐性,揭示了模型在合规性与对抗性鲁棒性上的显著差异,为组织AI安全提供了关键评估工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01765 2026-01-06 cs.AI cs.SE 70%

A New Benchmark for the Appropriate Evaluation of RTL Code Optimization

为RTL代码优化提供新的基准测试

Yao Lu, Shang Liu, Hangan Zhou, Wenji Fang, Qijun Zhang, Zhiyao Xie

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出RTL-OPT基准测试,用于评估大语言模型在RTL代码优化中的能力,通过手工设计的36个数字电路和人工优化的参考代码,提供标准化的评估框架以量化PPA改进。

详情

展开后加载摘要…

URL PDF HTML 收藏