arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11785 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2848 篇

2606.07779 2026-06-09 astro-ph.IM astro-ph.GA 新提交 78%

Do Vision-Language Models See Dwarf Galaxies the Way We Do?

视觉语言模型是否像我们一样看待矮星系?

Dimitrios Tanoglidis, Chin Yi Tan, Kate Overdeck, Alex Drlica-Wagner

专题命中 评测与基准 :language model(title,abstract)

AI总结 评估视觉语言模型在识别超暗矮星系候选体任务中的表现,发现零样本模型能复现人类整体校准,但在个体层面存在显著差异,且不确定性估计不可靠。

Comments 8 pages, 4 figures; Accepted at the Conference on Physics and AI at Stanford University (PAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07775 2026-06-09 cs.CV 新提交 78%

DALE-CT: Depth-Aware Foundation Models for Computed Tomography

DALE-CT: 用于计算机断层扫描的深度感知基础模型

Evan W. Damron, Mahmut S. Gokmen, Mitchell A. Klusty, Caroline N. Leach, Emily B. Collier, V. K. Cody Bumgardner

机构 * University of Kentucky(肯塔基大学)

专题命中 评测与基准 :foundation model(title);language model(abstract)

AI总结 提出DALE-CT,一种基于LeJEPA的2D切片模型,通过3D深度感知预训练(利用解剖掩膜和异常标注)提升表示质量,在CT多异常检测中达到与3D视觉语言模型近似的性能。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07641 2026-06-09 cs.CV 新提交 78%

Readable Yet Unpredictable: Rotated-Outcome Prediction in Vision-Language Models

可读但不可预测:视觉语言模型中的旋转结果预测

Lexin Wang, Shenghua Liu, Yiwei Wang, Jiafeng Guo, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of California, Merced(加州大学默塞德分校)

专题命中 评测与基准 :language model(title,abstract)

AI总结 研究视觉语言模型能否仅从原图预测180°旋转后的内容,引入RotOutBench基准,发现模型能识别但无法预测旋转结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19011 2026-08-20 cs.CR cs.AI 新提交 77%

From Threat Intelligence to Detection: Knowledge-driven Enrichment and Template-based Rule Grounding for Automated Sigma Rule Generation

从威胁情报到检测:知识驱动的丰富化与基于模板的规则落地用于自动化Sigma规则生成

Sepehr Ghaffarzadegan, Boubakr Nour, Makan Pourzandi, Mourad Debbabi, Chadi Assi

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 本研究设计了AUTOSIGMA,结合知识驱动丰富化等技术,将非结构化CTI报告自动生成Sigma规则,其在多项指标上优于其他方案。

Comments Submitted for publication and currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18296 2026-08-20 cs.CY cs.AI 新提交 77%

FairGlucose: A CGM Fairness Benchmark Reveals Subgroup Disparities Hidden in Population-Level Validation

FairGlucose:揭示人群水平验证中隐藏亚组差异的CGM公平性基准

Junjie Luo, Xuzhe Zhi, Rui Han, Abhimanyu Kumbara, Anand K. Iyer, Mansur E. Shomali, Ritu Agarwal, Guodong Gordon Gao

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 研究构建FairGlucose基准,发现CGM预测模型人群水平验证掩盖亚组差异,T1D患者误差更高,前沿LLM表现逊于专业神经模型,推动数字健康AI采用亚组分层公平评估标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17827 2026-08-19 cs.CL 新提交 77%

From Global Benchmarks to Local Evaluations: Benchmarking LLMs for the German Public Sector

从全球基准到本地评估:面向德国公共部门的大语言模型基准测试

Camilla Dalerci, Thilo Michael, Robin Schaefer, Daniel Weinland

机构 * Bundesdruckerei GmbH(德国联邦印刷公司)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 该研究针对德国公共部门构建MÖVE评估框架,发现现有LLM基准不适用于本地场景,不同模型在能耗、提供商透明度、德国政党立场认知维度存在显著权衡,公共机构选LLM需结合治理要求而非仅性能排名。

Comments Accepted as non-archival paper at Eval4SD (co-located with KONVENS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17694 2026-08-19 cs.SE cs.AI 新提交 77%

GADR: Gathering Architecture Decision Records from Meeting Transcriptions

GADR:从会议转录文本中收集架构决策记录

Lucas Daniel Costa da Silva, Kiev Gama

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 本文提出多智能体自校正工作流GADR,从原始会议转录文本提取架构决策并生成Nygard格式ADR,经评估其效果优于零样本、少样本基线,还探讨了RAG丰富化的权衡及自动架构文档可追溯性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17671 2026-08-19 cs.SE cs.AI cs.CR 新提交 77%

Benchmarking Automated Security Patch Backporting: How Far Are We?

自动化安全补丁回移植基准测试:我们还差多远?

Jincheng Yang, Yulong Fu, Chengwei Liu, Lyuye Zhang, Fangyuan Zhang, Bingyang Ren, Yang Liu, Hui Li

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 该研究推出涵盖多场景的Porting Benchmark基准,评估五类安全补丁回移植工具,发现工具泛化能力差、复杂补丁性能骤降,明确根本原因并指出优化方向。

Comments 13 pages, 3 figures. Accepted at ASE 2026. Artifact: https://doi.org/10.5281/zenodo.21785770

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16318 2026-08-18 cs.SE cs.AI cs.PF 新提交 77%

Revisiting the Performance of Generative Artificial Intelligence on Introductory Object-Oriented Programming Assessments: Insights from 2026

重新审视生成式人工智能在面向对象编程入门评估中的表现:来自2026年的见解

Marina Lepp, Joosep Kaimre

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究评估ChatGPT-5.2等5种GenAI系统在OOP入门课程评估中的表现,发现其得分高于平均学生,在部分任务有优势但仍存在编译、高级OOP概念等问题,且较前一年有明显改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15932 2026-08-18 cs.AI 新提交 77%

Augmenting Text to Increase Translation Difficulty

通过增强文本提升翻译难度

William Kalikman, Šimon Sukup, Michal Tešnar, Vilém Zouhar

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 针对机器翻译模型评估的饱和问题,提出对抗翻译优化(ATO)方法增强基准文本以提升翻译难度,生成了两个各含350篇英文文本的数据集,验证了其可有效降低翻译质量且无需额外成本。

Comments 18 pages, 8 figures, 10 tables. William Kalikman and Šimon Sukup contributed equally. Published in EAMT 2026. Code: https://github.com/BreakingMT/ATO. Data: https://huggingface.co/datasets/wskal/ATO-datasets

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14683 2026-08-18 cs.LG 新提交 77%

One Score, Two Decisions: Selective Prediction on the Rare-Disease Tail

一个分数,两个决策:针对罕见疾病尾部的选择性预测

Zhaoyang Jiang, Zhizhong Fu, Yunsoo Kim, Zicheng Li, Xuanqi Peng, Fei Teng, Jiacong Mi, Honghan Wu

机构 * School of Health & Wellbeing, University of Glasgow(格拉斯哥大学健康与福祉学院) Shanghai Sixth People’s Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属第六人民医院) School of Life Science and Technology, University of Electronic Science and Technology of China(电子科技大学生命科学与技术学院)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.LG

AI总结 针对罕见疾病尾部的选择性预测,研究发现现有小型开放权重LLM在超罕见疾病上表现受限,前两位边际可提升部分病例选择性准确率,且仅未标记分数无法确定边际切换是否有益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12905 2026-08-14 cs.CL 新提交 77%

Prompts in the Wild: A Large Analyzed Collection of Transactional Prompts in Code

野外提示:代码中事务性提示的大型分析集合

Victoria Basmov, Yoav Goldberg, Reut Tsarfaty

机构 * Bar-Ilan University(巴伊兰大学) Allen Institute for Artificial Intelligence(艾伦人工智能研究所)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文从GitHub收集57500个代码事务性提示样本,构建结构化本体将其结构化,分析得使用模式呈齐普夫分布,经错误分析验证标注可靠性,发布数据集及浏览界面。

Journal ref Proc. of the 20th Linguistic Annotation Workshop (LAW XX), pp. 257-308, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11332 2026-08-13 cs.CL cs.CV 新提交 77%

Gloss-Free Representation Learning for Cross-Dataset Sign Spotting

无 gloss( gloss 指手语 gloss,即手语的书面转写)的跨数据集手语定位表征学习

Oğuz Akif Tüfekcioğlu, Ezgi Ekin, Mustafa Kaan Çevik, Hacer Yalim Keles

机构 * Hacettepe University(哈杰泰佩大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.CL

AI总结 本研究针对资源受限语言的手语研究,用土耳其广播语料库 TSL-News 基于转录文本的伪 gloss 标签预训练手语编码器,在跨数据集手语定位任务中显著提升性能,证明松散对齐的广播数据可提供有效弱监督学习手语表征。

Comments Accepted at the 4th LIMIT Workshop (Representation Learning with Very Limited Resources), ECCV 2026. The abstract was shortened to comply with arXiv's 1,920-character limit

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11327 2026-08-13 cs.LG q-fin.CP 新提交 77%

Long-Horizon Forecasting of Complete Financial Statements with Forma

使用Forma进行完整财务报表的长周期预测

Travis L. Johnson, Jiannan Jiang, Soumyabrata Chaudhuri, Yihao Chen, Lauren Falvey, Donal O'Cofaigh

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 该研究发布了ProForma-20Q基准,提出Transformer模型Forma,在1至20个季度的完整财务报表预测任务中,击败各类对比模型,优势随期限扩大,且能支持无需重训的情景分析。

Comments 46 pages, 2 figures, 3 tables. Benchmark: https://github.com/forma-lab-mccombs/proforma-20q. Model and weights: https://github.com/forma-lab-mccombs/forma-release

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11146 2026-08-12 cs.CL 新提交 77%

The Illusion of Cross-Lingual Safety in Low-Resource Languages

低资源语言中跨语言安全的错觉

Abigail Oppong, P Sam Sahil, Tadesse Destaw Belay, Maryam Ibrahim Mukhtar, Esmael Ahmed Abdu, Tassallah Abdullahi, Jessica Oparebea, Saminu Mohammad Aliyu, Idris Abdulmumin, Abubakar Juma Chilala, Nicholaus Dismas Ladislaus, Alfred Malengo Kondoro, Lemofouet Valdini Douglace, Shamsuddeen Hassan Muhammad, Seid Muhie Yimam

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究发现大型语言模型的跨语言安全迁移在四种非洲低资源语言中极为有限,现有多语言安全对齐仅停留在表面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08869 2026-08-11 cs.CL 新提交 77%

Position Bias in Ordinal Classification: A Systematic Evaluation

序数分类中的位置偏差:系统评估

Yu Wang, Jeffrey Zhou, Menglin Liu, Ge Shi

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究系统评估了序数分类中大型语言模型的位置偏差,发现其普遍存在且现有校正方法效果有限,提出需结合预测性能与稳定性选择序数分类系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06672 2026-08-10 cs.CL 新提交 77%

TA-RAG: Tone Awareness as a Design Imperative for Retrieval-Augmented Generation

TA-RAG:将语气感知作为检索增强生成的设计要务

Yong-Bin Kang, Anthony McCosker

机构 * Swinburne University of Technology(斯威本科技大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对标准RAG系统存在的语境脱耦问题,提出TA-RAG框架,将交流对齐与事实准确性并列为核心设计目标,明确语气感知是高风险语境下RAG系统的设计要务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04682 2026-08-06 cs.SE cs.AI 新提交 77%

Active-SWE: Benchmarking Coding Agents for Proactive Bug Fixing without Issue Reports

Active-SWE:针对无问题报告的主动漏洞修复任务的编码智能体基准测试

Haobin Li, Ping Deng, Weizhong Qian, Liang Jiang, Zhenyu Huang, Mouxing Yang, Xi Peng

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Active-SWE是首个针对无问题报告的主动多漏洞修复任务的编码智能体基准,实验显示现有顶尖编码智能体在该任务上性能有限。

Comments 24 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03720 2026-08-05 cs.CL 新提交 77%

Detecting Hallucinations and Recovering Verified Answers in Arabic Islamic Question Answering

阿拉伯语伊斯兰问答中幻觉检测与可信答案恢复

Khaled Ziani

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究针对阿拉伯语伊斯兰问答场景,基于微调后的google/gemma-4-12B-it模型构建系统,实现了幻觉检测与可信答案选择的两步任务,在公开数据集上取得了优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03018 2026-08-05 cs.AI 新提交 77%

UrbanAgent: A Tool-Augmented Agent for Cross-System Urban Tasks

UrbanAgent:面向跨系统城市任务的工具增强型智能体

Jiayu Cao, Xingyuan Zeng, feiyu Li, Zhijing Huang, Xujie Yuan, Rongxiang Chen, Shimin Di, Libin Zheng, Jian Yin

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 针对城市数字服务碎片化问题,提出工具增强型智能体UrbanAgent,结合大语言模型与多类工具,引入基准Urban-Eval评估,在多模型上任务成功率达71%,领先基线10个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02672 2026-08-05 cs.CR cs.AI cs.ET cs.SE 新提交 77%

Security-First Evaluation of Text-to-Terraform: Benchmarking LLMs and SLMs for Secure IaC Generation

安全优先的Text-to-Terraform评估:针对安全基础设施即代码生成的大语言模型(LLMs)与小型语言模型(SLMs)基准测试

Francis Luis Santos Vargas, Rodrigo Brandão Mansilha, Diego Kreutz

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 该研究针对7款LLMs与SLMs开展Terraform生成基准测试,发现IaC的语法有效性与安全合规性正交,仅靠提示工程不足,自动化多工具扫描是必要补充。

Comments 10 pages, 1 figure, and 9 tables. The benchmark artifacts and CI/CD pipeline are publicly available at https://gitlab.com/repo-anon-iac/repo-anon-9ac. Accepted for publication at SBSeg 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02639 2026-08-05 cs.SE cs.AI 新提交 77%

Instruction Stacking Collapse: A Benchmark and the Capability-Dependent Value of Prompt Compilation

指令堆叠崩溃:基准测试集与提示词编译的能力依赖价值

Atul Anand, Sourav Chattaraj

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本研究构建了含24个指令的基准测试集,发现指令遵循率随堆叠指令数增加非线性下降,提出无需训练的指令编译器可提升较弱生产级LLM的指令遵循率,且该收益与模型能力相关。

Comments 13 pages, 11 figures. Benchmark, deterministic verifiers, and cached model responses released for full reproduction

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00640 2026-08-04 cs.CL 新提交 77%

TreeProbe : A Tibetan Medicine Benchmark for Cultural Bias in LLMs

TreeProbe:面向大型语言模型文化偏见的藏医药基准测试集

Jin Zhang, Linyu Li, Weili Jiang, Yuqing Cai, Yutong Liu, Guanquecairang, Yongbin Yu, Jingye Cai, Nyima Tashi, Gadeng Luosang

机构 * University of Electronic Science and Technology of China(电子科技大学) Tibet University(西藏大学) Peking University(北京大学) Southwest Jiaotong University(西南交通大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本研究针对大型语言模型的藏医药文化偏见问题,构建了首个基于藏医药“医学之树”框架的基准测试集TreeProbe,发现现有模型存在系统性本体漂移,为公平医疗AI开发提供了诊断基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28269 2026-07-31 cs.CV cs.AI cs.MM 新提交 77%

Theia: Large-Scale Multimodal Captioning and Automated Validation of the Incidents1M Dataset for Data-Free Distillation

Theia:用于无数据蒸馏的Incidents1M数据集的大规模多模态字幕生成与自动验证

Simone Giano, Lorenzo Severini, Alessandro Galdelli, Adriano Mancini

机构 * Università Politecnica delle Marche(马尔凯理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 本研究针对灾害领域多模态数据集的缺陷,提出方法构建并自动验证Incidents1M数据集,生成高保真字幕,其语义一致性达78.65/100,为跨模态知识蒸馏提供了可扩展框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28037 2026-07-31 cs.LG 新提交 77%

ClawTrack: Towards Trace-Level Evaluation and Improvement of Real-World Autonomous Agents

ClawTrack:面向真实世界智能体的追踪级评估与改进

Xingjian Wu, Xuhang Zhu, Xingchen Liu, Junlin Liu, Jianing Wang, Linsen Guo, Xiaoyu Li, Xuezhi Cao, Xunliang Cai

机构 * Meituan(美团)

专题命中 评测与基准 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.LG

AI总结 本研究针对现有智能体评估仅看结果的缺口,提出双评估基准ClawTrack,含320个任务及过程评分器,评估21个模型后发现其可归因推理、验证结果验证瓶颈等,助力智能体改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26611 2026-07-30 cs.AI cs.HC 新提交 77%

Fewer Clarifications, Better Code: Benchmarking Cross-Session Personalized Ambiguity Adaptation in Coding Assistants

更少澄清,更优代码:评测编码助手的跨会话个性化歧义适应能力

Zijian Xu, Wenshuo Zhang, Zisen Qin, Rui Sheng, Yushi Sun, Huamin Qu, Chuhan Shi

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 该研究提出个性化歧义适应新任务,构建CAPA评测基准,评估12个LLM在有无用户历史下的表现,提出同用户历史门控方法,助力开发减少重复澄清的长期编码助手。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25675 2026-07-29 cs.AI 新提交 77%

DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space

DecoEvo:文本空间中求解器与评分标准生成器技能的分数解耦协同进化

Jiangwang Chen, Zixin Song, Junlin Liu, Shuaiyu Zhou, Haiyan Wu, Haihan Shi, Chenxi Zhou, Hanqing Li, Xiao Yang, Da Zhu, Guanjun Jiang, Hai Wan, Xibin Zhao

机构 * Tsinghua University(清华大学) Qwen Business Unit of Alibaba(阿里巴巴的通义业务部) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究文本空间优化中现有方法瓶颈,提出DecoEvo方法,通过解耦目标协同进化求解器与评分标准生成器技能,不依赖黄金评分标准,在多基准和大语言模型主干上表现优异,有显著相对增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24766 2026-07-29 cs.AI 新提交 77%

Crystalis: Progressive Nucleation and Semantic Annealing for Coordinated Multi-View Visualization Generation

Crystalis:用于协同多视图可视化生成的渐进式成核与语义退火

Dazhen Deng, Zhaoping He, Xin Qian, Xiaotong Wang, Zi Ying, Yingcai Wu

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 研究针对大语言模型难以生成协同多视图可视化的问题,提出Crystalis框架,基于以查询为中心的CMV建模,通过渐进式成核和语义退火机制,在多任务基准测试中取得高成功率,且经用户研究验证了工作流程可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24190 2026-07-28 cs.RO cs.AI cs.HC 新提交 77%

Not Forgotten: Implementation and Evaluation of a Personalized Episodic Memory for the Humanoid Robot Head Kim

未被遗忘:人形机器人头部Kim的个性化情景记忆的实现与评估

Steve Aschenbrenner, Marcel Heisler, Thomas Sievers, Christian Becker-Asano

机构 * Stuttgart Media University(斯图加特媒体大学) University of Lübeck(吕贝克大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对社交机器人跨会话无记忆问题,提出在人形机器人头部Kim上集成轻量级情景记忆模块,结合语义检索与对话系统,用混合评分函数检索交互并注入提示,实验表明该模块提升社交性且未引发负面反应。

Comments Acceoted at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026) Kitakyushu, Japan

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22759 2026-07-28 cs.AR cs.LG 新提交 77%

Benchmarking LLMs for Verilog Design Flows

对用于Verilog设计流程的大语言模型进行基准测试

Angshuman Chakravertty, Rahul Koshti, Buddhi Prakash Sharma, Vinay Chamola

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.LG

AI总结 研究针对大语言模型生成Verilog RTL代码能力的基准测试问题,提出含特定流程的可重复平台,经测试提升了开源模型的语法有效性和模拟通过率,且平台与数据集开源,利于生成式人工智能在硬件设计工作流的评估。

Comments 7 pages, 3 figures, 3 tables. Manuscript prepared for submission to IEEE Design & Test

详情

展开后加载摘要…

URL PDF HTML 收藏