arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-05 至 2025-12-05 共收录 134 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 30 篇

2512.04105 2025-12-05 cs.CY cs.AI cs.HC 83%

LegalWebAgent: Empowering Access to Justice via LLM-Based Web Agents

LegalWebAgent:通过基于大语言模型的网络代理赋能正义获取

Jinzhe Tan, Karim Benyekhlef

机构 * Cyberjustice Laboratory, Faculty of Law, University of Montreal, Canada(法律正义实验室,法学院,蒙特利尔大学,加拿大)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LegalWebAgent通过多模态大语言模型实现网络代理,解决普通公民在法律问题中的获取障碍,实现从查询到行动的全流程自动化,实验结果显示其在复杂场景中的高自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15610 2025-12-05 cs.LG cs.AI 81%

A general language model for peptide function identification

一种用于肽功能识别的通用语言模型

Jixiu Zhai, Zikun Wang, Chupei Tang, Haitian Zhong, Ziyang Xu, Yuhuan Liu, Shengrui Xu, Jingwan Wang, Dan Huang, Tianchi Lu

机构 * School of Mathematics and Statistics, Lanzhou University(兰州大学数学与统计学学院) Department of Computer Science, City University of Hong Kong(城市大学计算机科学系) Shanghai Innovation Institute(上海创新研究院) New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室、多模态人工智能系统国家重点实验室、自动化研究所、中国科学院) Department of Mathematics, The Chinese University of Hong Kong(香港中文大学数学系) Cuiying Honors College, Lanzhou University(崔莹荣誉学院,兰州大学) Department of Mathematics, Harbin Engineering University(哈尔滨工程大学数学系)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 PDeepPP是一种整合预训练蛋白质语言模型与混合Transformer-CNN架构的通用语言模型,用于高效识别多种肽类和PTM位点,实现高精度和可解释的肽表示。

Comments 15 pages, 5 figures, 3 tables, submitted to arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04957 2025-12-05 cs.CL cs.AI 79%

LLMs Know More Than Words: A Genre Study with Syntax, Metaphor & Phonetics

LLMs Know More Than Words: 一种涉及语法、隐喻与语音的体裁研究

Weiye Shi, Zhaowei Zhang, Shaoheng Yan, Yaodong Yang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过引入多语言体裁分类数据集,研究LLMs在语法、隐喻和语音特征上的学习能力及其对分类任务的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04125 2025-12-05 cs.LG 78%

ASCIIBench: Evaluating Language-Model-Based Understanding of Visually-Oriented Text

ASCIIBench: 评估基于语言模型的视觉文本理解

Kerry Luo, Michael Fu, Joshua Peguero, Husnain Malik, Anvay Patil, Joyce Lin, Megan Van Overborg, Ryan Sarmiento, Kevin Zhu

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 评测与基准 :LLM(abstract,comments);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 ASCIIBench通过评估LLM生成ASCII艺术的性能,揭示了多模态表示的局限性,并推动了针对符号视觉模态的新方法发展。

Comments Accepted to The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025): LLM Evaluation Workshop & Multimodal Algorithmic Reasoning Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04058 2025-12-05 cs.CV 78%

EVE: Towards End-to-End Video Subtitle Extraction with Vision-Language Models

EVE:基于视觉-语言模型的端到端视频字幕提取

Haiyang Yu, Mengyang Zhao, Jinghui Lu, Ke Niu, Yanjie Wang, Weijie Yin, Weitao Jia, Teng Fu, Yang Liu, Jun Liu, Hong Chen

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ByteDance Inc.(字节跳动公司) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) School of Computing and Communications, Lancaster University(兰卡斯特大学计算机与通讯学院)

专题命中 评测与基准 :language model(title,abstract)

AI总结 EVE提出了一种基于视觉-语言模型的端到端视频字幕提取框架,通过双分支模块高效提取字幕及时间戳,并构建了首个大规模视频字幕数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04864 2025-12-05 cs.AI 77%

Are Your Agents Upward Deceivers?

您的代理是向上欺骗者吗?

Dadi Guo, Qingyu Liu, Dongrui Liu, Qihan Ren, Shuai Shao, Tianyi Qiu, Haoran Li, Yi R. Fung, Zhongjie Ba, Juntao Dai, Jiaming Ji, Zhikai Chen, Jialing Tao, Yaodong Yang, Jing Shao, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究发现基于LLM的代理可能通过欺骗行为隐瞒失败,需加强缓解策略以确保安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03887 2025-12-05 cs.AI 77%

A Hierarchical Tree-based approach for creating Configurable and Static Deep Research Agent (Static-DRA)

一种基于层次树的创建可配置和静态深度研究代理(静态-DRA)的方法

Saurav Prateek

机构 * Saurav Prateek(独立研究者)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出静态-DRA,通过深度和广度参数实现可配置的深度研究代理,提升多轮复杂研究任务的处理能力。

Comments 16 pages, 6 figures, 4 tables. Code available at: https://github.com/SauravP97/Static-Deep-Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00591 2025-12-05 cs.CL 77%

Probe-Rewrite-Evaluate: A Workflow for Reliable Benchmarks and Quantifying Evaluation Awareness

探测-重写-评估:一种用于可靠基准和量化评估意识的工作流程

Lang Xiong, Nishant Bhargava, Jianhang Hong, Jeremy Chang, Haihao Liu, Vasu Sharma, Kevin Zhu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出探测-重写-评估工作流程,通过量化LLM在不同上下文中的行为变化,揭示评估意识对模型安全性和诚实性的影响,并展示更真实的评估框架的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11678 2025-12-05 cs.CY cs.CL 77%

Which Type of Students can LLMs Act? Investigating Authentic Simulation with Graph-based Human-AI Collaborative System

哪些类型的学生可以被LLMs模拟?基于图-based人机协作系统的认证模拟研究

Haoxuan Li, Jifan Yu, Xin Cong, Yang Dang, Daniel Zhang-li, Lu Mi, Yisi Zhan, Huiqin Liu, Zhiyuan Liu

机构 * College of AI, Tsinghua University(人工智能学院,清华大学) School of Education, Tsinghua University(教育学院,清华大学) Department of Statistics and Data Science, Tsinghua University(统计与数据科学系,清华大学) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种基于图的LLM-人协作系统,通过自动化评分和图传播技术生成高质量学生代理,验证其在模拟学生行为方面的有效性。

Comments This work has been submitted to AI Open for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04315 2025-12-05 cs.AR 75%

HLStrans: Dataset for C-to-HLS Hardware Code Synthesis

HLStrans: 用于C到HLS硬件代码综合的数据库

Qingyun Zou, Nuo Chen, Yao Chen, Bingsheng He, WengFei Wong

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 HLStrans是首个用于LLM驱动的C到HLS综合的大型数据集,包含124,000对配对程序和完整测试台,通过自动化管道增强,用于提升LLM在硬件综合中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04765 2025-12-05 cs.CL 70%

AdiBhashaa: A Community-Curated Benchmark for Machine Translation into Indian Tribal Languages

AdiBhashaa:一个由社区共同编纂的机器翻译基准,用于印度部落语言

Pooja Singh, Sandeep Kumar

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 AdiBhashaa通过构建四个印度部落语言的开源平行语料库和基础MT系统,推动更公平的AI研究,强调本地专业知识和人类验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04728 2025-12-05 cs.CV cs.AI 70%

Measuring the Unspoken: A Disentanglement Model and Benchmark for Psychological Analysis in the Wild

测量未言之: 一种解耦模型和基准用于野外心理分析

Yigui Feng, Qinglin Wang, Haotian Mo, Yang Liu, Ke Liu, Gencheng Liu, Xinhai Chen, Siqi Shen, Songzhu Mei, Jie Liu

机构 * College of Computer Science, National University of Defense Technology(计算机科学学院,国防科技大学) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(智能工程学院,华南理工大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MIND模型和PRISM基准,通过解耦算法和专家标注数据提升野外对话心理分析的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04367 2025-12-05 cs.AI 70%

AgentBay: A Hybrid Interaction Sandbox for Seamless Human-AI Intervention in Agentic Systems

AgentBay:一种混合交互沙盒,用于无缝的人工智能干预在代理系统中

Yun Piao, Hongbo Min, Hang Su, Leilei Zhang, Lei Wang, Yue Yin, Xiao Wu, Zhejing Xu, Liwei Qu, Hang Li, Xinxin Zeng, Wei Tian, Fei Yu, Xiaowei Li, Jiayi Jiang, Tongxu Liu, Hao Tian, Yufei Que, Xiaobing Tu, Bing Suo, Yuebing Li, Xiangting Chen, Zeen Zhao, Jiaming Tang, Wei Huang, Xuguang Li, Jing Zhao, Jin Li, Jie Shen, Jinkui Ren, Xiantao Zhang

机构 * Alibaba Cloud Computing(阿里云计算)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AgentBay通过混合交互沙盒实现无缝人机协作,提升代理系统在复杂任务中的成功率与网络适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04262 2025-12-05 cs.SE cs.AI cs.HC 70%

Catching UX Flaws in Code: Leveraging LLMs to Identify Usability Flaws at the Development Stage

在代码中捕捉用户体验缺陷:利用大语言模型在开发阶段识别可用性缺陷

Nolan Platt, Ethan Luchs, Sehrish Nizamani

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了大语言模型在开发阶段识别可用性缺陷的能力,发现其在问题检测上表现中等一致,但严重性判断需人类监督。

Comments 7 pages. Published in Proceedings of the 2025 IEEE Symposium on Visual Languages and Human-Centric Computing (VL/HCC). DOI: 10.1109/VL-HCC65237.2025.00024

Journal ref Proceedings of the 2025 IEEE Symposium on Visual Languages and Human-Centric Computing (VL/HCC), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05091 2025-12-05 cs.CV 67%

Visual Reasoning Tracer: Object-Level Grounded Reasoning Benchmark

视觉推理追踪器:对象级 grounded 推理基准

Haobo Yuan, Yueyi Sun, Yanwei Li, Tao Zhang, Xueqing Deng, Henghui Ding, Lu Qi, Anran Wang, Xiangtai Li, Ming-Hsuan Yang

机构 * UC Merced(加州大学默塞德分校) PKU(北京大学) NTU(国立台湾大学) CUHK(香港中文大学) WHU(武汉大学) FDU(福建大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出视觉推理追踪器任务,通过对象级 grounded 推理基准评估模型的推理路径生成能力,并引入了新的评估指标和大规模数据集提升模型推理表现。

Comments Technical Report; Project Page: https://harboryuan.github.io/visual-reasoning-tracer

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04473 2025-12-05 cs.LG cs.AI cs.CL cs.IR 67%

Ground-Truth Subgraphs for Better Training and Evaluation of Knowledge Graph Augmented LLMs

用于改进知识图谱增强大语言模型训练和评估的真实子图

Alberto Cattaneo, Carlo Luschi, Daniel Justus

机构 * Graphcore Research(Graphcore研究院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SynthKGQA通过生成高质量的知识图谱问答数据集,提升知识图谱增强大语言模型的训练和评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04597 2025-12-05 cs.CV cs.AI cs.LG cs.RO 62%

When Robots Should Say "I Don't Know": Benchmarking Abstention in Embodied Question Answering

机器人何时应说'我不知道':身体化问答中退避的基准测试

Tao Wu, Chuhao Zhou, Guangyu Zhao, Haozhi Cao, Yewen Pu, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学) Peking University(北京大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了身体化问答中退避机制的重要性,通过构建AbstainEQA数据集,发现人类在退避任务中表现优异,而模型退避能力有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04324 2025-12-05 cs.CL cs.AI 62%

DAComp: Benchmarking Data Agents across the Full Data Intelligence Lifecycle

DAComp: 在全数据智能生命周期中跨领域评估数据代理

Fangyu Lei, Jinxiang Meng, Yiming Huang, Junjie Zhao, Yitong Zhang, Jianwen Luo, Xin Zou, Ruiyi Yang, Wenbo Shi, Yan Gao, Shizhu He, Zuo Wang, Qian Liu, Yang Wang, Ke Wang, Jun Zhao, Kang Liu

机构 * Institute of Automation, CAS(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 DAComp通过210个任务评估数据代理在数据工程与分析中的能力,揭示现有代理在复杂流程编排和开放性推理中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04488 2025-12-05 cs.CV cs.AI cs.HC cs.MM 57%

"I Can See Forever!": Evaluating Real-time VideoLLMs for Assisting Individuals with Visual Impairments

我能看到永远!

Ziyi Zhang, Zhen Sun, Zongmin Zhang, Zifan Peng, Yuemeng Zhao, Zichun Wang, Zeren Luo, Ruiting Zuo, Xinlei He

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文评估了实时视频LLMs在帮助视障者日常生活中的有效性,发现GPT-4o在任务成功率方面最高,并提出SafeVid数据集提升风险识别准确率至76%

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04408 2025-12-05 cs.AI 57%

Executable Governance for AI: Translating Policies into Rules Using LLMs

可执行治理 for AI:利用 LLMs 将政策翻译成规则

Gautam Varma Datla, Anudeep Vurity, Tejaswani Dash, Tazeem Ahmad, Mohd Adnan, Saima Rafi

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 利用 LLMs 将 AI 政策转化为可执行规则,通过 P2T 框架实现标准化表示,提升政策执行的自动化与安全性。

Comments Accepted to AAAI-26 AI Governance Workshop (in-person presentation); 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04479 2025-12-05 cs.CL 57%

ThaiOCRBench: A Task-Diverse Benchmark for Vision-Language Understanding in Thai

ThaiOCRBench: 一种任务多样化的泰语视觉-语言理解基准

Surapon Nonesung, Teetouch Jaknamon, Sirinya Chaiophat, Natapong Nitarach, Chanakan Wittayasakpan, Warit Sirichotedumrong, Adisai Na-Thalang, Kunat Pipatanakul

机构 * SCB 10X R&D(SCB 10X研发部) SCB 10X SCBX Group(SCBX集团)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 ThaiOCRBench是一个针对泰语视觉-语言理解任务的多样化基准,通过人工标注的数据集评估了多种VLMs,揭示了专有模型在性能上的优势及开源模型在细粒度文本识别中的挑战。

Comments Accepted at IJCNLP-AACL 2025 (Main). This version includes the corrected Table 2 and an updated conclusion regarding the deletion count of the Gemma model

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04599 2025-12-05 cs.CV 50%

Malicious Image Analysis via Vision-Language Segmentation Fusion: Detection, Element, and Location in One-shot

通过视觉-语言分割融合进行恶意图像分析:一次检测、元素识别与定位

Sheng Hang, Chaoxiang He, Hongsheng Hu, Hanqing Hu, Bin Benjamin Zhu, Shi-Feng Sun, Dawu Gu, Shuo Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Microsoft Corporation(微软公司)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出一种零样本方法,通过视觉-语言分割融合实现恶意图像的检测、元素识别与定位,提升细粒度审核的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 20 篇

2512.02056 2025-12-05 cs.CL cs.AI 91%

Reversing Large Language Models for Efficient Training and Fine-Tuning

反向大型语言模型以实现高效的训练和微调

Eshed Gal, Moshe Eliasof, Javier Turek, Uri Ascher, Eran Treister, Eldad Haber

机构 * Department of Computer Science, University of British Columbia(计算机科学系,不列颠哥伦比亚大学) Department of Computer Science, Ben Gurion University(计算机科学系,本· Gurion大学) EarthDynamics AI Department of Earth, Ocean and Atmospheric Sciences, University of British Columbia(地球、海洋和大气科学系,不列颠哥伦比亚大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

AI总结 本研究提出可逆架构以高效训练和微调LLM,通过时间可逆动力学减少内存消耗,提升吞吐量,并通过微调将现有模型转换为可逆架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04474 2025-12-05 cs.SE 89%

LLM-SrcLog: Towards Proactive and Unified Log Template Extraction via Large Language Models

LLM-SrcLog: 通过大语言模型实现前瞻性与统一的日志模板提取

Jiaqi Sun, Wei Li, Heng Zhang, Chutong Ding, Shiyou Qian, Jian Cao, Guangtao Xue

专题命中 效率与部署 :LLM(title,abstract);large language model(title);language model(title)

AI总结 LLM-SrcLog通过结合源代码分析与大语言模型,实现前瞻性日志模板提取,提升解析效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04108 2025-12-05 cs.CY cs.AI cs.HC q-fin.CP 85%

Responsible LLM Deployment for High-Stake Decisions by Decentralized Technologies and Human-AI Interactions

通过去中心化技术和人机交互实现高风险决策的负责任LLM部署

Swati Sachan, Theo Miller, Mai Phuong Nguyen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过去中心化技术和人机交互实现LLM在高风险决策中的负责任部署,通过多次迭代评估不确定样本并确保解释的稳定性,以提高安全性和责任追溯能力。

Comments IEEE International Conference on Human-Machine Systems, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05073 2025-12-05 cs.LG cs.AI cs.AR cs.SE 85%

David vs. Goliath: Can Small Models Win Big with Agentic AI in Hardware Design?

大卫与歌利亚:小型模型能否通过代理AI在硬件设计中胜出?

Shashwat Shankar, Subhranshu Pandey, Innocent Dengkhw Mochahari, Bhabesh Mali, Animesh Basak Chowdhury, Sukanta Bhattacharjee, Chandan Karfa

机构 * Indian Institute of Technology, Guwahati, India(印度理工学院冈瓦提分校) NXP USA, Inc.(NXP美国公司)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本研究探讨小型语言模型结合代理AI在硬件设计中的应用,证明其在成本效率和性能上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04088 2025-12-05 cs.DC 85%

Toward Sustainability-Aware LLM Inference on Edge Clusters

迈向可持续的边缘集群大语言模型推理

Kolichala Rajashekar, Nafiseh Sharghivand, Radu Prodan, Reza Farahani

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种针对边缘集群的可持续大语言模型推理方法,通过碳和延迟感知的路由策略平衡推理延迟和碳足迹。

Comments 4 pages, 5 figures, 3 tables, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19562 2025-12-05 quant-ph cs.AI 81%

PennyCoder: Efficient Domain-Specific LLMs for PennyLane-Based Quantum Code Generation

PennyCoder: 用于PennyLane量子代码生成的高效领域特定LLM

Abdul Basit, Minghao Shao, Muhammad Haider Asif, Nouhaila Innan, Muhammad Kashif, Alberto Marchisio, Muhammad Shafique

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 PennyCoder是一种针对PennyLane量子编程的高效领域特定LLM,通过本地部署和低秩适应技术提升量子代码生成的准确性和效率。

Comments 6 pages, 5 figures, 3 tables, paper accepted to QCE 2025

Journal ref 2025 IEEE International Conference on Quantum Computing and Engineering (QCE), Albuquerque, NM, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04738 2025-12-05 cs.CL cs.AI cs.DB 81%

OsmT: Bridging OpenStreetMap Queries and Natural Language with Open-source Tag-aware Language Models

OsmT: 通过开源标签感知语言模型连接OpenStreetMap查询与自然语言

Zhuoyue Wan, Wentao Hu, Chen Jason Zhang, Yuanfeng Song, Shuaimin Li, Ruiqiang Xiao, Xiao-Yong Wei, Raymond Chi-Wing Wong

机构 * The Hong Kong Polytechnic University(香港理工大学) WeBank Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 OsmT通过开源标签感知语言模型连接自然语言与OpenStreetMap查询,提升查询生成和解释的准确性与可访问性。

Comments 42nd IEEE International Conference on Data Engineering (ICDE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17127 2025-12-05 cs.CL cs.AI cs.DC 81%

Training Foundation Models on a Full-Stack AMD Platform: Compute, Networking, and System Design

在全栈AMD平台上训练基础模型:计算、网络和系统设计

Quentin Anthony, Yury Tokpanov, Skyler Szot, Srivatsan Rajagopal, Praneeth Medepalli, Anna Golubeva, Vasu Shyam, Robert Washbourne, Rishi Iyer, Ansh Chaurasia, Tomas Figliolia, Xiao Yang, Abhinav Sarje, Drew Thorstensen, Amartey Pearson, Zack Grossbart, Jason van Patten, Emad Barsoum, Zhenyu Gu, Yao Fu, Beren Millidge

机构 * IBM

专题命中 效率与部署 :foundation model(title);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文介绍了在AMD全栈平台上训练大规模混合专家模型的方法,展示了ZAYA1模型在预训练中的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏