arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-08 至 2025-12-08 共收录 139 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 11 篇

2412.07031 2025-12-08 econ.EM cs.AI 89%

Large Language Models: An Applied Econometric Framework

大语言模型:一个应用计量经济学框架

Jens Ludwig, Sendhil Mullainathan, Ashesh Rambachan

机构 * Center for Applied Artificial Intelligence at the University of Chicago(芝加哥大学应用人工智能中心) Altman Family Fund at MIT(麻省理工学院阿尔特曼家族基金) University of Chicago(芝加哥大学) Massachusetts Institute of Technology(麻省理工学院) NBER(美国国家经济研究局)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出一个应用计量经济学框架,利用大语言模型进行文本预测和经济概念测量,强调无训练泄漏和验证样本的重要性,以提高实证分析的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05464 2025-12-08 cs.CL cs.AI 86%

Dynamic Alignment for Collective Agency: Toward a Scalable Self-Improving Framework for Open-Ended LLM Alignment

动态对齐与集体代理:迈向一个可扩展的自我改进框架以实现开放式的LLM对齐

Panatchakorn Anantaprayoon, Nataliia Babina, Jad Tarifi, Nima Asgharbeygi

机构 * Integral AI

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出动态对齐框架,通过集体代理价值实现LLM的自我改进和可扩展对齐。

Comments 8 pages, 4 figures, to appear in AAAI 2026 AIGOV Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05887 2025-12-08 cs.SE cs.LG cs.PL 83%

Bootstrapping Fuzzers for Compilers of Low-Resource Language Dialects Using Language Models

通过语言模型构建编译器低资源语言方言的模糊测试器

Sairam Vaidya, Marcel Böhme, Loris D'Antoni

机构 * University of California San Diego(加州大学圣地亚哥分校) Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 通过语言模型构建编译器低资源语言方言的模糊测试器,利用语法和覆盖引导技术生成种子输入,提升测试效率和覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05216 2025-12-08 cs.LG 79%

Coefficient of Variation Masking: A Volatility-Aware Strategy for EHR Foundation Models

方差系数掩码:一种考虑波动性的电子健康记录基础模型策略

Rajna Fani, Rafi Al Attrach, David Restrepo, Yugang Jia, Leo Anthony Celi, Peter Schüffler

机构 * Massachusetts Institute of Technology (MIT)(麻省理工学院) Technical University of Munich (TUM)(慕尼黑技术大学) MICS CentraleSupélec – Université Paris-Saclay(巴黎萨克雷大学CentraleSupélec研究所) Harvard Medical School(哈佛医学院) Beth Israel Deaconess Medical Center(贝斯以色列医疗中心) Institute of Pathology Technical University of Munich(慕尼黑技术大学病理研究所) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 预训练与数据 :foundation model(title);pretraining(abstract);分类 cs.LG

AI总结 本文提出CV-Masking策略,通过考虑特征波动性改进EHR基础模型的预训练,提升重建性能和下游任务表现。

Comments 16 pages, 9 figures, 1 table, 1 algorithm. Accepted at Machine Learning for Health (ML4H) 2025, Proceedings of the Machine Learning Research (PMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01203 2025-12-08 cs.LG 79%

Hypergraph Foundation Model

超图基础模型

Yue Gao, Yifan Feng, Shiquan Liu, Xiangmin Han, Shaoyi Du, Zongze Wu, Han Hu

机构 * School of Software, BNRist, THUIBCS, BLBCI, Tsinghua University(软件学院,BNRist,THUIBCS,BLBCI,清华大学) Institute of Artificial Intelligence and Robotics, College of Artificial Intelligence, Xi’an Jiaotong University(人工智能与机器人研究院,人工智能学院,西安交通大学) College of Mechatronics and Control Engineering, Shenzhen University(机械与控制工程学院,深圳大学) Beijing Institute of Technology(北京理工大学)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 Hyper-FM是一种多领域知识提取的超图基础模型,通过层次化高阶邻居引导的顶点知识嵌入和结构知识提取,提升超图建模能力,并提出超图基础模型的扩展定律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07755 2025-12-08 cs.CV cs.AI cs.GR cs.RO 79%

SAT: Dynamic Spatial Aptitude Training for Multimodal Language Models

SAT:多模态语言模型的动态空间能力训练

Arijit Ray, Jiafei Duan, Ellis Brown, Reuben Tan, Dina Bashkirova, Rose Hendrix, Kiana Ehsani, Aniruddha Kembhavi, Bryan A. Plummer, Ranjay Krishna, Kuo-Hao Zeng, Kate Saenko

机构 * Boston University(波士顿大学) University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院) Microsoft Research(微软研究院) New York University(纽约大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI

AI总结 SAT通过模拟数据提升多模态语言模型在动态空间推理中的能力,实验表明其在多个基准测试中优于现有方法。

Comments Accepted to COLM 2025. Project webpage: https://arijitray.com/SAT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22143 2025-12-08 cs.CV 78%

3D Question Answering via only 2D Vision-Language Models

仅通过2D视觉-语言模型实现3D问答

Fengyun Wang, Sicheng Yu, Jiawei Wu, Jinhui Tang, Hanwang Zhang, Qianru Sun

机构 * Nanyang Technological University, Singapore Singapore Management University, Singapore National University of Singapore, Singapore Nanjing University of Science \& Technology, Nanjing, China

专题命中 预训练与数据 :language model(title,abstract)

AI总结 本文提出cdViews方法,通过仅使用2D视觉-语言模型,实现3D问答任务的高性能表现。

Comments ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05648 2025-12-08 cs.LG 77%

Beyond Data Filtering: Knowledge Localization for Capability Removal in LLMs

超越数据过滤:LLMs中能力移除的知识定位

Igor Shilov, Alex Cloud, Aryo Pradipta Gema, Jacob Goldman-Wetzler, Nina Panickssery, Henry Sleight, Erik Jones, Cem Anil

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出SGTM方法,通过局部化知识并屏蔽梯度来移除LLM中的危险能力,相比数据过滤和梯度路由,在标签噪声下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02098 2025-12-08 cs.CL cs.AI cs.LG 75%

CRAFT Your Dataset: Task-Specific Synthetic Dataset Generation Through Corpus Retrieval and Augmentation

为你的数据集定制:通过语料检索与增强进行任务特定合成数据集生成

Ingo Ziegler, Abdullatif Köksal, Desmond Elliott, Hinrich Schütze

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系) Center for Information and Language Processing (CIS), LMU Munich(慕尼黑大学信息与语言处理中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CRAFT通过语料检索与增强生成任务特定合成数据集,有效提升问答和摘要任务的模型性能。

Comments Accepted at TACL; Pre-MIT Press publication version. Code and dataset available at: https://github.com/ziegler-ingo/CRAFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01790 2025-12-08 cs.LG cs.CR 70%

IF-GUIDE: Influence Function-Guided Detoxification of LLMs

IF-GUIDE:影响函数引导的LLM去毒化

Zachary Coalson, Juhan Bae, Nicholas Carlini, Sanghyun Hong

机构 * Oregon State University(俄勒冈州立大学) University of Toronto(多伦多大学) Anthropic

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 IF-GUIDE通过影响函数主动识别并抑制训练数据中的有害标记,有效减少大语言模型的显性和隐性毒性。

Comments Accepted at NeurIPS 2025 [Poster]

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05386 2025-12-08 cs.LG cs.AI 62%

Generalization Beyond Benchmarks: Evaluating Learnable Protein-Ligand Scoring Functions on Unseen Targets

超越基准的泛化:在未见目标上评估可学习的蛋白质-配体评分函数

Jakub Kopko, David Graber, Saltuk Mustafa Eyrilmez, Stanislav Mazurenko, David Bednar, Jiri Sedlar, Josef Sivic

机构 * CIIRC, Faculty of Electrical Engineering, Czech Technical University in Prague(捷克技术大学布拉格分校电子工程学院智能信息研究中心) Seminar for Applied Mathematics, Department of Mathematics, ETH Zurich(苏黎世联邦理工学院应用数学研讨会) Institute for Computational Life Sciences, Zurich University of Applied Sciences(苏黎世应用科学大学计算生命科学研究所) Loschmidt Laboratories, Faculty of Science, Masaryk University, Brno(马萨里克大学布拉格分校科学学院洛施米特实验室) ICRC, St. Anne’s University Hospital, Brno(布拉格大学医院ICRC)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究评估了可学习蛋白质-配体评分函数在未见靶标上的泛化能力,揭示了现有基准的不足,并探讨了预训练和简单方法对提升泛化性能的潜在作用。

Comments 15 pages, 6 figures, submitted to NeurIPS 2025 AI4Science Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 5 篇

2512.05740 2025-12-08 cs.CV 86%

Distilling Expert Surgical Knowledge: How to train local surgical VLMs for anatomy explanation in Complete Mesocolic Excision

萃取专家手术知识:如何训练局部手术VLMs用于完全网膜切除术的解剖解释

Lennart Maack, Julia-Kristin Graß, Lisa-Marie Toscha, Nathaniel Melling, Alexander Schlaefer

机构 * 1 Institute of Medical Technology Intelligent Systems, Hamburg University of Technology, Hamburg, Germany 2 Department of General, Visceral Thoracic Surgery, University Medical Center Hamburg-Eppendorf, Hamburg, Germany

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出一种隐私保护框架,通过从大型通用LLM中萃取知识,训练出高效的本地手术VLM,用于在完全网膜切除术中进行解剖解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05489 2025-12-08 physics.comp-ph 78%

Beyond Adam: Disentangling Optimizer Effects in the Fine-Tuning of Atomistic Foundation Models

超越Adam:在原子基础模型微调中解耦优化器影响

Xiaoqing Liu, Yangshuai Wang, Teng Zhao

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本研究评估了七种优化器在原子基础模型微调中的性能,发现AdamW和ScheduleFree在曲率条件和力准确性方面表现最佳,同时证明二次优化可提升物理性质的保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16334 2025-12-08 cs.AI cs.CL 62%

OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and General Recipe

OpenMMReasoner: 推动多模态推理的前沿研究:一个开放且通用的配方

Kaichen Zhang, Keming Wu, Zuhao Yang, Bo Li, Kairui Hu, Bin Wang, Ziwei Liu, Xingxuan Li, Lidong Bing

机构 * MiroMind AI Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) LMMs-Lab Team(多模态实验室团队)

专题命中 指令微调 :SFT(abstract);分类 cs.CL、cs.AI

AI总结 OpenMMReasoner提出了一种开放且通用的多模态推理训练配方,通过两阶段方法提升推理性能,实现在多个基准测试中超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05470 2025-12-08 cs.SE 50%

Everything is Context: Agentic File System Abstraction for Context Engineering

一切皆为上下文:面向上下文工程的代理文件系统抽象

Xiwei Xu, Robert Mao, Quan Bai, Xuewu Gu, Yechao Li, Liming Zhu

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出一种基于文件系统的上下文工程抽象,通过统一挂载、元数据和访问控制,实现可验证的上下文管理,支持可问责和以人类为中心的AI协作。

Comments Submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04504 2025-12-08 cs.CV 50%

AnyAnomaly: Zero-Shot Customizable Video Anomaly Detection with LVLM

AnyAnomaly: 零样本可定制化视频异常检测与LVLM

Sunghyun Ahn, Youngwan Jo, Kijung Lee, Sein Kwon, Inpyo Hong, Sanghyun Park

机构 * Yonsei University(延世大学)

专题命中 指令微调 :language model(abstract)

AI总结 AnyAnomaly通过上下文感知的视觉问答模型实现零样本可定制化视频异常检测,无需微调大型视觉语言模型,在多个基准测试中取得最佳性能。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 1 篇

2512.05145 2025-12-08 cs.CV 50%

Self-Improving VLM Judges Without Human Annotations

无需人工标注的自改进VLM评判模型

Inna Wanyin Lin, Yushi Hu, Shuyue Stella Li, Scott Geng, Pang Wei Koh, Luke Zettlemoyer, Tim Althoff, Marjan Ghazvininejad

机构 * FAIR at Meta(Meta 的 FAIR) University of Washington(华盛顿大学)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 无需人工标注,通过自训练提升VLM评判模型的准确性和多维度表现

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 2 篇

2512.05371 2025-12-08 cs.AI cs.AR 77%

ChipMind: Retrieval-Augmented Reasoning for Long-Context Circuit Design Specifications

ChipMind:基于检索的长上下文电路设计规范推理

Changwen Xing, SamZaak Wong, Xinlai Wan, Yanfeng Lu, Mengli Zhang, Zebin Ma, Lei Qi, Zhengxiong Li, Nan Guan, Zhe Jiang, Xi Wang, Jun Yang

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ChipMind通过构建领域知识图谱并结合信息论检索与意图过滤,实现对长上下文电路规范的高效推理,提升LLM在硬件设计中的应用效果。

Comments Accepted by the AAAl26 Conference Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14257 2025-12-08 cs.SE 50%

C2SaferRust: Transforming C Projects into Safer Rust with NeuroSymbolic Techniques

C2SaferRust:利用神经符号技术将C项目转化为更安全的Rust

Vikram Nitin, Rahul Krishna, Luiz Lemos do Valle, Baishakhi Ray

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 C2SaferRust结合规则系统和LLMs,将C代码转换为更安全的Rust,减少指针和unsafe代码,提升安全性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理与问题求解 28 篇

2502.03916 2025-12-08 cs.CL cs.AI 90%

Experiments with Large Language Models on Retrieval-Augmented Generation for Closed-Source Simulation Software

在闭源仿真软件上使用检索增强生成进行大型语言模型实验

Andreas Baumann, Peter Eberhard

机构 * Institute of Engineering and Computational Mechanics, University of Stuttgart(工程与计算力学研究所,斯图加特大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究测试了RAG系统在闭源仿真软件Pasimodo中的表现,发现定制信息提供能显著提升响应质量,凸显了改进闭源仿真模型信息检索的重要性。

Comments 16 pages, 6 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07640 2025-12-08 cs.AI 89%

Enhancing Large Language Models through Neuro-Symbolic Integration and Ontological Reasoning

通过神经符号整合和本体推理增强大型语言模型

Ruslan Idelfonso Magana Vsevolodovna, Marco Monti

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出一种结合符号本体推理和机器学习的方法,通过迭代反馈提升LLM输出的一致性和事实准确性。

Comments Withdrawn because Version 1 contains inaccuracies in references and architecture description. A corrected and improved version will be submitted separately

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18526 2025-12-08 cs.AI cs.LG 88%

Counterfactual Reasoning for Steerable Pluralistic Value Alignment of Large Language Models

反事实推理用于可操控的多元价值观对齐大语言模型

Hanze Guo, Jing Yao, Xiao Zhou, Xiaoyuan Yi, Xing Xie

机构 * Renmin University of China(中国人民大学) Microsoft Research Asia(微软亚洲研究院) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程研究中心,教育部)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 COUPLE通过反事实推理框架实现多元价值观对齐,解决现有方法在处理细粒度价值目标时的依赖性和优先级控制问题。

Comments NeurIPS 2025. 41 pages, 7 figures

Journal ref The Thirty-Ninth Annual Conference on Neural Information Processing Systems. (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16054 2025-12-08 cs.CV 88%

Language-Instructed Reasoning for Group Activity Detection via Multimodal Large Language Model

基于多模态大语言模型的语言引导推理用于群体活动检测

Jihua Peng, Qianxiong Xu, Yichen Liu, Chenxi Liu, Cheng Long, Rui Zhao, Ziyue Li

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出LIR-GAD框架,通过多模态大语言模型实现群体活动检测,引入活动标记和群体标记以提升语义理解和分类性能。

Comments This work is being incorporated into a larger study

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05256 2025-12-08 cs.CL q-bio.QM 87%

Enhancing Clinical Note Generation with ICD-10, Clinical Ontology Knowledge Graphs, and Chain-of-Thought Prompting Using GPT-4

利用ICD-10、临床本体知识图谱和链式推理提示法提升临床笔记生成

Ivan Makohon, Mohamad Najafi, Jian Wu, Mathias Brochhausen, Yaohang Li

机构 * Computer Science, Old Dominion University(旧 Dominion 大学计算机科学系) Biomedical Informatics, University of Arkansas for Medical Sciences(阿肯色医学科学大学生物医学信息学系)

专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究利用ICD-10、临床本体知识图谱和链式推理提示法提升临床笔记生成质量,通过GPT-4在六个临床案例中验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19552 2025-12-08 cs.CV 87%

iFinder: Structured Zero-Shot Vision-Based LLM Grounding for Dash-Cam Video Reasoning

iFinder: 结构化零样本视觉基于LLM的地面定位用于行车记录仪视频推理

Manyi Yao, Bingbing Zhuang, Sparsh Garg, Amit Roy-Chowdhury, Christian Shelton, Manmohan Chandraker, Abhishek Aich

机构 * NEC Laboratories, America(NEC美国实验室) University of California, Riverside(加州大学河滨分校) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 iFinder通过结构化语义接地框架,利用行车记录仪视频中的关键线索提升LLM在驾驶视频推理中的性能。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05836 2025-12-08 cs.AI 86%

Using Large Language Models to Create Personalized Networks From Therapy Sessions

利用大语言模型从治疗会谈中创建个性化网络

Clarissa W. Ong, Hiba Arnaout, Kate Sheehan, Estella Fox, Eugen Owtscharow, Iryna Gurevych

机构 * Department of Psychological and Brain Sciences, University of Louisville, U.S.A(心理与脑科学系,路易斯维尔大学,美国) Department of Computer Science, TU Darmstadt, Germany(计算机科学系,图恩-达姆斯塔特大学,德国) Department of Psychology, University of Toledo, U.S.A(心理学系,托莱多大学,美国)

专题命中 推理与问题求解 :large language model(title);language model(title);prompting(abstract);分类 cs.AI

AI总结 本研究利用大语言模型从治疗记录中自动生成个性化网络,通过上下文学习和聚类方法提升临床效用和可解释性,为治疗个性化提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05419 2025-12-08 cs.LG 86%

TS-HINT: Enhancing Semiconductor Time Series Regression Using Attention Hints From Large Language Model Reasoning

基于大语言模型推理的注意力提示的半导体时间序列回归增强方法

Jonathan Adam Rico, Nagarajan Raghavan, Senthilnath Jayavelu

机构 * Engineering Product Development (EPD), SUTD, Singapore(新加坡南洋理工大学工程产品开发部) Institute for Infocomm Research (I$^2$R), A*STAR, Singapore(新加坡信息通信研究所)

专题命中 推理与问题求解 :large language model(title);language model(title);foundation model(abstract);分类 cs.LG

AI总结 TS-Hint通过结合大语言模型推理提供注意力提示,提升半导体时间序列回归在有限数据下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08475 2025-12-08 cs.SE cs.AI 85%

Designing LLM-based Multi-Agent Systems for Software Engineering Tasks: Quality Attributes, Design Patterns and Rationale

设计基于大语言模型的多智能体系统用于软件工程任务:质量属性、设计模式与理由

Yangxiao Cai, Ruiyin Li, Peng Liang, Mojtaba Shahin, Zengyang Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computing Technologies, RMIT University(皇家墨尔本理工学院计算技术学院) School of Computer Science, Central China Normal University(中央师范大学计算机学院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了基于大语言模型的多智能体系统在软件工程任务中的设计,发现代码生成是最常见任务,功能性适应性是主要关注的质量属性,基于角色的合作是最常用的设计模式,提高生成代码质量是主要设计动机。

Comments 35 pages, 4 images, 7 tables, Manuscript submitted to a Journal (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18574 2025-12-08 cs.SE 85%

SpecTra: Enhancing the Code Translation Ability of Language Models by Generating Multi-Modal Specifications

SpecTra: 通过生成多模态规范提升语言模型的代码翻译能力

Vikram Nitin, Rahul Krishna, Baishakhi Ray

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 SpecTra通过生成多模态规范提升LLM的代码翻译能力,实现高达46%的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18491 2025-12-08 cs.CL cs.AI 81%

MindEval: Benchmarking Language Models on Multi-turn Mental Health Support

MindEval: 在多轮心理健康支持中对语言模型进行基准测试

José Pombal, Maya D'Eon, Nuno M. Guerreiro, Pedro Henrique Martins, António Farinhas, Ricardo Rei

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 MindEval通过与临床心理学家合作,提出了一种自动评估语言模型在多轮心理健康对话中表现的框架,评估了12种先进模型,发现其在复杂交互中表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏