arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-17 至 2025-12-17 共收录 61 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 11 篇

2509.12875 2025-12-17 cs.AI 79%

LTA-thinker: Latent Thought-Augmented Training Framework for Large Language Models on Complex Reasoning

LTA-thinker: 用于复杂推理的大语言模型的潜在思维增强训练框架

Jiaqi Wang, Binquan Ji, Haibo Luo, Yiyang Qi, Ruiting Li, Huiyan Wang, Yuantao Han, Cangyi Yang, jiaxu Zhang, Feiliang Ren

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 LTA-Thinker通过提升潜在思维分布方差和信息效率,优化大语言模型的复杂推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14040 2025-12-17 cs.CV cs.LG 79%

ChartAgent: A Chart Understanding Framework with Tool Integrated Reasoning

ChartAgent: 一种集成工具推理的图表理解框架

Boran Wang, Xinming Wang, Yi Chen, Xiang Li, Jian Xu, Jing Yuan, Chenglin Liu

机构 * College of Artificial Intelligence, Nankai University(人工智能学院,南开大学) University of Chinese Academy of Sciences(中国科学院大学) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institution of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室(MAIS),自动化研究所,中国科学院) Zhongguancun Academy(中关村学院) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 ChartAgent通过集成工具推理框架提升图表理解的鲁棒性与可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17985 2025-12-17 cs.HC cs.AI 70%

How K-12 Educators Use AI: LLM-Assisted Qualitative Analysis at Scale

K-12教育工作者如何使用AI:大规模LLM辅助定性分析

Alex Liu, Lief Esbenshade, Shawon Sarkar, Victor Tian, Zachary Zhang, Kevin He, Min Sun

机构 * University of Washington(华盛顿大学) Hensun Innovation(翰森创新)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本研究通过大规模LLM辅助分析,探讨K-12教育工作者在教学中使用AI工具的模式与方法,揭示其教学推理过程并为教育工具设计提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10400 2025-12-17 cs.MA cs.AI cs.CL 62%

Rethinking the Reliability of Multi-agent System: A Perspective from Byzantine Fault Tolerance

重新思考多智能体系统可靠性:从拜占庭容错的角度出发

Lifan Zheng, Jiawei Chen, Qinghong Yin, Jingyuan Zhang, Xinyi Zeng, Yu Tian

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文从拜占庭容错角度研究基于大语言模型的智能体可靠性,提出CP-WBFT机制提升多智能体系统稳定性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14503 2025-12-17 cs.IR cs.CL 57%

RecGPT-V2 Technical Report

RecGPT-V2 技术报告

Chao Yi, Dian Chen, Gaoyang Guo, Jiakai Tang, Jian Wu, Jing Yu, Mao Zhang, Wen Chen, Wenjun Yang, Yujie Luo, Yuning Jiang, Zhujin Gao, Bo Zheng, Binbin Cao, Changfa Wu, Dixuan Wang, Han Wu, Haoyi Hu, Kewei Zhu, Lang Tian, Lin Yang, Qiqi Huang, Siqi Yang, Wenbo Su, Xiaoxiao He, Xin Tong, Xu Chen, Xunke Xi, Xiaowei Huang, Yaxuan Wu, Yeqiu Yang, Yi Hu, Yujin Yuan, Yuliang Yan, Zile Zhou

机构 * RecGPT Team(RecGPT 团队)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 RecGPT-V2通过多代理系统、元提示框架、受约束强化学习和代理作为裁判框架,提升推荐系统意图推理的效率和准确性,实现60%的GPU消耗降低和11.46%的NER提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14417 2025-12-17 cs.AI 57%

PortAgent: LLM-driven Vehicle Dispatching Agent for Port Terminals

PortAgent: 基于大语言模型的港口终端车辆调度代理

Jia Hu, Junqi Li, Weimeng Lin, Peng Jia, Yuxiong Ji, Jintao Lai

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 PortAgent利用大语言模型实现港口终端车辆调度系统的自动化迁移,无需专家参与,降低数据需求并加快部署速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14288 2025-12-17 cs.AI 57%

Leveraging LLMs for Collaborative Ontology Engineering in Parkinson Disease Monitoring and Alerting

利用大语言模型进行帕金森病监测与预警的协同本体工程

Georgios Bouchouras, Dimitrios Doumanas, Andreas Soularidis, Konstantinos Kotis, George A. Vouros

机构 * Intelligent Systems Laboratory, Department of Cultural Technology and Communication, University of the Aegean(爱琴海大学智能系统实验室) Artificial Intelligence Laboratory, Department of Digital Systems, University of Piraeus(比雷埃克斯大学人工智能实验室)

专题命中 复杂问题求解 :CoT(abstract);分类 cs.AI

AI总结 本文研究了利用大语言模型进行帕金森病监测与预警本体工程,通过人机协作提升本体的全面性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14102 2025-12-17 cs.CV cs.AI cs.IR 57%

Neurosymbolic Inference On Foundation Models For Remote Sensing Text-to-image Retrieval With Complex Queries

面向遥感文本到图像检索的神经符号推理:为复杂查询的基座模型

Emanuele Mezzi, Gertjan Burghouts, Maarten Kruithof

机构 * Vrije Universiteit Amsterdam(瓦赫宁根大学阿姆斯特丹) TNO(荷兰国防研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 RUNE通过结合大型语言模型和神经符号AI,利用逻辑推理提升遥感文本到图像检索的性能与可解释性,针对复杂查询和图像不确定性提出新的评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13752 2025-12-17 cs.CV cs.AI 57%

STAR: STacked AutoRegressive Scheme for Unified Multimodal Learning

STAR:用于统一多模态学习的堆叠自回归方案

Jie Qin, Jiancheng Huang, Limeng Qiao, Lin Ma

机构 * Meituan Inc(美团公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 STAR通过堆叠自回归方案提升多模态生成性能,同时保持理解能力,实验验证其在统一多模态学习中的有效性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00981 2025-12-17 cs.CV 50%

VesSAM: Efficient Multi-Prompting for Segmenting Complex Vessel

VesSAM: 高效多提示分割复杂血管

Suzhong Fu, Rui Sun, Xuan Ding, Jingqi Dong, Yiming Yang, Yao Zhu, Min Chang Jordan Ren, Delin Deng, Angelica Aviles-Rivero, Shuguang Cui, Zhen Li

机构 * FNii-Shenzhen, CUHK-Shenzhen(FNii-Shenzhen,CUHK-Shenzhen) School of Science and Engineering, CUHK-Shenzhen(CUHK-Shenzhen科学与工程学院) Zhejiang University(浙江大学) Boston University(波士顿大学) Vanderbilt University(范德比大学) Tsinghua University(清华大学)

专题命中 复杂问题求解 :planning(abstract)

AI总结 VesSAM通过多提示编码器和轻量级解码器提升血管分割性能,实现比现有方法更高的Dice和IoU指标,同时参数更少且泛化能力更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09554 2025-12-17 cs.IR 50%

Mixture-of-RAG: Integrating Text and Tables with Large Language Models

混合RAG:利用大语言模型整合文本和表格

Chi Zhang, Qiyang Chen, Mengqi Zhang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 MixRAG通过三阶段框架整合文本和表格,提升异构文档检索性能,实现混合模态文档接地的最新成果。

Comments Accepted to SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 13 篇

2508.01977 2025-12-17 cs.CL cs.AI 92%

TIBSTC-CoT: A Multi-Domain Instruction Dataset for Chain-of-Thought Reasoning in Language Models

TIBSTC-CoT:一种用于语言模型链式推理的多领域指令数据集

Fan Gao, Cheng Huang, Nyima Tashi, Yutong Liu, Xiangxiang Wang, Thupten Tsering, Ban Ma-bao, Renzeg Duojie, Gadeng Luosang, Rinchen Dongrub, Dorje Tashi, Xiao Feng, Hao Wang, Yongbin Yu

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(title,abstract);分类 cs.CL、cs.AI

AI总结 TIBSTC-CoT通过链式推理提示法构建多领域藏语数据集,开发出具备推理能力的藏语LLM,提升低资源语言处理性能。

Comments We will merge this paper with arXiv:2503.18288

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13573 2025-12-17 cs.CV 82%

MMhops-R1: Multimodal Multi-hop Reasoning

MMhops-R1: 多模态多跳推理

Tao Zhang, Ziqi Zhang, Zongyang Ma, Yuxin Chen, Bing Li, Chunfeng Yuan, Guangting Wang, Fengyun Rao, Ying Shan, Weiming Hu

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

AI总结 MMhops-R1通过动态规划和多模态知识整合,提升多跳推理能力,提出新型mRAG框架并提供挑战性基准。

Comments Acceped by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20935 2025-12-17 cs.AI 79%

GALAX: Graph-Augmented Language Model for Explainable Reinforcement-Guided Subgraph Reasoning in Precision Medicine

GALAX:图增强语言模型用于可解释的强化引导子图推理在精准医学中

Heming Zhang, Di Huang, Wenyu Li, Michael Province, Yixin Chen, Philip Payne, Fuhai Li

机构 * I2DB, Washington University School of Medicine(I2DB,华盛顿大学医学学院) Department of Computer Science and Engineering, Washington University in St. Louis(计算机科学与工程系,华盛顿大学圣路易斯分校) Department of Genetics, Washington University School of Medicine(遗传学系,华盛顿大学医学学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 GALAX通过整合图神经网络与大语言模型,利用强化学习实现子图推理,提升精准医学中目标发现的可解释性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07553 2025-12-17 cs.AI 70%

COMMA: A Communicative Multimodal Multi-Agent Benchmark

COMMA:一种基于通信的多模态多智能体基准

Timothy Ossowski, Danyal Maqbool, Jixuan Chen, Zefan Cai, Tyler Bradshaw, Junjie Hu

机构 * Department of Computer Sciences University of Wisconsin-Madison(计算机科学系威斯康星大学麦迪逊分校) Department of Computer Sciences UC San Diego(计算机科学系加州大学圣地亚哥分校) Department of Radiology University of Wisconsin-Madison(放射学系威斯康星大学麦迪逊分校) Department of Computer Sciences Department of Biostatistics and Medical Informatics University of Wisconsin-Madison(计算机科学系生物统计学与医学信息学系威斯康星大学麦迪逊分校)

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 COMMA基准通过语言通信评估多模态多智能体系统的协作性能,揭示现有模型在智能体协作中的不足。

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13741 2025-12-17 cs.LG cs.AI 62%

The Laminar Flow Hypothesis: Detecting Jailbreaks via Semantic Turbulence in Large Language Models

层流假说:通过大语言模型中的语义湍流检测对抗性突破

Md. Hasib Ur Rahman

机构 * Brac University(布拉克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出层流假说,通过检测大语言模型中的语义湍流,实现对抗性突破的实时检测与安全架构诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13713 2025-12-17 cs.AI cs.LG cs.MA 62%

LoopBench: Discovering Emergent Symmetry Breaking Strategies with LLM Swarms

LoopBench: 通过LLM群体发现涌现的对称性打破策略

Ali Parsaee, Yashar Talebirad, Csongor Szepesvári, Vishwajeet Ohal, Eden Redman

机构 * University of Alberta(阿尔伯塔大学) Network for Applied Technology(应用技术网络)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 LoopBench通过LLM群体研究分布式对称性打破策略,揭示先进模型在解决死锁问题上的能力。

Comments 11 pages, 3 figures, submitted to ANTS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08743 2025-12-17 cs.AI cs.MA 57%

Single-Agent Scaling Fails Multi-Agent Intelligence: Towards Foundation Models with Native Multi-Agent Intelligence

单智能体扩展无法实现多智能体智能:迈向具有原生多智能体智能的基础模型

Shuyue Hu, Haoyang Yan, Yiqun Zhang, Yang Chen, Dongzhan Zhou, Lei Bai

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文指出单智能体扩展无法实现多智能体智能,提出构建具有原生多智能体智能的基础模型的关键方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11162 2025-12-17 cs.CV cs.LG 57%

VIBE: Can a VLM Read the Room?

VIBE:视觉语言模型能否读懂房间?

Tania Chakraborty, Eylon Caplan, Dan Goldwasser

机构 * Purdue University(普渡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出视觉社交-语用推理任务,揭示VLM在社交推理中的局限性,并通过高质量数据集评估多种VLM的性能。

Comments Findings of EMNLP, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14312 2025-12-17 cs.CV cs.AI 57%

From YOLO to VLMs: Advancing Zero-Shot and Few-Shot Detection of Wastewater Treatment Plants Using Satellite Imagery in MENA Region

从YOLO到VLMs:利用卫星图像在中东和北非地区推进零样本和少样本废水处理厂检测

Akila Premarathna, Kanishka Hewageegana, Garcia Andarcia Mariangel

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究利用VLMs替代YOLOv8,通过零样本和少样本方法高效识别中东和北非地区废水处理厂,提升遥感应用的可扩展性。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14233 2025-12-17 cs.SE cs.AI cs.CR 57%

PentestEval: Benchmarking LLM-based Penetration Testing with Modular and Stage-Level Design

PentestEval: 一种基于模块化和阶段级设计的LLM渗透测试基准测试

Ruozhao Yang, Mingfei Cheng, Gelei Deng, Tianwei Zhang, Junjie Wang, Xiaofei Xie

机构 * School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡国立管理大学) School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学) School of Cyber Security, Tianjin University(网络安全学院,天津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 PentestEval通过模块化和阶段级设计,评估LLM在渗透测试各阶段的性能,揭示其在自动化测试中的局限性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14141 2025-12-17 cs.CV cs.AI 57%

TorchTraceAP: A New Benchmark Dataset for Detecting Performance Anti-Patterns in Computer Vision Models

TorchTraceAP: 一种新的基准数据集,用于检测计算机视觉模型中的性能反模式

Hanning Chen, Keyu Man, Kevin Zhu, Chenguang Zhu, Haonan Li, Tongbo Luo, Xizhou Feng, Wei Sun, Sreen Tallam, Mohsen Imani, Partha Kanuparthy

机构 * University of California, Irvine(加州大学尔湾分校) Meta University of California, Riverside(加州大学河滨分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 TorchTraceAP提出了一种新的基准数据集和迭代方法,用于提升ML模型检测计算机视觉模型轨迹中反模式的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14014 2025-12-17 cs.AI 57%

MobileWorldBench: Towards Semantic World Modeling For Mobile Agents

MobileWorldBench: 向移动智能体的语义世界建模迈进

Shufan Li, Konstantinos Kallidromitis, Akash Gokul, Yusuke Kato, Kazuki Kozuka, Aditya Grover

机构 * UCLA(加州大学洛杉矶分校) Panasonic AI Research(松下人工智能研究) Salesforce AI Research(Salesforce人工智能研究)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 MobileWorldBench通过语义世界模型提升移动智能体任务成功率

Comments 21 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07961 2025-12-17 quant-ph cs.DS cs.LG stat.ML 57%

QCircuitBench: A Large-Scale Dataset for Benchmarking Quantum Algorithm Design

QCircuitBench:用于量子算法设计的大型数据集

Rui Yang, Ziruo Wang, Yuntian Gu, Tianyi Chen, Yitao Liang, Tongyang Li

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Center on Frontiers of Computing Studies, Peking University(北京大学计算前沿研究中心) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Anderson School of Management, University of California, Los Angeles(美国加州大学洛杉矶分校安德森管理学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 QCircuitBench是一个用于评估AI在量子算法设计中能力的大型数据集,包含多种任务和算法,揭示了大语言模型在此领域的局限性。

Comments 45 pages, 17 figures, 15 tables, GitHub repository: https://github.com/EstelYang/QCircuitBench

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他推理 7 篇

2512.14427 2025-12-17 cs.CL cs.AI cs.LG 82%

Effect of Document Packing on the Latent Multi-Hop Reasoning Capabilities of Large Language Models

文档打包对大型语言模型潜在多跳推理能力的影响

Gabriele Prato, Shagun Sodhani, Alessandro Sordoni, Sarath Chandar

机构 * Chandar Research Lab(Chandar研究实验室) Mila – Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Microsoft Research(微软研究院) Polytechnique Montréal(蒙特利尔理工学院) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了文档打包对大型语言模型多跳推理能力的影响,发现打包可提升性能但增加计算成本,并通过消融研究揭示了其关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14118 2025-12-17 cs.CL 79%

CogMem: A Cognitive Memory Architecture for Sustained Multi-Turn Reasoning in Large Language Models

CogMem:一种用于大型语言模型中持续多轮推理的认知记忆架构

Yiran Zhang, Jincheng Hu, Mark Dras, Usman Naseem

机构 * Macquarie University(麦考瑞大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 CogMem通过引入认知启发的记忆增强架构,解决大型语言模型在多轮交互中的推理偏差、任务漂移和记忆衰减问题,提升推理的连贯性和可靠性。

Comments underreview

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14064 2025-12-17 cs.CL 70%

What Affects the Effective Depth of Large Language Models?

影响大语言模型有效深度的因素是什么?

Yi Hu, Cai Zhou, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) Department of Computer Science, Massachusetts Institute of Technology(计算机科学系,麻省理工学院)

专题命中 其他推理 :reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 研究发现大语言模型的有效深度受模型规模、训练类型和任务难度影响,且有效深度比例稳定,提示需提升层利用率、模型剪枝和提前退出技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16313 2025-12-17 cs.LG cs.AI cs.CL 67%

Retrieval Enhanced Feedback via In-context Neural Error-book

通过上下文神经错误本增强的检索反馈

Jongyeop Hyun, Bumsoo Kim

机构 * School of CSE Chung-Ang University(计算机科学与工程学院 Chung-Ang 大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 REFINE通过结构化反馈框架,系统分析并缓解多模态推理中的错误,提升推理效率和可扩展性。

Comments Accepted at EMNLP 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14052 2025-12-17 cs.CV cs.CL 57%

HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices

HyperVL: 一种高效的多模态大语言模型用于边缘设备

HyperAI Team, Yuchen Liu, Kaiyang Han, Zhiqiang Xia, Yuhang Dong, Chen Song, Kangyu Tang, Jiaming Xu, Xiushi Feng, WenXuan Yu, Li Peng, Mingyang Wang, Kai Wang, Changpeng Yang, Yang Li, Haoyu Lu, Hao Wang, Bingna Xu, Guangyao Liu, Long Huang, Kaibin Guo, Jinyang Wu, Dan Wu, Hongzhen Wang, Peng Zhou, Shuai Nie, Shande Wang, Runyu Shi, Ying Huang

机构 * HyperAI Team(HyperAI团队) Xiaomi Corporation(小米公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 HyperVL是一种为边缘设备优化的高效多模态大语言模型,通过图像分块、视觉分辨率压缩和双一致性学习技术,实现低延迟、低功耗的多模态推理。

Comments Technical report of Xiaomi HyperAI Team

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13714 2025-12-17 cs.AI 57%

AI-Powered Annotation Pipelines for Stabilizing Large Language Models: A Human-AI Synergy Approach

基于AI的标注流程用于稳定大语言模型:一种人机协同方法

Gangesh Pathak, Prasanna Kumar

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于AI的标注流程,通过人机协同方法系统识别并修复大语言模型的不稳定性,提升模型的可靠性和鲁棒性。

Comments 16 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏