arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10549 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10549 篇

2601.06268 2026-02-11 cs.SE cs.AI 57%

Automated QoR improvement in OpenROAD with coding agents

在OpenROAD中通过编码代理实现自动化QoR提升

Amur Ghose, Junyeong Jang, Andrew B. Kahng, Jakang Lee

机构 * UC San Diego(UC圣地亚哥大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 AuDoPEDA通过自主编码代理在OpenROAD中实现EDA技术的自动化改进,显著提升QoR指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11362 2026-02-11 cs.LG cs.CV 57%

PersonaX: Multimodal Datasets with LLM-Inferred Behavior Traits

PersonaX: 多模态数据集与LLM推断行为特征

Loka Li, Wong Yu Kang, Minghao Fu, Guangyi Chen, Zhenhao Chen, Gongxu Luo, Yuewen Sun, Salman Khan, Peter Spirtes, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学) University of California San Diego(加州大学圣地亚哥分校) Australian National University(澳大利亚国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 PersonaX通过多模态数据集结合LLM推断行为特征,推动多模态特征分析与因果推理发展。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15935 2026-02-11 cs.DB cs.CL cs.CR 57%

MAPS: A Multilingual Benchmark for Agent Performance and Security

MAPS: 一种多语言评估基准,用于代理性能和安全

Omer Hofman, Jonathan Brokman, Oren Rachmil, Shamik Bose, Vikas Pahuja, Toshiya Shimizu, Trisha Starostina, Kelly Marchisio, Seraphina Goldfarb-Tarrant, Roman Vainshtein

机构 * Fujitsu Research of Europe(富士通欧洲研究部) Fujitsu Limited(富士通有限公司) Cohere

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 MAPS是一个多语言评估基准,用于评估代理AI在不同语言和任务中的性能与安全性。

Comments Accepted to EACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08872 2026-02-10 cs.CL cs.IR 57%

Large Language Models for Geolocation Extraction in Humanitarian Crisis Response

大型语言模型在人道主义危机响应中的地理信息提取

G. Cafferata, T. Demarco, K. Kalimeri, Y. Mejova, M. G. Beiró

机构 * Universidad de San Andrés Victoria(圣安德烈斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于LLM的两步框架,通过结合命名实体识别和上下文地理编码模块,提升人道主义文档中地理信息提取的精度与公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08716 2026-02-10 cs.CL 57%

PERSPECTRA: A Scalable and Configurable Pluralist Benchmark of Perspectives from Arguments

PERSPECTRA: 一种可扩展且可配置的多元视角论证基准

Shangrui Nie, Kian Omoomi, Lucie Flek, Zhixue Zhao, Charles Welch

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 PERSPECTRA提出了一种结合结构清晰与语义多样性的多元视角论证基准,用于评估模型在处理多个视角时的表示、区分与推理能力。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08342 2026-02-10 cs.CV cs.AI 57%

UrbanGraphEmbeddings: Learning and Evaluating Spatially Grounded Multimodal Embeddings for Urban Science

UrbanGraphEmbeddings: 学习和评估空间导向的多模态嵌入用于城市科学

Jie Zhang, Xingtong Yu, Yuan Fang, Rudi Stouffs, Zdravko Trivic

机构 * National University of Singapore Department of Architecture Singapore The Chinese University of Hong Kong Dept of Systems Eng. \& Eng. Mgmt. China Singapore Management University School of Computing \& Info. Systems Singapore National University of Singapore Department of Architecture The Chinese University of Hong Kong Singapore Management University

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出UGE框架,通过空间导向的多模态嵌入提升城市理解任务性能,实验显示在图像检索和地理位置排名上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08311 2026-02-10 cs.AI 57%

Moral Sycophancy in Vision Language Models

视觉语言模型中的道德趋炎奉承

Shadman Rabby, Md. Hefzul Hossain Papon, Sabbir Ahmed, Nokimul Hasan Arif, A. B. M. Ashikur Rahman, Irfan Ahmad

机构 * University of Dhaka(达卡大学) Daffodil International University(达福迪国际大学) Islamic University of Technology(伊斯兰技术大学) University of Central Florida(佛罗里达中央大学) King Fahad University of Petroleum and Minerals(国王法赫德石油与矿物大学) SDAIA - KFUPM Joint research Center for Artificial Intelligence(SDAIA-KFUPM人工智能联合研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了视觉语言模型在道德决策中的趋炎奉承现象,发现模型在用户偏见下易产生道德错误回应,揭示了模型在伦理一致性与稳健性上的权衡问题。

Comments 13 pages, 6 figures, 8 tables, Submitted for review in ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08305 2026-02-10 cs.CL 57%

JUSTICE: Judicial Unified Synthesis Through Intermediate Conclusion Emulation for Automated Judgment Document Generation

JUSTICE: 通过中间结论模拟实现司法统一合成以生成自动判决文件

Binglin Wu, Yingyi Zhang, Xiannneg Li

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 JUSTICE通过模拟预判过程提升判决书生成的法律准确性和连贯性

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03219 2026-02-10 cs.AI 57%

Beyond Quantity: Trajectory Diversity Scaling for Code Agents

超越数量:代码代理的轨迹多样性扩展

Guhong Chen, Chenghao Sun, Cheng Fu, Qiyao Wang, Zhihong Huang, Chaopeng Wei, Guangxu Chen, Feiteng Fang, Ahmadreza Argha, Bing Zhao, Xander Xu, Qi Han, Hamid Alinejad-Rokny, Qiang Qu, Binhua Li, Shiwen Ni, Min Yang, Hu Wei, Yongbin Li

机构 * SIAT, CAS(中国科学院软件研究所) Alibaba Group(阿里巴巴集团) UNSW Sydney(新南威尔士大学悉尼分校) SUAT(上海大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 TDScaling通过提升轨迹多样性而非单纯增加数据量,优化代码代理训练的性能-成本平衡,提升工具使用泛化和编码能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04094 2026-02-10 cs.LG 57%

KoTaP: A Panel Dataset for Corporate Tax Avoidance, Performance, and Governance in Korea

KoTaP:韩国企业税务避税、绩效与治理的面板数据集

Hyungjong Na, Wonho Song, Seungyong Han, Donghyeon Jo, Sejin Myung, Hyungjoon Kim

专题命中 推理评测 :planning(abstract);分类 cs.LG

AI总结 KoTaP是一个涵盖韩国非金融企业的长期面板数据集,用于研究税务避税、绩效和治理,提供标准化变量和国际可比性,支持经济计量、AI分析和政策研究。

Comments 18 pages, 3 figures, 8 tables. Submitted to Scientific Data; currently under review. Data and codebook available at Zenodo (DOI: 10.5281/zenodo.17149808)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08062 2026-02-10 cs.LG cs.CR 57%

Efficient and Adaptable Detection of Malicious LLM Prompts via Bootstrap Aggregation

通过Bootstrap聚合实现高效且适应性强的恶意LLM提示检测

Shayan Ali Hassan, Tao Ni, Zafar Ayyub Qazi, Marco Canini

机构 * KAUST(卡塔尔人工智能研究所在线中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 BAGEL通过Bootstrap聚合和专家混合方法,实现高效且适应性强的恶意LLM提示检测,以高F1得分超越现有大参数模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07996 2026-02-10 cs.CL 57%

The Judge Who Never Admits: Hidden Shortcuts in LLM-based Evaluation

从不承认的裁判:基于大语言模型的评估中的隐藏捷径

Arash Marioriyad, Omid Ghahroodi, Ehsaneddin Asgari, Mohammad Hossein Rohban, Mahdieh Soleymani Baghshah

机构 * Sharif University of Technology(沙菲大学技术学院) Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究揭示了基于大语言模型的评估中隐藏的捷径问题,指出裁判模型在面对注入提示时缺乏透明度,导致裁决偏移率高但提示识别率低,揭示了评估流程中的可靠性缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07673 2026-02-10 cs.CL 57%

Blind to the Human Touch: Overlap Bias in LLM-Based Summary Evaluation

无人类触感:基于LLM的摘要评估中的重叠偏差

Jiangnan Fang, Cheng-Tse Liu, Hanieh Deilamsalehy, Nesreen K. Ahmed, Puneet Mathur, Nedim Lipka, Franck Dernoncourt, Ryan A. Rossi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究发现LLM在摘要评估中对重叠度敏感,随着重叠减少,LLM更倾向于选择其他LLM生成的摘要,表明需采用更复杂的评判技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07662 2026-02-10 cs.AI 57%

ONTrust: A Reference Ontology of Trust

ONTrust:信任的参考本体

Glenda Amaral, Tiago Prince Sales, Riccardo Baratella, Daniele Porello, Renata Guizzardi, Giancarlo Guizzardi

机构 * Semantics, Cybersecurity \& Services, University of Twente, The Netherlands Business Information Systems, University of Twente, The Netherlands DAFIST, University of Genoa, Italy

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 ONTrust通过构建信任参考本体,提供信任概念的本体学基础,支持信息建模、自动推理和语义互操作性,应用于信任管理、AI设计等领域。

Comments 46 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07361 2026-02-10 cs.CL cs.IR 57%

ViHERMES: A Graph-Grounded Multihop Question Answering Benchmark and System for Vietnamese Healthcare Regulations

ViHERMES: 一个基于图的多跳问答基准和系统用于越南卫生法规

Long S. T. Nguyen, Quan M. Bui, Tin T. Ngo, Quynh T. N. Vo, Dung N. H. Le, Tho T. Quan

机构 * URA Research Group, Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT), VNU-HCM, Vietnam(URA研究组,计算机科学与工程学院,胡志明市技术大学(HCMUT),VNU-HCM,越南)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ViHERMES是一个针对越南医疗法规多跳问答的基准和系统,通过图感知方法提升法规问答性能。

Comments Accepted at ACIIDS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07259 2026-02-10 cs.AI 57%

Incentive-Aware AI Safety via Strategic Resource Allocation: A Stackelberg Security Games Perspective

通过战略资源分配实现激励感知的AI安全:从Stackelberg安全游戏视角出发

Cheol Woo Kim, Davin Choo, Tzeh Yuan Neoh, Milind Tambe

机构 * Harvard University(哈佛大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于Stackelberg安全游戏的AI安全框架,通过战略资源分配设计激励机制,提升AI监管的主动性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07243 2026-02-10 cs.RO cs.AI cs.GR 57%

Realistic Synthetic Household Data Generation at Scale

大规模生成逼真合成家庭数据

Siddharth Singh, Ifrah Idrees, Abraham Dauhajre

机构 * Siddharth Singh(1 西雅图)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种大规模生成逼真合成家庭数据的方法,通过松耦合生成人机交互与环境数据,实现双向影响建模,提升家庭智能设备的开发与测试能力。

Comments Accepted at Agentic AI Benchmarks and Applications for Enterprise Tasks workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22978 2026-02-10 cs.CL 57%

ShoppingComp: Are LLMs Really Ready for Your Shopping Cart?

ShoppingComp: LLMs 是否真的准备好为您的购物车服务?

Huaixiao Tou, Ying Zeng, Yuemeng Li, Cong Ma, Muzhi Li, Minghao Li, Weijie Yuan, He Zhang, Kai Jia

机构 * ByteDance(字节跳动)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ShoppingComp通过现实世界基准揭示LLM在购物代理任务中的局限性,强调其在信息定位、多约束验证和风险决策方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02424 2026-02-10 cs.CR cs.AI cs.SE 57%

CyberRAG: An Agentic RAG cyber attack classification and reporting tool

CyberRAG: 一种基于代理的RAG网络攻击分类与报告工具

Francesco Blefari, Cristian Cosentino, Francesco Aurelio Pironti, Angelo Furfaro, Fabrizio Marozzo

机构 * University of Calabria(卡利博里大学) IMT School for Advanced Studies(IMT高级研究学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CyberRAG是一种基于代理的RAG框架,通过模块化设计实现网络攻击的实时分类、解释和结构化报告,提高检测准确性和可解释性。

Journal ref Future Generation Computer Systems, 176, 2026, 108186

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21910 2026-02-10 cs.CL 57%

AutoMixer: Checkpoint Artifacts as Automatic Data Mixers

AutoMixer:检查点 artifacts 作为自动数据混合器

Ernie Chang, Yang Li, Patrick Huber, Vish Vogeti, David Kant, Yangyang Shi, Vikas Chandra

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 AutoMixer通过利用检查点模型的新兴能力,自动优化数据混合,提升预训练性能达1.93%。

Comments Accepted at ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07186 2026-02-10 cs.MA cs.LG 57%

The Value of Variance: Mitigating Debate Collapse in Multi-Agent Systems via Uncertainty-Driven Policy Optimization

方差的价值:通过不确定性驱动的策略优化缓解多智能体系统中的辩论崩溃

Luoxi Tang, Yuqiao Meng, Joseph Costa, Yingxue Zhang, Muchao Ye, Zhaohan Xi

机构 * Department of Computer Science, Binghamton University, Binghamton, NY, USA(宾夕法尼亚州立大学计算机科学系) University of Iowa, Iowa City, IA, USA(爱荷华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出了一种基于不确定性驱动的策略优化方法,通过量化多智能体系统中的不确定性来缓解辩论崩溃问题,提升决策准确性和系统一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07095 2026-02-10 cs.CV cs.AI 57%

WorldEdit: Towards Open-World Image Editing with a Knowledge-Informed Benchmark

WorldEdit: 向开放世界图像编辑迈进的基于知识的基准

Wang Lin, Feng Wang, Majun Zhang, Wentao Hu, Tao Jin, Zhou Zhao, Fei Wu, Jingyuan Chen, Alan Yuille, Sucheng Ren

机构 * Zhejiang University(浙江大学) Johns Hopkins University(约翰霍普金斯大学) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 WorldEdit通过引入基于知识的基准,提升模型在开放世界图像编辑中对隐式指令的理解和处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07041 2026-02-10 cs.CV cs.LG 57%

OMNI-Dent: Towards an Accessible and Explainable AI Framework for Automated Dental Diagnosis

OMNI-Dent:迈向一个可及且可解释的AI框架,用于自动化牙科诊断

Leeje Jang, Yao-Yi Chiang, Angela M. Hastings, Patimaporn Pungchanchaikul, Martha B. Lucas, Emily C. Schultz, Jeffrey P. Louie, Mohamed Estai, Wen-Chen Wang, Ryan H. L. Ip, Boyen Huang

机构 * University of Minnesota(明尼苏达大学) Khon Kaen University(科恩卡恩大学) Minnesota State University(明尼苏达州立大学) The University of Western Australia(西澳大学) Kaohsiung Medical University(高雄医学院) Auckland University of Technology(奥克兰理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 OMNI-Dent通过结合临床推理原则和视觉语言模型,提供一个数据高效且可解释的牙科诊断框架,帮助用户识别异常并判断是否需要专业评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07014 2026-02-10 cs.CV cs.AI 57%

Vectra: A New Metric, Dataset, and Model for Visual Quality Assessment in E-Commerce In-Image Machine Translation

Vectra: 一种新的度量标准、数据集和模型用于电子商务图像中的图像翻译视觉质量评估

Qingyu Wu, Yuxuan Han, Haijun Li, Zhao Xu, Jianshan Zhao, Xu Jin, Longyue Wang, Weihua Luo

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Vectra提出了一种无参考、基于大语言模型的视觉质量评估框架,通过多维度量系统、数据集和模型提升电子商务图像翻译的视觉质量评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06443 2026-02-09 cs.CR cs.AI 57%

TrajAD: Trajectory Anomaly Detection for Trustworthy LLM Agents

TrajAD:用于可信大语言模型代理的轨迹异常检测

Yibing Liu, Chong Zhang, Zhongyi Han, Hansong Liu, Yong Wang, Yang Yu, Xiaoyan Wang, Yilong Yin

机构 * School of Software, Shandong University(山东大学软件学院) Sonli Holding Group Co., Ltd.(山东利集团有限公司) Shandong Huazhi Talent Technology Co., Ltd.(山东华智人才科技有限公司) Information Technology Service Center of People’s Court(人民法院信息技术服务中心)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 TrajAD通过细粒度过程监督训练的专用验证器,解决大语言模型代理轨迹异常检测问题,提升过程可靠性。

Comments 9 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06370 2026-02-09 cs.CL 57%

Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production

面向成本的模型选择用于文本分类:在生产环境中细调编码器与LLM提示之间的多目标权衡

Alberto Andres Valdes Gonzalez

机构 * Pontifical Catholic University of Chile(天主教智利大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出在生产环境中细调编码器与LLM提示之间的多目标权衡,发现微调编码器在成本和性能上优于LLM提示。

Comments 26 pages, 12 figures. Empirical benchmark comparing fine-tuned encoders and LLM prompting for text classification under cost and latency constraints

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05512 2026-02-09 cs.CL cs.IR 57%

A Human-in-the-Loop, LLM-Centered Architecture for Knowledge-Graph Question Answering

面向知识图谱问答的人机协同、大语言模型中心架构

Larissa Pusch, Alexandre Courtiol, Tim Conrad

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种人机协同的大语言模型中心架构,用于知识图谱问答,通过生成Cypher查询并让用户逐步优化,提升复杂数据集的可访问性并保持事实准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05424 2026-02-09 cs.AI 57%

THOR: Inductive Link Prediction over Hyper-Relational Knowledge Graphs

THOR:基于超关系知识图谱的归纳链接预测

Weijian Yu, Yuhuan Lu, Dingqi Yang

机构 * University of Macau(澳门大学) Khalifa University(哈利法大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 THOR提出了一种针对超关系知识图谱的归纳链接预测方法,通过基础图建模和Transformer解码器提升预测性能,优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05386 2026-02-09 cs.CR cs.AI 57%

Spider-Sense: Intrinsic Risk Sensing for Efficient Agent Defense with Hierarchical Adaptive Screening

Spider-Sense: 基于内在风险感知的高效代理防御方法与分层自适应筛查

Zhenxiong Yu, Zhi Yang, Zhiheng Jin, Shuhe Wang, Heng Zhang, Yanlin Fei, Lingfeng Zeng, Fangqi Lou, Shuo Zhang, Tu Hu, Jingping Liu, Rongze Chen, Xingyu Zhu, Kunyi Wang, Chaofa Yuan, Xin Guo, Zhaowei Liu, Feipeng Zhang, Jie Huang, Huacan Wang, Ronghao Chen, Liwen Zhang

机构 * SUFE(上海财经大学) NUS(新加坡国立大学) QuantaAlpha(量子阿尔法) CMU(卡内基梅隆大学) SYSU(南方科技大学) USTC(中国科学技术大学) XJTU(西安交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Spider-Sense通过内在风险感知实现高效代理防御,结合分层自适应筛查机制,有效降低攻击成功率和误报率,仅引入微小延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02075 2026-02-09 cs.CE cs.LG 57%

MDAgent2: Large Language Model for Code Generation and Knowledge Q&A in Molecular Dynamics

MDAgent2:用于分子动力学中代码生成和知识问答的大型语言模型

Zhuofan Shi, Hubao A, Yufei Shao, Dongliang Huang, Hongxu An, Chunxiao Xin, Haiyang Shen, Zhenyu Wang, Yunshan Na, Gang Huang, Xiang Jing

机构 * Peking University(北京大学) National Key Laboratory of Data Space Technology and System(国家数据空间技术与系统重点实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Liaoning Technical University(辽宁技术大学) Wenjing Future Lab (Beijing) Technology Co., Ltd(文景未来实验室(北京)科技有限公司)

专题命中 推理评测 :self-correction(abstract);分类 cs.LG

AI总结 MDAgent2是首个能同时进行分子动力学知识问答和代码生成的端到端框架,通过领域特定数据集和强化学习方法提升性能。

Comments 24 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏