arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-27 至 2026-08-27 共收录 408 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 55 篇

2608.21265 2026-08-27 cs.CL 版本更新 70%

Memory Augmentation Unlocks Efficient Chain-of-Thought Reasoning

记忆增强解锁高效思维链推理

Simeng Zhang, Yilong Chen, Wenyuan Zhang, Zhenyu Zhang, Yao Chen, Junyuan Shang, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Baidu Inc.(百度公司) Tencent Inc.(腾讯公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出无需训练的记忆增强压缩框架,构建可复用推理记忆提升思维草稿压缩效果,在多任务上获显著准确率提升并加速推理,兼容多种压缩机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26735 2026-08-27 cs.CL 版本更新 70%

Rethinking the Multilingual Reasoning Gap with Layer Swap

通过层交换重新思考多语言推理差距

Maxence Lasbordes, Amélie Chatelain, Djamé Seddah

机构 * LightOn Inria(法国国家科学研究中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过构建多语言推理数据集并微调专家模型,发现本地推理与英语枢轴推理的性能差距远小于先前报道,并提出层交换方法将英语专家的推理中间层迁移到本地专家,以缩小差距。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08188 2026-08-27 cs.CL 70%

MetricalARGS: A Taxonomy for Studying Metrical Poetry with LLMs

Chalamalasetti Kranti, Sowmya Vajjala

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Pre-print

Journal ref https://aclanthology.org/2026.wildre-1.1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13207 2026-08-27 cs.CV 版本更新 67%

GTPred: Benchmarking MLLMs for Interpretable Geo-localization and Time-of-capture Prediction

GTPred:评估多模态大语言模型在可解释地理定位和拍摄时间预测中的基准测试

Jinnao Li, Tingzhu Chen, Changbo Wang

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Institute of Image Communication and Information Processing, Shanghai Jiao Tong University(上海交通大学图像通信与信息处理研究院) School of Humanities, Shanghai Jiao Tong University(上海交通大学人文学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 GTPred是一个新的地理-时间预测基准测试,通过评估多模态大语言模型在可解释地理定位和拍摄时间预测中的表现,揭示了当前模型在世界知识和时空推理方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25935 2026-08-27 cs.CV cs.AI 新提交 57%

TAU-Agent: An Agentic Retrieval-Augmented Framework for Traffic Anomaly Understanding

TAU-Agent:用于交通异常理解的智能体式检索增强框架

Yuqiang Lin, Yan Shi, Sam Lockyer, Harish Tayyar Madabushi, Adrian Evans, Wenbin Li, Yinhai Wang, Nic Zhang

机构 * University of Bath(巴斯大学) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 针对交通异常理解需求,提出TAU-Agent智能体式检索增强框架,调度两类视觉工具获取证据,结合微调视觉语言模型推理,在AI City 2026挑战赛多赛道取得对应排名成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25641 2026-08-27 cs.RO cs.AI 新提交 57%

Leveraging Inter-object Affordances for Efficient Planning in Contact-rich Tasks

利用物体间可供性实现接触密集型任务的高效规划

Pouya P. Niaz, Justus Piater, Alejandro Agostini

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 该研究针对传统TAMP方法在接触密集型任务中规划时间长、成功率低的问题,提出结合VLM与U-TAMP的方法,在模拟厨房场景中实现了更高的规划成功率与更快的规划速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05545 2026-08-27 cs.CY cs.AI cs.HC 版本更新 57%

Vibe Compiler: A Research-Logic Synthesis Tool That Runs without Prompt Engineering -Toward Enhancing Metacognition for Sustaining Agency in the Age of Generative AI-

Vibe Compiler:无需提示工程即可运行的研究逻辑综合工具——迈向生成式AI时代维持智能体的元认知

Riichiro Mizoguchi, Tomoki Aburatani, Kento Koike, Machi Shimmei

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

AI总结 针对生成式AI可能侵蚀人类认知智能体的问题,提出基于综合-分析互惠模型的Vibe Compiler工具,通过16个学术参数的本体编译研究想法,以反思性问题引导研究人员,减少对复杂提示的依赖,提升AI辅助推理效果。

Comments 98 pages, 3 figures. English version (pp. 1-54) followed by a Japanese version (pp. 55-98)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22775 2026-08-27 cs.CL cs.SE 版本更新 57%

Scalable Supervision for Software Agents via Patch Reasoning

基于补丁推理的软件智能体可扩展监督

Junjielong Xu, Boyin Tan, Xiaoyuan Liu, Chao Peng, Pengfei Gao, Pinjia He

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) ByteDance(字节跳动)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 针对现有基于测试的软件智能体监督可扩展性不足的问题,提出R4P推理方法,在SWE-bench补丁验证中准确率达72.2%,训练的Mini-SE在Pass@1上较Qwen3-32B提升10.0%至26.2%。

Comments EMNLP'26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20758 2026-08-27 cs.AI 版本更新 57%

How Chain-of-Thought Works? Tracing Information Flow from Decoding, Projection, and Activation

思维链如何工作?从解码、投影和激活追踪信息流

Hao Yang, Qinghua Zhao, Lei Li, Lingyi Meng, Mengda Yu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence and Big Data, Hefei University(合肥大学人工智能与大数据学院) School of Artificial Intelligence, Beijing Institute of Technology(北京理工大学人工智能学院) School of Computing and Information, University of Pittsburgh(匹兹堡大学计算机与信息学院) Center for Biostatistics, The Ohio State University Wexner Medical Center(俄亥俄州立大学韦克斯纳医学中心生物统计中心)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

AI总结 通过反向追踪解码、投影和激活阶段的信息流,揭示思维链作为解码空间剪枝器的作用,并发现其以任务依赖方式调节神经元激活。

Comments Accept by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08375 2026-08-27 cs.CL 57%

Evaluating Transformer Models for Suicide Risk Detection on Social Media

Jakub Pokrywka, Jeremi I. Kaczmarek, Edward J. Gorzelańczyk

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL

Journal ref 2024 IEEE International Conference on Big Data (BigData), pp. 8566-8573, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25299 2026-08-27 cs.CV 新提交 50%

PointRL: Learning Point-Level Vision-Language Grounding from Verifiable Annotation Evidence

PointRL:从可验证标注证据中学习点级视觉-语言接地

Jingyang Su, Pu Cao, Xiuze Jin, Longyue Zhang, Qing Song, Lu Yang

机构 * School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(北京邮电大学智能工程与自动化学院)

专题命中 推理与问题求解 :language model(abstract)

AI总结 PointRL是一种可验证强化学习框架,通过将异构标注证据转换为指向指令并设计多维度奖励,提升了Qwen3.5-4B等模型的点级视觉-语言接地性能,在多个基准上取得显著增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25168 2026-08-27 cs.CV cs.MM 新提交 50%

See More, Detect Less? Taming Information Leakage in Multi-View Anomaly Detection

看得更多,检测得更少?抑制多视图异常检测中的信息泄漏

Shang-Fu Chen, Kuan-Chuan Peng, Jhih-Ciang Wu, Wen-Huang Cheng, Kai-Lung Hua

机构 * National Taiwan University(台湾大学) Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室) National Taiwan Normal University(台湾师范大学) VinUniversity Microsoft Taiwan Corporation(微软台湾公司) National Taiwan University of Science and Technology(台湾科技大学)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 该研究针对多视图异常检测中的跨视图信息泄漏问题,提出GLAD框架,结合视觉基础模型特征与MMA、OGA模块,在Real-IAD等数据集上优于现有最优方法,证实信息限制的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21516 2026-08-27 cs.SE cs.PL 版本更新 50%

Neuro-Formal Verification: Agentic Language-Agnostic Formal Program Reasoning

神经形式化验证:智能体的语言无关形式化程序推理

Shuvendu K. Lahiri

专题命中 推理与问题求解 :LLM(abstract)

AI总结 该研究提出神经形式化验证(NFV),让AI编码智能体与成熟验证器结合,为主流语言开发者实现一键式程序验证,在Python编程问题数据集上取得了良好的验证效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19972 2026-08-27 cs.CV 版本更新 50%

Boosting Reasoning in Large Multimodal Models via Activation Replay

通过激活回放提升大多模态模型的推理能力

Yun Xing, Xiaobin Hu, Qingdong He, Jiangning Zhang, Shuicheng Yan, Shijian Lu, Yu-Gang Jiang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Tencent Youtu Lab(腾讯云图实验室) Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 推理与问题求解 :post-training(abstract)

AI总结 本文通过激活回放方法提升大模型的多模态推理能力,通过操控低熵激活来增强推理性能,验证了该方法在数学、视觉代理和视频推理等场景中的有效性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12065 2026-08-27 cs.RO 版本更新 50%

Scene2Demo: Self-Evolving Embodied Data Generation via Object-Action Graph

具身学习的可扩展任务生成:基于 affordance 的任务世界

Xiang Liu, Sen Cui, Guocai Yao, Zhong Cao, Jingheng Ma, Min Zhang, Changshui Zhang

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出 AGT-World 框架,通过结构化图方法实现任务空间的精确分解,并结合混合反馈机制实现策略的自进化,从而提升机器人任务生成的可扩展性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 91 篇

2604.07054 2026-08-27 cs.CL 版本更新 92%

Sell More, Play Less: Benchmarking LLM Realistic Selling Skill

多卖少玩:LLM真实销售技能基准测试

Xuanbo Su, Wenhao Hu, Le Zhan, Yuting Xie, Kailin Lyu, Kaijie Chen, Ziwei Li, Yeqiang Wang, Haibo Su, Yunzhang Chen, Ling Huang

机构 * SF Express(顺丰速运)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出SalesLLM基准测试,通过30,074个剧本配置和1,805个多轮场景评估大语言模型的销售能力,采用自动评估流程和用户模型CustomerLM提升模拟真实性,实验显示LLM在销售任务上的表现差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19299 2026-08-27 cs.AI 版本更新 92%

Air Traffic Control Using Large Language Models: Prompt Engineering, Architecture, and Evaluation

使用大语言模型的空中交通管制:提示工程、架构与评估

Mahyar Ghazanfari, Matthias Casanova, Jordan Kam, Alex Zongo, Peng Wei, Torsten Darrell, Alexandre Bayen

机构 * The George Washington University(乔治华盛顿大学) California Institute of Technology(加州理工学院) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究针对ATC仍以人工为主的问题,设计5种提示结构并在9种LLMs上实验,发现简洁提示表现最佳,注入正确历史可修复脚本严格提示的错误,明确了LLM辅助ATC的路径与局限。

Comments 39 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02855 2026-08-27 cs.CL cs.CY 版本更新 92%

IDEAlign: Comparing Ideas of Large Language Models to Domain Expert

IDEAlign:将大语言模型的想法与领域专家进行比较

Hyunji Nam, Lucia Langlois, James Malamut, Mei Tan, Dorottya Demszky

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究提出IDEAlign方法,通过“挑出异类”任务评估LLM标注与专家标注的想法层面相似性,发现LLM作为评判者表现最佳但仍不及专家,为开放式LLM标注评估提供了可复用的基准测试协议。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05788 2026-08-27 cs.LG cs.AI cs.CL 版本更新 92%

Emergent Abilities in Large Language Models: A Survey

大语言模型中的涌现能力:一项综述

Leonardo Berti, Flavio Giorgi, Gjergji Kasneci

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本综述全面梳理大语言模型(LLMs)及大推理模型(LRMs)的涌现能力,分析其定义、出现条件,同时指出其潜在有害行为,强调需完善评估框架与监管监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25920 2026-08-27 cs.AI cs.SE 新提交 92%

Repair or Resample? Rethinking Failure Debugging in LLM Multi-Agent Systems

修复还是重采样?重新思考LLM多智能体系统中的故障调试

Zhongwen Luan, Xiaoyu Zhang, Ming Hu, Yue Yang, Jiongchi Yu, Xiaohong Chen

机构 * East China Normal University(华东师范大学) Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理大学) Xi’an University of Architecture and Technology(西安建筑科技大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对LLM多智能体系统的故障调试,提出SymTrace评估框架与SymFail数据集,发现现有无指导重运行方法不可靠,提出的症状驱动干预方法可显著提升故障修复率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25869 2026-08-27 cs.CL 新提交 92%

Anchoring Bias in LLM-as-a-Judge Systems: Prior Scores Compromise Evaluation Independence

LLM作为评判者系统中的锚定偏差:先验分数损害评估独立性

Ante Kapetanovic, Kemal Altwlkany, Andro Mercep, Tomislav Duricic, Emanuel Lacic

机构 * Infobip(英福比普(Infobip))

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究发现LLM-as-a-Judge系统存在锚定偏差,先验分数作为元数据会系统性偏移LLM的评估结果,且现有缓解措施效果有限,需针对性设计评估方案。

Comments 10 pages, full research paper, to appear in proceedings of the 35th ACM International Conference on Information and Knowledge Management (CIKM '26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19872 2026-08-27 cs.AI 版本更新 91%

Simulated Self-Assessment in Large Language Models: A Psychometric Approach to AI Self-Efficacy

大语言模型的模拟自我评估:一种心理测量方法用于AI自我效能

Daniel I Jackson, Emma L Jensen, Syed-Amad Hussain, Emre Sezgin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文通过心理测量方法评估大语言模型的自我效能,发现模型自我评估与实际表现不一致,且不同任务表现差异显著。

Comments 30 pages,7 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25939 2026-08-27 cs.SE 新提交 91%

XREPOTEST: Benchmarking Multilingual Repository-Level Unit Test Generation for Large Language Models

XREPOTEST:面向大语言模型的多语言仓库级单元测试生成基准测试

Dung Le Quang, Dong Cao Van, Nam Le Hai, Linh Ngo Van, Anh M. T. Bui, Phuong T. Nguyen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 本文提出XREPOTEST多语言仓库级单元测试生成基准,针对5种少用语言,结合多上下文策略,用14种LLM实验发现独立与仓库级性能差距,为推进现实场景单元测试生成提供支撑。

Comments Accepted to EMNLP Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25894 2026-08-27 cs.CL 新提交 91%

From Passive Response to Proactive Correction: Enhancing LLM Robustness Against Input Fact Perturbations

从被动响应到主动修正:增强大语言模型(LLM)对输入事实扰动的鲁棒性

Ping Wang, Xiangguo Sun, Bingbing Xu, Guocong Li, Xiaofeng Meng

机构 * Renmin University of China(中国人民大学) Southeast University(东南大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对LLM易受输入事实误导产生错误响应的问题,提出三阶段框架DEDUCE,结合新数据集与指标,在多基准上提升了Qwen、LLaMA等系列模型的鲁棒性与错误修正能力。

Comments Accepted to the Main Conference of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25824 2026-08-27 cs.CL 新提交 91%

Localize-Then-Decide Guarantees for LLM Judgments

LLM判断的“先定位后决策”保证

Xinyu Li, Yi Zhou, Guanqun Cao, Zeyu Fu, Tianjin Huang, Gaojie Jin

机构 * University of Exeter(埃克塞特大学) Cardiff University(卡迪夫大学) University of the West of England(西英格兰大学) University of Macau(澳门大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对LLM作为评估者时候选响应增多导致置信度假设失效的问题,提出“先定位后决策”框架,结合共形预测与校准规则,提升保证成功率与覆盖率。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. Code: https://github.com/llm2409/Localize-Then-Decide

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25291 2026-08-27 cs.LG cs.AI 新提交 90%

InsightSR: Refining Symbolic Regression Search Spaces via Parallel Semantic and Structural LLM Guidance

InsightSR:通过并行语义与结构大语言模型引导优化符号回归搜索空间

Yating Ling, Wenjing Cun, Zhitang Chen

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 InsightSR是嵌入PySR遗传编程引擎的框架,通过LLM的语义与结构引导优化符号回归搜索空间,在多个基准测试中性能优于现有方法且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25937 2026-08-27 cs.AI cs.MA 新提交 90%

Candidate supply and answer selection shape the value of LLM judging in multi-agent systems

候选供给与答案选择塑造多智能体系统中大语言模型(LLM)评判的价值

Jia-Hao Ji, Sijie Li, Jiabei Cheng, Zixi She, Jin-Tai Yu, Zhiyuan Yuan

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究针对多智能体系统中LLM评判的价值,通过分析多组基准数据集,发现结合答案频率与LLM评判可提升答案准确率,为设计多智能体架构提供了诊断基础。

Comments 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25727 2026-08-27 cs.LG cs.CR 新提交 90%

Are LLM-Enhanced GNNs Privacy-Safe?

增强型大型语言模型的图神经网络是否具备隐私安全性?

Longzhu He, Zelang Wen, Chaozhuo Li, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过5阶段统一框架评估LLM增强型GNNs的隐私风险,发现其隐私脆弱性高于浅层文本基线,差分隐私可部分缓解风险但会导致效用下降,凸显了该领域的隐私-效用权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25217 2026-08-27 cs.AI cs.SY eess.SY 新提交 90%

LLM-Driven, Datasheet-Aware Automated Hardware Compatibility Verification for Early-Stage, Pre-Schematic Embedded System Design

面向早期原理图前嵌入式系统设计的、由大语言模型(LLM)驱动且支持数据手册感知的自动化硬件兼容性验证

Haotian Qiao, Robert P. Dick

机构 * University of Michigan(密歇根大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究提出一种LLM驱动的支持数据手册感知的自动化硬件兼容性验证框架,在早期嵌入式系统设计中实现97.5%的验证准确率,较“上传并查询”工作流减少8.6倍输入上下文大小,验证了模块化任务分解等方法的益处。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01975 2026-08-27 cs.AI cs.SE 版本更新 90%

Algorithmic algorithm development with LLMs: A Case Study on LLM-Usage for Contraction Order Optimization in Tensor Networks

基于LLM的算法开发:以张量网络收缩顺序优化中LLM使用为例

Fabian Hoppe, Melven Röhrig-Zöllner, Philipp Knechtges

机构 * German Aerospace Center (DLR), Institute of Software Technology, department High-Performance Computing(德国航空航天中心(DLR)软件技术研究所高性能计算部门)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 通过OpenEvolve对张量网络收缩顺序优化的案例研究,探讨了基于LLM的算法开发,重点分析了LLM选择、评估指标和测试实例等设计因素,强调了验证引导的进化编码代理的潜力以及人类科学家在评估、验证和解释方面的重要性与挑战。

Comments Submitted to the proceedings of the deRSE26 conference

详情

展开后加载摘要…

URL PDF HTML 收藏