AI能给植物肉试味?斯坦福等用2.1万次人类评价检验预测
斯坦福大学计算机科学系、Food Intelligence Lab、NECTAR、多伦多大学化学工程系等机构提出TasteBench,汇集超过2.1万次人类评价,检验AI预测植物食品与目标食品的口味相似度。同组比较中,最佳模型准确率66.1
斯坦福大学计算机科学系、Food Intelligence Lab、NECTAR、多伦多大学化学工程系等机构提出TasteBench,汇集超过2.1万次人类评价,检验AI预测植物食品与目标食品的口味相似度。同组比较中,最佳模型准确率66.1
清华大学、加州大学洛杉矶分校、日本理化学研究所AIP与耶鲁大学等推出OSWorld-Science,把电脑Agent放进统计、生物医学、地理信息和工程仿真等真实科研软件。评测不只看是否点到按钮,而是检查交付文件、数值精度与完整工作流,揭示“
元环智能、北京大学与清华大学等机构联合用细胞自动机拆解世界模型:单格预测准确率可达96.3%,完整演化成功率却只有18.9%。研究把落差归结为空间局部性、时间局部性和时间稳定性,并用三处信息流修改将对应指标从39.1%、25.8%、42.2
今年6月,《福布斯》报道了硅谷AI圈的一门小众生意:几位高价伴游者既提供亲密陪伴,也能和客户聊AI、生物黑客、加密货币。曾在金融业工作的Meida Marek向记者报出每小时3500美元的价格;她说,近来不少客户来自英伟达。技术热潮里,有人
香港科技大学联合上海人工智能实验室、清华大学、南洋理工大学提出SciWalker,让AI按算子链自动出科学编程题,并用真实执行反馈筛选修复。他们造出8178道高质量题目,用GSPO训练后,Qwen3.5-9B在SciCode上的准确率从29
DP Technology、中国科学院理论物理研究所、北京大学、兰州大学等机构提出Large Knowledge Model(LKM),把论文拆成问题、推理步骤、结论与证据,再跨论文连成可检索地图。固定回答模型时,LKM检索将ChemBen
哈尔滨工业大学与阿里巴巴淘宝提出CompAdapt,让视频生成模型处理耦合运动、多阶段转换和多物体碰撞,并能用一个样例适应新的物理环境。目标不是只让单个物体移动得像,而是让连续事件彼此接得上。
用完的一次性电子烟,还能拿来架网站。开发者 Bogdan Ionescu 在开源项目 semihost-ip 中,把拆出的普冉微控制器变成了一台微型网页服务器:只有3KB内存,靠调试接口与电脑交换网络数据。代码和搭建方法都已公开,硬件爱好者
Practical Systems团队用一个可验证的LLM程序进化循环改写圆堆积求解器,在15轮内以27.72美元模型调用成本,改进Packomania中N=101至114范围的10项已知纪录。结果由零容差检查并被数据库接受,但只针对可变半
香港城市大学、苏黎世联邦理工学院提出KnowVis,把线性视频课程改排成概念图、知识单元和视觉摘要。团队整理10个学科的125段视频并生成1079份摘要,人体研究报告认知负担下降、学习与保持改善;样本规模有限,不能外推到所有课程和长期学习。
加州大学伯克利分校、直觉外科公司等机构联合提出MACAW,让达芬奇研究机器人用视觉伺服对准碎片,再以单目图像控制抓取深度。双臂设置在物理实验中达到92%成功率,平均7秒处理一个碎片、折合每小时473个;实验使用研究平台和仿真组织碎片,不能视
微软研究院、伊利诺伊大学厄巴纳-香槟分校提出StudentSim,用少量个人学习记录训练个性化学生模拟器。评测覆盖国际象棋、英语写作和数学三类任务、60名学生,论文称StudentSim在行为保真度和指导响应性上均超过GPT-5.4。
商家计划下周增加广告预算时,普通时间序列模型往往仍沿着历史销量往前画线。阿里巴巴、中国科学技术大学、香港科技大学(广州)提出CEDAR,直接学习“当前状态—商家行动—下一状态”的转换,再单独修正节日和热点带来的偏差。
不给AI智能体分配固定角色,也不让中央调度器指定下一步,只提供一个可检验的研究目标,它们会不会自己形成研究路线?来自DualverseAI、剑桥大学、香港大学、加州大学圣迭戈分校的研究团队共同提出并评测了开放世界多智能体环境Station。
手指被杯子、工具或另一只手挡住时,摄像头很容易丢点;依赖惯性或磁场的传感手套又会遇到漂移和干扰。Meta、西北大学提出一套光纤传感手套,用沿手指铺设的多芯形状传感光纤直接恢复三维曲线,再以60Hz重建完整手部姿态。
九名参与者听到句子后在键盘上输入,脑磁图设备连续记录大脑活动。Meta AI、巴黎高师、法国国家科学研究中心等机构据此训练Brain2Qwerty v2,在不植入电极的情况下解码自然句子,跨参与者平均词错误率达到39%。
给AI完整实验路线时,它能沿步骤执行;只给研究问题,让它自己决定方法,成绩迅速下滑。清华大学、麻省理工学院、哈佛大学、微软研究院等机构发布ASI-Bench,用60项项目级任务测试AI探索未知、选择方法并产出可验证结果的能力。
南京大学、蚂蚁集团和阿里巴巴达摩院联合提出BaguanHR,目标是训练0.1度全球高分辨率天气模型。论文报告,在72小时预报范围内,其合成加真实数据版本在超过85%的受测时段优于IFS-HRES;训练数据翻倍时,72小时预报RMSE下降4.
AI科研Agent可以一口气提出很多实验,但算力真正花在哪里,往往比想法数量更决定最终成绩。Meta FAIR、牛津大学、伦敦大学学院等团队提出Research Preference Models(RPM),专门比较候选研究动作并挑选更有希
把胸片、鸟鸣、显微图、3D结构和运动轨迹交给AI,它能否不靠人类先整理成表格,直接提出假设、运行分析并写成论文?牛津大学与新加坡国立大学提出OmniScientist,在5个学科的36组真实数据上完成从感知到论文的全流程,直接读取原始模态的