压缩烹饪世界:寻求通用食材原语
A 最近的研究论文在技术和烹饪界引发了激烈辩论,声称已将“人类所有的烹饪”压缩到了仅 2 MB。虽然标题具有挑衅性——且被广泛批评为标题党——但其背后的工作揭示了一次引人入胜的尝试,即为全球食材及其关系创建标准化的数学表示。
由总部位于伦敦、专注于自动化餐厅的初创公司 Kaikaku 发布,该项目旨在将全球食谱的巨大复杂性提炼为一组可管理的“原语”(primitives)。通过分析多种语言和来源的数据,研究人员旨在为自动化烹饪和风味搭配建立基础。
核心概念:食材原语
该研究的核心是努力实现食材的归一化。在食谱的世界里,同一种物品根据地区或语言的不同,可能会有几十种不同的名称(例如,“scallion”与“green onion”与“long onion”)。研究人员使用 LLMs,特别是 Claude,在低温度解码(low-temperature decoding)下进行食材分类,将这些变体映射到一组约 1,800 个原语中。
正如一位观察者所指出的,该项目与其说是关于烹饪的过程,不如说是关于烹饪的库存:
"A better title would be: 'all of human ingredients compressed into 1,800 primitives.' There is little to substantively nothing about the actual cooking: preparation methods, proportions, etc."
在实践中测试模型
该系统的实际演示(例如 Epicure demo)表明,该模型对烹饪技术拥有惊人的“潜在知识”。例如,当用户选择“rice”时,系统能够建议特定的准备方法——例如为了做炒饭而冷藏 jasmine rice,或者为了做 pilaf 而浸泡 basmati。它还可以智能地将肉类部位(如 shoulder 或 shank)与通常用于炖煮的蔬菜进行搭配。
然而,该系统并非没有缺陷。用户报告了其词汇量中的空白,例如缺乏对 grapeseed oil 的意识,或者对像 Peter Gilmore 这样的先锋厨师使用的某些高度专业化的食材的认知不足。还存在语言差异;例如,系统可能会识别“pumpkin seeds”但将“pumpkin”归类为“squash”,反映了对美式英语术语的偏好。
批评与局限性
来自社区最显著的反驳集中在数据的范围上。“所有人类的烹饪”这一说法在考虑到来源材料时,从数学和文化上都是不可能的:
- 有限的来源: 数据提取自 11 个来源,涵盖七种语言(包括 English, Chinese, Russian, Vietnamese, Spanish, Turkish, Indonesian, German, 和 Indian-English)。
- 文化空白: 批评者指出,意大利和法国食谱——世界上最具影响力的两种烹饪传统——的明显缺失,以及非洲食材的代表性不足。
- “人类”因素: 有些人认为,烹饪是一种直觉性的、触觉性的艺术,无法被压缩进一个数据文件。正如一位评论者所说,制作 lentil soup 通常不需要书面描述或正式数据,而是需要熟练的手感和文化直觉。
技术影响
尽管标题存在争议,但创建食材归一化流水线(pipeline)的技术目标是非常有价值的。对于从事 food-tech 或自动化烹饪的开发者来说,拥有一个将不同的食谱数据库映射到单一原语系统的标准化方法,是至关重要的第一步。
数据中还有一个有趣的地理成分。食材关系的可视化图表显示了一种镜像反映世界地理的映射关系,这意味着模型中食材之间的“距离”通常与使用它们的文化之间的物理距离相关。
结论
虽然 2 MB 的文件可能并不包含人类烹饪的“灵魂”或全球美食知识的全貌,但它代表了向构建结构化的、数字化的风味分类学迈出了重要一步。通过减少语言变体的噪声并识别世界厨房的核心原语,该项目为那些寻求自动化或分析味觉科学的人提供了一个有用的框架。