返回博客

从冰箱照片到晚餐:图片生成菜谱的 AI 是怎么工作的

从拍下冰箱到收到完整菜单之间发生了什么——食材识别、结构化生成,以及这件事为什么近两年才真正变得可用。

2026年8月25日PanSnap 团队PanSnap 团队
从冰箱照片到晚餐:图片生成菜谱的 AI 是怎么工作的

用手机对准打开的冰箱,点一下,然后收到一份带配图的完整晚餐菜单。两年前这是发布会上的演示花活,今天它是每晚可依赖的工具。这大约一分钟里到底发生了什么?为什么它现在才变好?

第一步:看懂冰箱

现代多模态模型(比如 Gemini)不再像旧式计算机视觉那样「打标签」,而是读场景:玻璃盒里的剩米饭、门架上的两个鸡蛋、包着保鲜膜的半个彩椒。关键是它们还能读懂上下文——分量、新鲜度,以及你忘了的那瓶没开封的豆瓣酱。

早期的拍照识菜 App 到这一步就停了,拿着标签去菜谱数据库里做匹配。结果像拉老虎机——因为数据库只能返回它本来就有的东西。

第二步:设计,而不是搜索

真正的解锁点,是把识别出的食材当作给大语言模型的设计需求书,并施加结构化输出约束。模型被问的不再是「找含鸡蛋的菜谱」,而是:用恰好这些食材,为 N 个人组合一套协调的晚餐菜单,遵守这些偏好,以严格 JSON 返回。

结构化生成比听上去重要得多。没有 Schema 约束时模型会自由发挥;有了约束,你得到的是可靠字段——菜名、描述、每道菜的食材清单、编号步骤,甚至包括稍后用来生成美食摄影图的提示词。

第三步:绘制菜谱书

然后每道菜通过图像模型(我们使用 APIMart 的 GPT Image 2)获得配图,提示词要求保持一致的杂志级美食摄影风格——同一道菜在各个步骤里的摆盘保持统一。

为什么是现在(而不是 2023 年)

三条技术曲线刚好交汇:

  1. 多模态识别对杂乱的真实冰箱隔层足够准确了——而不是影棚照片;
  2. 结构化输出(JSON Schema)把大模型从健谈的写手变成了可靠的流水线部件;
  3. 图像生成在消费级成本下达到了美食摄影质量。

PanSnap 把这三个阶段缝合成一个流程:照片 → 分析 → 你看着图片逐张绘出 → 可导出分享的分页菜谱书。那个曾经让你对着冰箱站四十分钟的决定,现在只需要一分钟的点按。

冰箱里从来都不缺晚餐灵感,只是缺一个认真看它一眼的东西。