Banana Slides 拆解:当 PPT 生成跳过模板,直接调用模型能力
Banana Slides 在 GitHub 上拿了 15k Stars,AGPL-3.0 开源。它基于 Google 的 nano banana pro 🍌 模型,做的是一个 AI 原生的 PPT 生成应用。
但值得看的不是它生成了多好看的 PPT——nano banana pro 本身已经能生成不错的页面。真正有意思的是它的产品方向:一个 AI 原生的、不依赖预设模板的 PPT 创作工具,用模型的视觉理解能力替代了传统模板系统。
传统 AI PPT 工具的结构问题
市面上多数 AI PPT 工具的工作方式差不多:用户输入主题,AI 生成大纲,然后从预设模板库里选一套模板套上去。Gamma、讯飞智文、Beautiful.ai 基本都是这个路径。
这个模式有两个结构性问题。
第一,模板是静态的,内容是动态的。 你选的模板再好,内容一多一少、结构一调整,排版就崩。结果是用户花大量时间手动调整模板套不上的页面。
第二,修改成本高。 想让 AI 改某一页的布局,它往往把整组样式改乱。最后用户放弃 AI 修改,自己拖 PPT 元素。
Banana Slides 的作者把这归为五个点:只能选预设模板、自由度低、同质化严重、素材质量差、图文排版割裂。核心矛盾是一样的——传统 AI PPT 工具的瓶颈不在 AI 能力,在模板架构。
key design 1:用模型视觉理解替代模板系统
Banana Slides 的做法和同类工具不一样:它不做自己的模板系统。页面布局、配色、图文搭配这些,全交给 nano banana pro 生成。
这意味着几个变化。
每页都是独立的。 没有「这套模板的第 3 页有什么元素」的概念。每一页由模型根据当前内容、配图和风格参考即时生成。你一页页翻过去,不会感到用的是同一张模板。
风格通过参考图传达。 用户上传一张参考图片或模板,模型从中提取视觉风格,而不是从库中选一个编号模板。多图联合参考也支持——模板图和素材图一起传入模型。
局部修改不依赖模板 API。 框选不满意的区域,口头描述修改(「把这张图换成饼图」「改成左右结构」)。模型直接重绘这一块,不影响其他区域。
这个设计的关键前提是:nano banana pro 的视觉生成和指令理解能力足够好,不需要模板来托底。 回头来看,这恰好是之前很多 AI PPT 项目没有做成的事——不是不想,是底层模型做不到。
key design 2:Vibe 编辑——把 PPT 操作变成对话
「Vibe PPT」这个词借用了 vibe coding 的概念:像聊天一样生成和修改 PPT。
它体现在几个层面。
一句话生成。 输入标题,AI 自动展开大纲和逐页描述。如果结果不满意,口头调整大纲再批量生成。
正文编辑和局部重绘分开处理。 文本修改走文本模型,图片布局走 nano banana pro 重绘。不混在一起让一个模型包办,降低了单次失败的连带影响。
质量控制过滤器。 生成结果出来后,系统自动检查乱码、低质量输出、提示词偏离。没通过就重新生成,不进入保存流程。这个机制保证了用户看到的是至少「及格」的结果,不会出现文字缺失或排版跑飞的中间态。
key design 3:可编辑 PPTX 导出——从图像回到文档
AI 生成的 PPT 页面本质上是图片。导出成 PPTX 后往往就是一张张截图,文字不可编辑,失去文档属性。
Banana Slides 在 RC 阶段做了一个「可编辑 PPTX(Beta)」模式。导出后文字是文字、图片是图片、背景独立。用户可以在 PowerPoint 或 WPS 里直接改字、调位置、换图。
实现方式参考了 MinerU 等文档解析方案——把图像逆向解析成结构化元素。Beta 阶段还不完美,但这个方向是对的:AI 生成的 PPT 应该是起点,不是终点。
对比同类:notebooklm 的 PPTX 导出不可编辑;Gamma 的免费版有水印,付费版才解锁导出;讯飞智文同样有水印限制。
与同类对比的工程视角
| 维度 | Banana Slides | notebooklm | Gamma |
|---|---|---|---|
| 页数上限 | 无限制 | 15 页 | 有限 |
| 二次编辑方式 | 框选+口头编辑 | 提示词修改 | 提示词修改 |
| 导出格式 | PPTX(可编辑)/PDF/视频 | PDF、不可编辑PPTX | PPTX/PDF |
| 水印 | 无 | 免费版有 | 付费版 |
| 开源 | AGPL-3.0 | ❌ | ❌ |
| 自托管 | Docker | ❌ | ❌ |
从工程角度看,Banana Slides 把每个关键节点都做了开源选择。页数不限、无水印、可自托管,这三条放在一起,就意味着它不靠限制功能来变现,而是靠提供更完整的能力来竞争。
部署方式与依赖
Docker Compose 一键部署是推荐路径:
git clone https://github.com/Anionex/banana-slides.git
cd banana-slides
cp .env.example .env
# 配置 API Key
docker compose up -d
前端 localhost:3011,后端 localhost:5011。
核心依赖是 nano banana pro API(Gemini 格式),也支持 OpenAI、火山方舟、DeepSeek、豆包等厂商——这意味着国内用户也可以通过兼容 API 使用,不一定需要直连 Gemini。
桌面版(RC2)已发布,支持 Windows/macOS/Linux,设置里可直接保存 API 配置,不需要自己维护 .env 文件。
额外依赖: FFmpeg(带 libass 支持),导出讲解视频时需要。
适用场景与边界
适合:
- 需要快速产生高质量 PPT 的学生、教师、职场人士
- 有自托管需求的技术团队
- 想通过开源项目研究 AI PPT 技术实现的人
不适合:
- 不能接受自备 API Key 的用户(需要自己的 Gemini 或兼容 API)
- 对输出稳定性要求极高的正式场合(RC 阶段,偶有问题)
- 需要彻底精细排版控制的设计师(AI 生成的 PPT 需要人工二次调整)
可以带走什么
Banana Slides 提供的启发不限于 PPT 生成:
当底层模型能力足够时,传统模板层可以被移除。 这不是每个场景都能复用的判断——等模型的视觉理解能力赶上 nano banana pro 的水平再说。但方向是清晰的:如果某个垂直场景一直被「预设模板」限制,值得重新评估现在能不能做原生生成。
开源可以成为垂直 AI 工具的差异化壁垒。 页数不限、无水印、可自托管——这些在商业产品中通常被作为付费功能,在开源项目中成为默认配置。对于技术用户,这比任何营销都直接。
可编辑输出是 AI 工具的验收标准之一。 如果 AI 的产出进了编辑软件就变成死图片,那就只完成了半个功能。真正可编辑的输出才谈得上工程闭环。