把一句话变成可编辑的 PPT(Banana Slides)
Banana Slides 是一个基于 nano banana pro 的原生 AI PPT 生成应用,用 TypeScript 与 Python 写成,输入一句话、大纲或素材文档即可生成整套幻灯片,并导出可编辑 PPTX 与讲解视频。这篇文章梳理它的能力边界、前置条件、关键参数与真实用户踩过的坑,帮读者判断它是否适合自己。
「明天汇报,PPT 还是一片空白」,这是几乎所有 AI PPT 工具都在回答的问题,给出的答案也大多相似:先挑一套模板,再把文字填进占位符。产出的观感接近,图文常常分成两层。Banana Slides 换了一条路,整页画面由 nano banana pro 这类图像模型按提示词直接渲染,风格与排版的控制权落在提示词、参考图和上传的素材上。
Banana Slides 是用 TypeScript 与 Python 写的原生 AI PPT 生成应用,输入一句话、大纲或素材文档,输出整套幻灯片,可导出为可编辑的 PPTX。
它有三种进入方式:打开在线 Demo 直接试,下载 Electron 桌面版安装包,或者本地用 Docker 部署。仓库在 Anionex/banana-slides,采用 AGPL-3.0 许可证,主要语言是 TypeScript(占 48.0%,Python 占 46.9%),当前 15678 Star、1786 Fork、开放 Issue 82 个,最新版本为 v0.9.0-rc.7。

它不做什么
它不自带模型额度。文本生成与生图都要接外部服务,密钥得自己去申请,仓库只提供 .env.example(5.4 KB)和配置入口。
Gemini 免费层级在 Issue 里被确认无法生成图片,只能出大纲,没有付费额度或第三方中转时,流程走不到最后一步。这一点直接决定了成本门槛。
页面本体是模型渲染出的图像,文字可编辑性依赖导出环节的还原,不是原始文本层。v0.3.0 之后对文字颜色、加粗、字号位置和表格文字做了还原优化,但仍属于有损还原。
桌面端在仓库里以 NSIS 安装包和 PowerShell 脚本的形式出现,说明有 Windows 打包产物;其它平台的支持情况,本篇引用的材料里没有说明。
用之前先准备好什么
- 一个模型供应商与对应密钥,可选路径包括 Gemini、OpenAI 兼容接口、火山引擎、APIMart,以及桌面版注册的 11 家 LazyLLM 在线供应商(qwen、doubao、deepseek、glm、kimi、minimax、sensenova、siliconflow、ppio、aiping、openai)。
- 或者走 OpenAI 官方 OAuth 绑定 Codex 账号,绑定后不必手填 API Key,官方说法是 plus 账号五小时可生成 100+ 张 2k 图。这条基于 OpenAI 官方 OAuth PKCE 授权流程。
- 要改造已有的 PPT,还需要 MinerU 凭据,配置不全时会报凭据错误。
- 本地部署需要能跑 Docker 的环境,仓库同时提供了 Docker 镜像构建文件与 Node、Python 的依赖清单(
package.json、pyproject.toml、uv.lock)。
主要功能
- 多入口起稿:一句话、大纲、页面描述都能生成幻灯片,也可以上传素材文档或图片,由系统先解析内容再出页。仓库里带
create-test-data.sh这类造测试数据的脚本。 - 逐页模板:支持单模板与多模板两种模式。可上传图片或 PDF 构建项目模板库,AI 自动解析模板的视觉特征并为每页智能匹配,也支持逐页手动绑定、补充文字模板,两种模式之间可以双向切换。
- 素材工具箱:在素材生成之外提供整图编辑、框选编辑(overlay / replace)与智能擦除三种模式,统一入口操作。打开图片编辑时默认进入框选状态。
- 对话式局部修改:可以口头指定区域要求改图,不用整页重出。
- 导出可编辑 PPTX:v0.3.0 起优化了文字颜色与加粗的还原、表格文字识别、字号与位置还原逻辑,并减少了导出背景图残留文字。背景想在导出后可编辑,可在「设置-导出选项-背景获取」里选择「生成式获取」。
- 在线幻灯片播放器:预览页提供沉浸式播放入口,支持应用内近似全屏与浏览器原生全屏,键盘、画面点击区域和控制按钮都能翻页,退出后主预览停留在最后播放页。
- 桌面端:Electron 加内置后端的桌面应用,启动后可检查更新但不会未经确认自动下载,可在设置里关闭启动检查或手动检查;更新卡片会显示版本号、本次更新摘要与完整更新日志链接,提供下载进度、失败重试和「重启并更新」。
- CLI 与 Agent Skills:2026-04-11 起支持命令行操作,并加入了 agent skills 能力。
- 风格描述:RC7 起可以在项目设置和预览中结合页面内容生成风格描述;自定义的文字风格描述模板可以命名、标色并持久化复用,不必每次重输。
讲解视频也是它的一条输出路径,仓库里有 TODO_video_narration_fixes.md 记录相关待修问题,RC2 修复过讲解视频的 FFprobe 路径错误。
安装与最短示例
最省事的方式是不安装:打开在线 Demo,地址是 bananaslides.online,注册可直接体验生成流程。
本地部署走 Docker,仓库提供了三份 Compose 文件(docker-compose.yml、docker-compose.prod.yml、docker-compose.allinone.yml)和 Dockerfile.allinone。具体启动命令在它 README 的「使用方法」章节和 docs.bananaslides.online 里,本篇引用的文档片段中没有给出,需要照着官方文档执行。
桌面版到 Releases 页下载安装包,当前候选版本为 v0.9.0-rc.7(2026-09-05),该版本把生图请求内部的主模型从 gpt-5.4 更新为 gpt-5.6-terra,实际图片生成仍用 gpt-image-2。
启动之后的最短路径是:在设置里选好 provider 并填密钥,回到首页输入一句话或一段大纲,确认页数与比例,点生成。
接第三方 OpenAI 兼容中转时,Issue 里有用户贴出过这样一份配置,字段命名以仓库的 .env.example 为准:
AI_PROVIDER_FORMAT=openai
OPENAI_API_KEY=sk-xxxx
OPENAI_API_BASE=http://10.0.1.6:8045/v1
TEXT_MODEL=gemini-2.5-flash
关键参数
TEXT_MODEL 与图片模型分开配置,项目默认的文本模型是 gemini 2.5 flash。走 Codex OAuth 时,图片模型不要填成文本模型,这是 RC7 专门修的 400 报错来源。
AI_PROVIDER_FORMAT 决定接口协议,填 openai 时配套用 OPENAI_API_KEY 与 OPENAI_API_BASE。供应商预设在桌面版里已经注册好,LazyLLM 那 11 家可以直接选。
分辨率支持 1K / 2K / 4K 三档传递。比例与额外字段在 2026-03 的更新中加入,用于控制页面尺寸与补充信息。
导出相关配置集中在「设置-导出选项」,其中「背景获取」可选生成式获取,代价是导出耗时更长。
结果在哪里看
- 前端预览页,生成完成后逐页展示,可以从预览页返回描述编辑页继续改。
- 在线幻灯片播放器,用于演示和快速翻页检查。
- 导出的可编辑 PPTX 文件,落到本地磁盘。
- 讲解视频文件,由独立流程生成。
- 桌面版的更新卡片,显示版本号与更新摘要。
实际使用中的坑
Codex 登录后仍连接失败。有用户把授权小网页地址栏里的链接贴回输入框,依旧提示连接失败,而本地 Codex CLI 用 GPT Plus 套餐正常。该 issue 已解决,评论 16 条;RC7 又修了一次「已连接但生图返回 400」的情况。
Gemini 免费层级生不出图。现象是大纲能生成、图片生成失败,导致整个 PPT 出不来。该 issue 已解决,评论 10 条,官方路径是换用有额度的 provider 或第三方中转。
配了第三方密钥后出现 CORS 跨域错误。前后端都正常运行的情况下仍报网络错误,该 issue 已解决,评论 14 条。
自定义风格模板还原度差。把学校要求的模板内容存成图片、拼接成一张再上传,生成结果与上传模板的差异比较大,而用项目自带模板时风格遵循效果很好。该 issue 已解决,评论 7 条。同一位提问者还问到默认的 gemini 2.5 flash 是否具备 nano banana 能力,这条也说明图像模型要单独确认。
横向对照
| 项目 | 适合谁 | 部署方式 | 主要限制 | 什么情况下选它更合适 | 项目地址 |
|---|---|---|---|---|---|
| banana-slides | 要成套设计感幻灯片、愿意自备模型密钥的职场人、教师与学生 | Docker Compose(三份 compose 文件 + Dockerfile.allinone)、Electron 桌面安装包、在线 Demo | 生图依赖 nano banana pro 这一类图像模型与外部密钥,Gemini 免费层级可能出不了图;页面本体是渲染图像,文字可编辑性靠导出还原 | 需要逐页模板、框选局部修改、可编辑 PPTX 与讲解视频这条完整链路时 | banana-slides |
| joymate/CozySlide | 想用一句话或大纲快速出一套幻灯片的个人 | 仓库没有说明 | 仓库信息有限,未逐一核实 | 只需要「输入想法出幻灯片」这一核心流程,不需要桌面端、模板库与视频导出时 | joymate/CozySlide |
| Gfddfgydddx/langchat-slides | 想找个轻量 AI slides 生成器试手的开发者 | 仓库没有说明 | 仓库信息有限,未逐一核实 | 只想验证一句提示词能生成什么效果的幻灯片、不在乎导出格式与模板控制时 | Gfddfgydddx/langchat-slides |
如果只是想把一段文字快速变成几张配图幻灯片,不打算折腾模型密钥、模板库和桌面端,CozySlide 这类只做核心生成流程的小项目上手更快;banana-slides 完整能力的代价是更长的部署链条,仓库体积 63428 KB,前后端加 Python 后端一起跑,而且要留意 AGPL-3.0 在闭源分发场景下的要求。
适合谁
适合要把商业提案、课程教案、作业 Pre 在几十分钟内做成成套视觉稿的人,尤其是对模板同质化不满、愿意自己维护一个 provider 密钥的用户。也适合想拿现成前端加后端架构做二次开发的开发者,仓库里 React 前端、Python 后端、CLI、桌面端和 skills 目录都分开了。不适合完全不想配置模型密钥、希望开箱即用且零成本的人,也不适合需要严格离线运行、或者做出来的幻灯片必须逐字精修排版的人。
焚评:这个项目的量化评分
本项目的选题来自 焚.com(一个按公开公式给 GitHub 项目打分的站)。焚评当前总分 9.4 分(满分 10)。下表是各维度的得分:
| 评分维度 | 得分 |
|---|---|
| 热度动量(权重 25%) | 10.0 / 10 |
| 开发活跃(权重 25%) | 8.0 / 10 |
| 社区响应(权重 15%) | 10.0 / 10 |
| 文档质量(权重 15%) | 10.0 / 10 |
| 发布节奏(权重 10%) | 8.8 / 10 |
| 风险控制(权重 10%) | 10.0 / 10 |
评分口径、权重与计算方式见焚.com 的评分方法页;数据随 GitHub 指标刷新,具体数值以焚.com 当前页面为准。本文正文为诀.com 独立撰写,评分数据由焚.com 授权引用。
内容核验说明
一份写明边界的选型参考:它如实交代不自带模型额度、页面本体是渲染图像、导出属有损还原,并把仓库 Issue 里踩过的坑逐条对上。适合愿意自备密钥、需要逐页模板与可编辑 PPTX 的教师、学生和提案制作者;只想零成本开箱即用的人应看更轻的项目。文中的 Star、Issue 数、版本与焚评评分来自公开披露,诀.com 未独立验证。
仓库 Star、Fork、开放 Issue 数、版本号、仓库体积与焚评评分均取自公开页面,诀.com 未独立验证;导出效果案例、使用案例 PDF 与配置片段由提交者在 Issue 中提供,本站未实测,结果不保证复现。用户反馈摘要
根据仓库 Issue 来看,反馈集中在模型接入:Codex 登录后连接失败、Gemini 免费层级能出大纲却生不出图、第三方中转报 503 与 CORS 跨域、图像生成返回 400,这些状态多为已解决;自定义风格模板还原度差也有一条报告。另有提交者希望增加本地 LLM 与本地图片模型支持,以及上传粗糙 PPT 自动翻新。持续更新的使用案例帖状态为待解决。默认文本模型是否具备 nano banana 能力,有提交者表示困惑。
基于该仓库公开 Issue 整理,只反映提交者报告的现象与诉求,不代表诀.com 立场,也不代表问题已被确认。项目来源与说明
开源项目:Anionex(Anionex)
本文由诀.com 编辑基于该项目的公开信息独立撰写,属原创解读,不是对项目文档的翻译或转载;文中提到的功能与参数以官方仓库为准,代码与文档版权归原作者所有。
查看项目仓库