ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Open Generative AI 深度拆解:535 个模型的自托管 AI 图像视频生成工作室,本地推理双引擎

Open Generative AI 深度拆解:535 个模型的自托管 AI 图像视频生成工作室,本地推理双引擎 Open Generative AI 深度拆解535 个模型的自托管 AI 图像视频生成工作室本地推理双引擎【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image video generation studio with 600 models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AIOpen Generative AI是一个 MIT 协议的开源生成式工作室聚合 Flux、Midjourney、Kling、Sora、Veo 等535 个模型packages/studio/src/models.js中 8 个模型数组的实际统计值提供16 个 Studio页签覆盖文生图、图生视频、唇形同步、工作流编排不做内容过滤可自托管桌面版内置sd.cpp Wan2GP 两套本地推理引擎。它解决什么问题商业生成平台的套路是固定的月度订阅README 里列的对照区间从每月约 $8 到 $120 不等、提示词进过滤层不合规的直接拦截或改写、模型闭源不可替换。对三类需求这套模式天然不满足不想被审查的创作场景——项目把无过滤器、不拒绝提示词写进了产品定位README 原话是 no content filters, no prompt rejections, no guardrails想在局域网里跑通模型聚合的团队——400 模型统一走一个网关 API前端只是一层可改写的 React 壳数据不出自己机器既想免费又想可白牌——MIT 协议意味着可以直接改 UI、加模型、做成自己产品卖。它的取舍很明确模型推理本身不做只做聚合 界面 可选本地引擎。云端模型全部经由 Muapi.ai 网关调用本地推理只支持两个受限集合sd.cpp 的 6 个图像模型 Wan2GP 的 6 个远端模型而不是声称能本地跑所有模型。源码跑起来三条命令起步前置Node.js v18以及一个 Muapi.ai access key只填 key 值不是 key 名称只用本地模型可不填。注意绝大多数用户直接下载桌面安装包即可下面的源码路径面向贡献者。# 必须带子模块workflow / agents 等 4 个 workspace 包依赖它们 git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI cd Open-Generative-AI # 拉子模块 npm install 构建 4 个 workspace 包studio、workflow、agents、design-agent # 只跑 npm install 是起不来的 npm run setup # 二选一 npm run electron:dev # 桌面版Vite 构建后 Electron 启动推荐 npm run dev # Web 版Next.js→ http://localhost:3000package.json里setup脚本的展开就是git submodule update --init --recursive npm install npm run build:packages——build:packages会依次构建workflow-builder、ai-agent、design-agent、studio四个子包。常见报错排查# 报错 Couldnt find a pages directory # 1) 确认当前目录是仓库根能同时看到 app/、package.json、next.config.mjs # 2) 确认克隆时带了 --recurse-submodules若 packages/Vibe-Workflow 为空重跑 npm run setup打桌面安装包npm run electron:buildmacOS DMGx64arm64、npm run electron:build:winNSISx64、npm run electron:build:linuxAppImage DEBx64产物落在release/。三个平台都没做签名/公证macOS 首次启动要xattr -cr /Applications/Open Generative AI.app再右键 OpenWindows 在 SmartScreen 里点 Run anywayUbuntu 24.04 用 AppImage 会撞上 AppArmor 的apparmor_restrict_unprivileged_unprivileged_userns限制官方建议直接装.deb自带 AppArmor profile临时方案是sudo sysctl -w kernel.apparmor_restrict_unprivileged_userns0。能力全景按用户能做什么分组导航定义在components/StandaloneShell.js的TABS与NAVIGATION_CATEGORIES两个数组里16 个 Studio归入 4 个导航分类。按用户目标归类如下用户目标对应 Studio关键能力出图Image / Layers / Cinema / Design Agent / AI Influencert2i78个、i2i76个模型models.js实测双模式自动切换多图输入最多14张参考图出视频Video / AI Clipping / Motion Control / Vibe Motion / Lip Sync / Body Swap / Marketingt2v105个、i2v173个、v2v67个模型长视频自动剪辑、主体换装出音频Audio Studio18个音频/音乐模型文本生成与编辑编排Workflow / Agent / Design Agent / Apps节点式流水线、多轮对话代理、画布设计代理、应用模板目录值得展开的四点其余Layers、Marketing、AI Influencer 等机制相同不赘述双模式自动切换。Image/Video Studio 不看模式按钮看输入没传参考图就是 t2i/t2v 集合提示词必填传了图就切到 i2i/i2v 集合提示词可选。选择器里同时暴露getMaxImagesForI2IModel()这类函数按模型能力动态渲染宽高比/分辨率/时长选项Smart Controls。多图输入。选中支持多参考图的模型后上传入口变多选带顺序编号的复选框图片按你勾选的顺序发给模型、批量上传、Use Selected 确认。上限因模型而异Nano Banana 2 Edit 14 张、Flux Kontext Dev 10 张、GPT-4o Edit 10 张、Wan 2.5/2.6 Edit 2–3 张。Lip Sync。两种输入模式共 9 个专用模型人像图音频Infinite Talk、Wan 2.2 Speech to Video、LTX 2.3 / LTX 2 19B Lipsync480p–1080p视频音频Sync、LatentSync、Creatify、Veed、Infinite Talk V2V。生成历史单独存在lipsync_history刷新页面后挂起任务自动恢复。Cinema Studio 的虚拟相机。6 种机身、11 种镜头、7 档焦距8mm–85mm、3 档光圈f/1.4 / f/4 / f/11——选择会被翻译成提示词修饰符而不是相机仿真参数本质是一套结构化的 prompt 模板。贯穿全局的还有上传历史本地持久化localStorage跨会话复用、生成历史可浏览可重下、全局通知sessionStorageTTL12 秒最多挂 3 条。往深里看两个有工程含量的细节Wan2GP 端点名重映射和会改名的远端服务器打交道桌面版的本地推理分两套配置入口都在Settings → Local Models引擎形态覆盖sd.cpp内置stable-diffusion.cpp 的 C 引擎与 App 同机运行Apple Silicon 走 MetalLinux/Windows 走 CUDA/Vulkan/ROCm6 个图像模型Z-Image Turbo2.5 GB 2.7 GB 辅助、Z-Image Base3.5 2.7、Dreamshaper 8 / Realistic Vision / Anything v5各 2.1 GB、SDXL Base6.9 GBWan2GPBYO 服务器纯 HTTP 客户端指向你自己跑的 Gradio 服务器CUDA/ROCm 机Flux.1 Dev、Qwen Image Wan 2.2 / Hunyuan / LTX 视频Wan2GP 的 Python 运行时Sage attention、flash-attn、AWQ/GGUF 内核只支持 CUDA没有 Apple Silicon 路径所以桌面端只发提示词收结果。真正有意思的是electron/lib/wan2gpProvider.js的WAN2GP_CATALOG每个条目除了fn首选 Gradioapi_name还带fnAliases新旧变体名单和family族名兜底因为 Wan2GP 不同版本之间会重命名 Gradio 端点Pinokio 打包版甚至会整个丢掉某些端点。连接时客户端拉服务器/info把目录里每个条目的fn重映射成服务器实际注册的函数名别名匹配失败再退到family模糊匹配。配置持久化在应用数据目录的local-ai/wan2gp.json。sd.cpp 侧的健康检查可以绕过 UI 直接验证应用调用的就是同一个sd-cli二进制APP_DATA${OPEN_GENERATIVE_AI_LOCAL_AI_DIR:-$HOME/Library/Application Support/open-generative-ai/local-ai} # 直接跑一次 512x512 / 12 步推理 DYLD_LIBRARY_PATH$APP_DATA/bin $APP_DATA/bin/sd-cli \ -m $APP_DATA/models/DreamShaper_8_pruned.safetensors \ -p a serene mountain lake at sunrise, oil painting \ -o /tmp/sd15-test.png \ --steps 12 -H 512 -W 512 --cfg-scale 7.5 --seed 42 --sampling-method euler_a # Metal 正常打印 VRAM 1969.78MB若 VRAM 为 0.00MB 说明 dylib 回退 CPU # 可用 otool -L $APP_DATA/bin/libstable-diffusion.dylib | grep -i metal 检查硬件红线写得很直白Z-Image 建议16 GB内存7.4 GB 权重 2.4 GB 计算缓冲8 GB 的 M 系 Mac 上已知会挂起系统应改用 SD 1.5M2 上 Metal 生效约1–2 秒/步实测 ~10 秒/步即回退 CPU。多 GB 权重想放别的盘启动前设OPEN_GENERATIVE_AI_LOCAL_AI_DIR应用会在其中建bin/、models/、tmp/三个子目录。BYOK 密钥的选择性注入与代理脱头应用与网关是两步式协议POST /api/v1/{model-endpoint}提交任务再GET /api/v1/predictions/{request_id}/result轮询到completed文件走POST /api/v1/upload_filemultipart返回托管 URL 给条件模型。认证头是x-api-key。密钥管理在StandaloneShell.jskey 存localStoragemuapi_key同时写一份365 天有效期、SameSiteLax的 cookie 供后台请求建立身份。关键在请求拦截器——它不往 axios 全局默认头里塞 key而是逐请求判断URL 是相对路径或命中/api/app、/api/workflow、/api/agents、/api/api、/api/v1这几个内部代理前缀才注入x-api-key避免 key 泄漏给 S3 这类外部域名。余额每30 秒轮询一次getUserBalance。自托管时 Next.js 路由app/api/api/v1/[[...path]]/route.js把/api/api/v1/*原样代理到https://api.muapi.ai/api/v1/*cleanHeaders()剥掉host/connection/cookie三个头再转发注释里标着 Cookie-based auth removed for security (CWE-522)——即服务端只认 header key不认 cookie。这是研究Next.js 里怎么安全代理第三方 API的一个干净样本。拆开看monorepo 结构与二开入口仓库是 Next.js npm workspaces 的 monorepopackage.jsonv2.0.0MIT声明 4 个 workspaceOpen-Generative-AI/ ├── app/ # Next.js App Routernext ^15.0.0 / react ^19 │ ├── page.js # 根路由重定向 → /studio │ ├── studio/[[...slug]]/ # 渲染 StandaloneShellslug 决定激活 Tab │ └── api/ # 各代理路由/api/api/v1、/api/app、/api/workflow、/api/agents… ├── components/ │ ├── StandaloneShell.js # 16 Tab 导航 BYOK 通知 拖拽上传 │ └── ApiKeyModal.js # key 输入弹窗 ├── packages/ │ ├── studio/src/ # 共享组件库models.js535 个模型定义 各 Studio.jsx muapi.js │ ├── Vibe-Workflow/ # workflow-builder 子包Workflow Studio 引擎 │ ├── Open-Poe-AI/ # agents 子包Agent Studio │ └── Open-AI-Design-Agent/ # design-agent 子包 ├── electron/ # 桌面壳 lib/localInference*、modelCatalog、wan2gpProvider └── afterPack.js / scripts/ # 打包后处理与 Linux deb 构建脚本扩展模型的唯一入口是packages/studio/src/models.js往对应数组t2iModels、i2vModels…加一个{ id, name, endpoint, inputs: {...} }条目——inputs就是该模型支持的参数 schemaprompt、aspect_ratio枚举、时长、分辨率等前端 Smart Controls 直接按 schema 渲染。README 提到这份目录同时被 muapi.ai 托管版消费改一处两端生效。Studio 组件库以studio: *依赖进根项目构建由npm run build:packages串起桌面版则由vite build electron-builder出包。部署与选型方式启动命令本地推理适用桌面安装包DMG / NSIS / AppImage / DEB直接运行sd.cpp Wan2GP终端用户无需 Node源码桌面开发npm run electron:dev同上改 UI / 加引擎源码 Web 版npm run dev:3000无仅云 API调试前端与代理路由Web 生产npm run build npm run start无自托管给团队用容器仓库根Dockerfiledocker-compose.yml无常驻服务选型的实质是要不要本地推理决定用桌面版还是 Web 版要不要动模型/界面决定要不要拉源码。Web 版含 Docker永远只走云端 API这是README里明确的边界。收束Open Generative AI 把模型聚合、创作界面、本地推理三层解耦中间层packages/studio是可独立复用的组件库下层网关可换上层 Electron 壳自带 sd.cpp/Wan2GP 逃生通道。它适合两类人想白牌一个多模型生成工作室的开发者以及想研究Electron 应用如何接入异构本地推理引擎、Next.js 如何安全代理第三方 API的工程师。【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image video generation studio with 600 models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表