ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

GPT4All Node.js 绑定实践:本地 LLM 推理、流式输出与原生构建完整指南

GPT4All Node.js 绑定实践:本地 LLM 推理、流式输出与原生构建完整指南 GPT4All Node.js 绑定实践本地 LLM 推理、流式输出与原生构建完整指南【免费下载链接】gpt4allGPT4All: Run Local LLMs on Any Device. Open-source and available for commercial use.项目地址: https://gitcode.com/GitHub_Trending/gp/gpt4allGPT4All 的 Node.js 绑定npm 包名gpt4all让你在不经过任何 API 服务的情况下直接在 Node.js 应用中加载 GGUF 本地大模型完成对话补全、文本向量化、流式 token 输出等任务。本文以仓库中 gpt4all_nodejs.md 这份 Node.js API 文档为主体结合 gpt4all-bindings/typescript 目录下的实际源码完整讲解其安装方式、核心 API 用法、参数含义、原生构建流程以及常见问题的排查思路帮助你把本地 LLM 能力真正落地到 Node 应用里。安装与运行环境安装非常简单任意主流包管理器均可yarn add gpt4alllatest npm install gpt4alllatest pnpm install gpt4alllatest文档给出的运行时要求与 package.json 中engines: node 18.x.x一致gitNode.js 18.0.0yarnnode-gyp 及其全部依赖包内以node-gyp-build作为安装钩子node-gyp 9.x声明为 optionalDependenciesUnixgcc 12WindowsMSVC 143可通过 Visual Studio 2022 构建工具获得Python 3Windows 和 Linux 上构建 GPT4All 需要完整的 Vulkan SDKmacOS 不需要因为使用 Metal需要说明的是该文档位于仓库docs/old/目录属于历史版本文档。当前仓库的 TypeScript 绑定已经演进到 package.json 中标注的 4.0.0 版本部分 API 细节如补全返回结构、token 回调命名与旧文档存在差异本文在讲解时会以当前源码为准并标注这些差异。快速上手四类核心用法1. Chat Completion对话补全loadModel是创建模型的“事实标准入口”createCompletion则等价于 Python 绑定的chat_completion。旧文档中的示例import { loadModel, createCompletion } from gpt4all const model await loadModel(mistral-7b-openorca.gguf2.Q4_0.gguf, { verbose: true, device: gpu }) const completion1 await createCompletion(model, What is 1 1?, { verbose: true }) console.log(completion1.message) const completion2 await createCompletion(model, And if we add two?, { verbose: true }) console.log(completion2.message) model.dispose()对照当前实现 src/gpt4all.js#L131-L164createCompletion的返回结构是{ model: provider.modelName, usage: { prompt_tokens: result.tokensIngested, total_tokens: result.tokensIngested result.tokensGenerated, completion_tokens: result.tokensGenerated, n_past_tokens: result.nPast, }, choices: [ { message: { role: assistant, content: result.text }, }, ], }也就是说当前版本读取回复内容应使用completion.choices[0].message.content旧文档中的completion.message是早期结构。usage字段中的n_past_tokens记录了会话已消耗的上下文 token 数可用于跨请求维持上下文。loadModel内部的默认参数在 src/gpt4all.js#L33-L44 中定义modelPath默认~/.cache/gpt4all、allowDownload: true本地没有时自动下载、device: cpu、nCtx: 2048、ngl: 100。2. Embedding文本向量化加载嵌入模型时需要传type: embeddingimport { loadModel, createEmbedding } from gpt4all const embedder await loadModel(all-MiniLM-L6-v2-f16.gguf, { verbose: true, type: embedding }) console.log(createEmbedding(embedder, Maybe Minecraft was the friends we made along the way))当前实现 src/gpt4all.js#L87-L124 中createEmbedding(model, text, options)还支持第三组选项dimensionality期望的向量维度必须是正整数低于模型建议的最小值EmbeddingModel.MIN_DIMENSIONALITY当前为 64见 src/models.js#L144-L160时会打印性能警告longTextModemean默认对分段向量取均值或truncateatlas布尔值附加向量增强选项。返回值为Float32Array。3. Chat Sessions有状态会话无状态的createCompletion每次都是独立请求如果需要多轮对话保持上下文应使用聊天会话import { loadModel, createCompletion } from gpt4all const model await loadModel(orca-mini-3b-gguf2-q4_0.gguf, { verbose: true, device: gpu, }); const chat await model.createChatSession(); await createCompletion( chat, Why are bananas rather blue than bread at night sometimes?, { verbose: true } ); await createCompletion(chat, Are you sure?, { verbose: true })从源码看src/chat-session.js会话的实现机制值得理解createChatSession(options)会先initialize()若有systemPrompt则以promptTemplate: %1、nPredict: 0、special: true的方式把系统提示词单独喂入模型即“只吃上下文、不生成”再依次摄入初始messages模型对象上只有一个activeChatSessionChatSession.generate()开头会检查当前会话是否为激活会话否则抛出Chat session is not active...错误——这是文档中InferenceModel.createChatSession章节所述行为每次生成结束后promptContext.nPast会更新为本次推理返回的nPast后续请求自动携带此前全部上下文user/assistant消息也会追加到session.messages数组中如果一次传入消息数组末尾的user消息会被当作本轮 prompt其余消息以fakeReply方式摄入历史src/chat-session.js#L110-L144。ChatSessionOptions支持systemPrompt初始化时摄入的系统提示与messages初始消息数组role取system | assistant | user并可继承LLModelPromptContext中的采样参数。4. 流式响应与异步生成器三种消费 token 的方式对应三个 APIcreateCompletionStreamNode Stream、createCompletionGeneratorAsync Generator以及直接在 options 里传onResponseToken回调。import gpt from gpt4all const model await gpt.loadModel(mistral-7b-openorca.gguf2.Q4_0.gguf, { device: gpu, }) process.stdout.write(### Stream:) const stream gpt.createCompletionStream(model, How are you?) stream.tokens.on(data, (data) { process.stdout.write(data) }) // 必须等待流结束才能继续 await stream.result process.stdout.write(\n) process.stdout.write(### Stream with pipe:) const stream2 gpt.createCompletionStream( model, Please say something nice about node streams. ) stream2.tokens.pipe(process.stdout) await stream2.result process.stdout.write(\n) console.log(done) model.dispose()process.stdout.write(### Generator:) const gen gpt.createCompletionGenerator(model, Redstone in Minecraft is Turing Complete. (let it in!)) for await (const chunk of gen) { process.stdout.write(chunk) } process.stdout.write(\n) model.dispose()实现上createCompletionStream内部就是包了一个Stream.PassThrough每个 token 通过onResponseToken回调推入流中最终await stream.result拿到完整结果src/gpt4all.js#L166-L193createCompletionGenerator则是直接消费该流重新 yield 的薄封装。仓库中 spec/streaming.mjs 提供了完整的可运行示例额外演示了通过onResponseToken回调逐 token 打印、以及用nPast: stream2Res.usage.n_past_tokens把多次生成串联为一段连续上下文——这是跨调用维持上下文的关键技巧。参数体系LoadModelOptions 与 LLModelPromptContextloadModel 的选项loadModel(modelName, options)默认在给定路径找不到模型时会从官方模型清单当前默认清单 URL 见 src/config.js#L30解析并自动下载allowDownload: false可关闭该行为。选项类型说明modelPathstring模型文件查找位置默认~/.cache/gpt4allDEFAULT_DIRECTORYlibrariesPathstring后端动态库查找路径多个路径用分号;分隔modelConfigFilestring模型配置文件路径适合离线使用或自定义模型配置allowDownloadboolean本地不存在时是否允许自动下载默认trueverboseboolean打开详细日志devicestringcpu/gpu不限厂商的最佳 GPU/amd/nvidia/intel指定厂商/ 具体 GPU 名称。若所选 GPU 显存不足将抛出错误并使实例失效建议初始化前确认显存nCtxnumber上下文窗口上限默认2048nglnumber放入 GPU 的层数默认100typestringinference默认或embedding决定返回InferenceModel还是EmbeddingModel后端库的默认搜索顺序在 src/config.js#L6-L23~/.cache/gpt4all/libraries→./libraries→ 包内runtimes/{platform}-{arch}/native→runtimes/{platform}/native→ 当前工作目录。loadModel会先过滤掉不存在的目录再传给原生层src/gpt4all.js#L57-L60。采样参数LLModelPromptContextcreateCompletion的 options 可继承全部LLModelPromptContext字段当前默认值定义在 src/config.js#L32-L40DEFAULT_PROMPT_CONTEXT { temp: 0.1, topK: 40, topP: 0.9, minP: 0.0, repeatPenalty: 1.18, repeatLastN: 10, nBatch: 100, }各参数含义与调参建议继承自文档的 API ReferencenPast已使用的上下文 token 数控制模型“回看”多远nPredict最多生成的 token 数promptTemplateuser/assistant 消息对的模板%1必填用户输入%2可选助手回复topK只在概率最高的 K 个 token 中采样。值越大如 100输出越多样值越小如 10越保守多数任务 30–60 是较好的区间topP核采样阈值如 0.95 更发散0.1 更聚焦minP候选 token 的最小概率temperature0 时完全确定性输出0.5 偏保守1.2 偏发散文档建议的安全区间为 0.6–0.85nBatchprompt 分批处理大小。按每 N 个 token 切分 prompt 可降低峰值内存但 N 过小如 10会使 500 token 的长 prompt 需要多次处理、拖慢速度设大如 2048可一次处理完repeatPenalty重复惩罚系数1 表示无惩罚大于 1 会抑制重复 tokenrepeatLastN惩罚检查时回看的历史 token 数contextErase上下文窗口超限时擦除的上下文比例。注意LLModelPromptContext中的nCtx字段已废弃旧文档明确标注 THIS IS DEPRECATED上下文大小请用loadModel的nCtx选项设置。另外InferenceModel.generate中temp与temperature两个字段名都会回落到默认值src/models.js#L24-L33。LLModel 底层能力loadModel返回对象内部持有原生LLModel通过node-gyp-build加载可直接访问其属性与方法name()、type()、stateSize()、threadCount()/setThreadCount(n)默认线程数为物理核心数、infer(prompt, promptContext, callback)最底层的原始推理、embed(text, ...)、isModelLoaded()、setLibraryPath()/getLibraryPath()、initGpuByString(memory_required, device_name)、hasGpuDevice()、listGpu(nCtx)返回GpuDevice数组type对应VkPhysicalDeviceType以及dispose()。仓库的 spec/llmodel.mjs 演示了完整用法包括listGpu()枚举设备、memoryNeeded()查询显存需求以及不用 ChatSession 时手动喂入 system prompt 的技巧await createCompletion( model, system\nYou are an advanced mathematician.\n【免费下载链接】gpt4allGPT4All: Run Local LLMs on Any Device. Open-source and available for commercial use.项目地址: https://gitcode.com/GitHub_Trending/gp/gpt4all创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表