盈倍云 盈倍云 文档中心 进入平台
首页/文档中心

Yingbei Cloud Docs

盈倍云文档中心

从在线对话到 OpenAI 兼容 API 接入,这里提供账户、套餐、密钥、参数、流式调用、错误处理与计费的完整说明。

购买指南

充值余额并购买 Token 套餐

账户余额以人民币计价,充值成功后可用于购买 Token 套餐。套餐购买完成后,Token 将即时加入套餐余量。

  1. 1
    充值账户余额

    登录后进入“充值”,选择支付金额并完成付款。

  2. 2
    选择 Token 套餐

    根据预计调用量选择体验、Lite、Pro 或 MAX 套餐。

  3. 3
    确认余额购买

    阅读购买规则并勾选协议,点击“立即购买”。

  4. 4
    查看套餐余量

    在用量监控中查看剩余 Token、模型消耗与调用记录。

提示

体验单每个账号仅限成功购买一次,购买其他套餐不影响体验单资格。企业大额调用可参考充值页的阶梯报价。

快速入门

完成你的第一次模型调用

按照下面五个步骤即可开始使用。网页模型对话无需额外配置;程序接入需要先创建 API Key,并从接口读取可用模型 ID。

01

注册并登录账户

返回盈倍云首页,点击“登录”,在登录窗口中选择“注册账号”。完成邮箱验证后即可进入用户中心。

前往盈倍云平台
02

创建 API Key

进入“账户中心 → API 密钥”,填写密钥名称,可选模型白名单,然后点击创建。密钥只在创建时完整显示,请妥善保存。

安全提醒不要在浏览器前端、公开仓库或聊天记录中暴露 API Key。
03

配置环境变量

将地址和密钥写入服务端环境变量,应用代码只读取变量。下面的变量名可直接用于 OpenAI SDK。

Shell / .env
# OpenAI 兼容客户端
OPENAI_BASE_URL=http://114.215.201.147:3001/v1
OPENAI_API_KEY=YOUR_API_KEY

# Anthropic / Claude Code 兼容客户端
ANTHROPIC_BASE_URL=http://114.215.201.147:3001
ANTHROPIC_AUTH_TOKEN=YOUR_API_KEY
04

获取可用模型

模型可能随渠道状态和密钥权限变化。调用前先读取模型列表,并使用响应中的完整 id,不要凭展示名称猜测模型 ID。

cURL
curl http://114.215.201.147:3001/v1/models \
  -H "Authorization: Bearer YOUR_API_KEY"
05

发送首次请求

盈倍云兼容 OpenAI Chat Completions 格式。将示例中的 YOUR_API_KEY 替换为你创建的密钥。

cURL
curl http://114.215.201.147:3001/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "GLM-5.2",
    "messages": [
      {"role": "user", "content": "你好,请介绍一下盈倍云"}
    ],
    "stream": false
  }'
使用指南

模型对话

登录后打开“模型对话”,选择可用模型并输入问题。平台默认启用实时联网能力;支持上传图片及常见文档附件,具体能力取决于所选模型。

选择模型

模型列表与平台已接入渠道保持同步,可通过搜索快速定位。

连续对话

同一会话保留上下文,可新建、切换、重命名和删除会话。

附件理解

上传图片、TXT、PDF、Word 或 Excel 文件并结合问题分析。

实时扣费

回答完成后同步更新 Token 余量,可在用量监控中查看详情。

使用指南

API Key 生命周期管理

建议为不同应用、环境和团队成员分别创建密钥。这样可以独立限制模型范围、定位用量,并在单个密钥泄露时快速停用而不影响其他业务。

按用途拆分

生产、测试和个人调试使用不同密钥,名称中标明应用与环境。

最小权限

仅勾选应用实际需要的模型,减少误调用和异常消费风险。

定期轮换

先创建新密钥并更新服务,确认正常后再删除旧密钥,避免业务中断。

发现泄露时立即在“API 密钥”页面删除对应密钥,创建新密钥,并检查使用记录中是否存在异常模型、时间或 Token 消耗。
使用指南

用量、余额与渠道状态

“用量监控”展示套餐余量、累计消耗和分模型记录;“渠道状态”用于查看当前模型服务是否可用。账户余额与 Token 余量相互独立:余额用于购买套餐,Token 用于模型调用。

计费口径

一次调用由输入 Token 与输出 Token 共同构成,输出 Token 已包含模型隐藏思考。工具调用的每一轮模型请求分别计费:工具调用参数计入输出,工具结果回传计入下一轮输入。API 与网页端统一以 New API 已扣额度为最终账单。

使用指南

申请发票

在账户中心维护个人或企业发票抬头,选择已支付订单提交申请。申请进入后台审批,通过后由管理员开具并更新发票状态。

API 文档

接口概览

所有接口均使用 JSON。当前公开 Base URL 如下:

Base URLhttp://114.215.201.147:3001/v1
AUTHAuthorization: Bearer <API_KEY>

将 API Key 放入每次请求的 Authorization Header。不要将 Key 放在查询参数中。

GET/models

获取当前 API Key 可调用的模型列表。建议应用启动时读取并缓存,避免硬编码过期模型名称。

POST/chat/completions

创建模型对话。支持 modelmessagesstreamtemperaturemax_tokens 等 OpenAI 兼容参数。

POST/messages

使用 Anthropic Messages 协议创建对话。同一枚平台 API Key 可通过 x-api-keyAuthorization: Bearer 鉴权,支持非流式与 Anthropic SSE 流式响应。

OpenAI Base URLhttp://114.215.201.147:3001/v1
Anthropic Base URLhttp://114.215.201.147:3001
cURL · Anthropic Messages
curl http://114.215.201.147:3001/v1/messages \
  -H "x-api-key: YOUR_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "z-ai/glm-5.2",
    "max_tokens": 1024,
    "messages": [
      {"role": "user", "content": "你好,请介绍一下盈倍云"}
    ]
  }'
双协议说明

Key 本身没有“OpenAI Key”和“Anthropic Key”之分。协议由请求路径、Header 和请求体决定;模型 ID 仍应以该 Key 调用 GET /v1/models 的返回值为准。

请求参数

以下是 POST /chat/completions 的常用参数。未传递的生成参数由模型采用默认值;不同模型对高级参数的支持可能不同。

参数类型必填说明
modelstring模型 ID,必须与 GET /models 返回值完全一致。
messagesarray对话消息数组,按发生顺序排列。
streamboolean是否使用 SSE 流式返回,默认 false
temperaturenumber采样随机性,常见范围 0 至 2;事实和代码任务建议使用较低值。
top_pnumber核采样参数,常见范围 0 至 1。通常只调整它或 temperature 之一。
max_tokensinteger限制最大输出长度,实际可用值受模型上下文窗口约束。
presence_penaltynumber鼓励模型谈及新内容,通常范围 -2 至 2。
frequency_penaltynumber降低重复内容,通常范围 -2 至 2。
response_formatobject请求文本或 JSON 输出;仅在所选模型支持时生效。
toolsarray函数工具定义;需由客户端执行工具并回传 tool 消息。
reasoning_effortstring推理强度,如 lowmediumhigh,仅推理模型支持。

messages 消息格式

role用途content
system设置助手身份、风格和任务边界。字符串
user用户输入,可包含文本与图片。字符串或内容数组
assistant历史模型回复,用于延续上下文。字符串或工具调用
tool回传工具执行结果。字符串,并提供 tool_call_id
兼容性说明

标准参数会转发给所选模型,但模型厂商对参数范围、工具调用、JSON 输出和推理字段的实现并不完全一致。收到参数错误时,请先移除高级参数并用最小请求验证。

流式输出

stream 设为 true 后,服务通过 SSE 持续返回增量内容。流式方式能更快展示首段回答,也更适合长文本生成。

Python · Streaming
from openai import OpenAI

client = OpenAI(
    base_url="http://114.215.201.147:3001/v1",
    api_key="YOUR_API_KEY",
)

stream = client.chat.completions.create(
    model="GLM-5.2",
    messages=[{"role": "user", "content": "用三点介绍模型聚合平台"}],
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta.content
    if delta:
        print(delta, end="", flush=True)
客户端处理

不要假设每个数据块都包含文本;应判空后再拼接。连接结束后保存完整回复,并将其作为下一轮的 assistant 消息加入上下文。

图片理解

对支持视觉能力的模型,可在用户消息中同时发送文字和图片 URL。图片应可被公网访问;能力与文件限制以所选模型为准。

cURL · Vision
curl http://114.215.201.147:3001/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "YOUR_VISION_MODEL_ID",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "请概括这张图片的内容"},
        {"type": "image_url", "image_url": {"url": "https://example.com/image.jpg"}}
      ]
    }]
  }'
注意普通文本模型无法处理图片。请先在模型广场确认模型能力,并避免把需要鉴权的临时内网地址作为 image_url

非流式响应结构

成功响应通常包含请求 ID、模型、候选结果与 Token 用量。不同上游模型可能增加扩展字段,业务代码应忽略不认识的字段。

JSON
{
  "id": "chatcmpl_xxx",
  "object": "chat.completion",
  "model": "GLM-5.2",
  "choices": [{
    "index": 0,
    "message": {"role": "assistant", "content": "..."},
    "finish_reason": "stop"
  }],
  "usage": {
    "prompt_tokens": 18,
    "completion_tokens": 86,
    "total_tokens": 104
  }
}
finish_reason: stop

模型正常完成回答。

finish_reason: length

达到输出或上下文限制,可缩短输入或提高限制。

usage

用于观察输入、输出及合计 Token;completion_tokens 已包含隐藏思考,账单以 New API 额度记录为准。

HTTP 状态码与排查

状态码含义处理建议
400请求参数错误检查 JSON、模型 ID、messages 格式及模型是否支持所传高级参数。
401认证失败检查 Bearer 格式、密钥是否完整、是否已被删除。
403无模型权限检查密钥模型白名单、套餐权益或内容安全限制。
404接口或模型不存在Base URL 应以 /v1 结尾;模型名以 GET /models 为准。
429请求过快或额度不足降低并发并指数退避;同时检查 Token 余量。
500服务内部错误记录时间、模型与错误信息,短暂退避后重试。
502 / 503上游暂时不可用查看渠道状态,采用有限次数重试或切换可用模型。
提交工单信息

请提供发生时间、接口路径、模型 ID、HTTP 状态码和错误正文。API Key 只提供前后少量字符用于定位,切勿发送完整密钥。

Python SDK 示例

Python
import os
from openai import OpenAI

client = OpenAI(
    base_url=os.environ["OPENAI_BASE_URL"],
    api_key=os.environ["OPENAI_API_KEY"],
)

response = client.chat.completions.create(
    model="GLM-5.2",
    messages=[{"role": "user", "content": "你好"}],
)

print(response.choices[0].message.content)

Node.js SDK 示例

Node.js
import OpenAI from "openai";

const client = new OpenAI({
  baseURL: process.env.OPENAI_BASE_URL,
  apiKey: process.env.OPENAI_API_KEY,
});

const response = await client.chat.completions.create({
  model: "GLM-5.2",
  messages: [{ role: "user", content: "你好" }],
});

console.log(response.choices[0].message.content);

生产环境接入建议

01设置超时

按业务场景设置连接和总请求超时;长回答优先使用流式接口。

02有限重试

仅对 429、500、502、503 等暂时性错误重试,并使用指数退避和随机抖动。

03控制并发

在应用侧设置并发上限与队列,避免突发请求耗尽额度或触发限流。

04记录可观测信息

记录耗时、状态码、模型和 Token 用量,但不要记录完整密钥及敏感原文。

05限制上下文

定期压缩历史消息,避免上下文持续增长导致延迟和费用上升。

06准备降级

关键业务预设可替代模型,并在渠道不可用时返回清晰的用户提示。

实用工具

兼容工具与客户端接入

凡是允许自定义 OpenAI Base URL 的客户端,通常都可以接入盈倍云。配置时填写 Base URL、API Key 和接口实际返回的模型 ID。

OpenAI SDK

base_url 设为 http://114.215.201.147:3001/v1,密钥放在服务端环境变量中。

cURL / Postman

Header 添加 Authorization: Bearer YOUR_API_KEYContent-Type: application/json

CCSwitch

供应商类型选择 OpenAI 兼容,填写盈倍云 Base URL、API Key 与平台返回的模型 ID。

Claude Code

设置 ANTHROPIC_BASE_URLANTHROPIC_AUTH_TOKEN 后,可通过原生 Anthropic Messages 协议调用;模型名仍以 GET /models 返回值为准。

联网搜索说明盈倍云网页“模型对话”会自动编排实时搜索;外部 API 调用不会因为使用同一模型而自动拥有网页端搜索流程,应用侧需要自行实现搜索与结果回填。
服务协议

平台使用规则

  • 用户应妥善保管账户和 API Key,对密钥产生的调用负责。
  • 不得使用平台生成或传播违法违规、侵权或危害网络安全的内容。
  • 模型能力、上下文长度和可用性可能随上游渠道调整,以平台实时状态为准。
  • 套餐为数字化服务,购买前请确认额度、适用范围和账户信息。
  • 平台按实际 Token 用量记录计费,异常账单可联系管理员核查。
常见问题

常见问题

为什么账户有余额,API 仍提示额度不足?

人民币余额用于购买套餐,API 调用消耗的是 Token 余量。请先在充值页使用余额购买 Token 套餐。

为什么提示所选模型不存在?

模型名称必须与 GET /v1/models 返回的 ID 完全一致。请刷新模型列表后重新选择。

API Key 创建后还能再次查看完整内容吗?

不能。完整 Key 只在创建成功时显示一次;遗失后请删除旧 Key 并重新创建。

如何查看每次调用消耗?

进入“用量监控”查看分模型调用记录、Token 消耗、时间和当前套餐余量。

调用失败是否会扣除 Token?

通常只有成功产生有效模型用量的请求才会计入消耗;如发现异常,请保留时间和请求信息联系管理员核查。

Base URL 应该填写到哪一级?

SDK 的 Base URL 填写 http://114.215.201.147:3001/v1,不要只填主机地址,也不要把 /chat/completions 一并填入。

为什么网页对话能联网,API 回答却没有联网信息?

网页端会额外执行搜索与上下文编排,标准 /chat/completions 只负责模型推理。外部应用如需联网,需要自行接入搜索服务并把结果作为上下文交给模型。

为什么流式调用偶尔收到空数据块?

SSE 数据块可能只携带角色、结束原因或用量信息。客户端应先判断 delta.content 是否存在,再追加到显示内容。

如何降低响应延迟?

启用 stream: true 改善首字展示速度,减少过长的历史上下文和输出上限,并选择延迟更低且当前渠道正常的模型。

temperature 和 top_p 应该怎样设置?

事实问答和代码任务可先使用较低 temperature,创意任务适当提高。一般只调整 temperature 或 top_p 其中一个,并通过固定测试集比较效果。

OpenAI 和 Anthropic 协议需要分别创建 Key 吗?

不需要。同一枚网页生成的 API Key 可以调用 /v1/chat/completions/v1/messages;只需按所用 SDK 配置对应 Base URL 和鉴权方式。

已复制