Yingbei Cloud Docs
盈倍云文档中心
从在线对话到 OpenAI 兼容 API 接入,这里提供账户、套餐、密钥、参数、流式调用、错误处理与计费的完整说明。
充值余额并购买 Token 套餐
账户余额以人民币计价,充值成功后可用于购买 Token 套餐。套餐购买完成后,Token 将即时加入套餐余量。
- 1充值账户余额
登录后进入“充值”,选择支付金额并完成付款。
- 2选择 Token 套餐
根据预计调用量选择体验、Lite、Pro 或 MAX 套餐。
- 3确认余额购买
阅读购买规则并勾选协议,点击“立即购买”。
- 4查看套餐余量
在用量监控中查看剩余 Token、模型消耗与调用记录。
体验单每个账号仅限成功购买一次,购买其他套餐不影响体验单资格。企业大额调用可参考充值页的阶梯报价。
完成你的第一次模型调用
按照下面五个步骤即可开始使用。网页模型对话无需额外配置;程序接入需要先创建 API Key,并从接口读取可用模型 ID。
创建 API Key
进入“账户中心 → API 密钥”,填写密钥名称,可选模型白名单,然后点击创建。密钥只在创建时完整显示,请妥善保存。
配置环境变量
将地址和密钥写入服务端环境变量,应用代码只读取变量。下面的变量名可直接用于 OpenAI SDK。
# OpenAI 兼容客户端
OPENAI_BASE_URL=http://114.215.201.147:3001/v1
OPENAI_API_KEY=YOUR_API_KEY
# Anthropic / Claude Code 兼容客户端
ANTHROPIC_BASE_URL=http://114.215.201.147:3001
ANTHROPIC_AUTH_TOKEN=YOUR_API_KEY
获取可用模型
模型可能随渠道状态和密钥权限变化。调用前先读取模型列表,并使用响应中的完整 id,不要凭展示名称猜测模型 ID。
curl http://114.215.201.147:3001/v1/models \
-H "Authorization: Bearer YOUR_API_KEY"
发送首次请求
盈倍云兼容 OpenAI Chat Completions 格式。将示例中的 YOUR_API_KEY 替换为你创建的密钥。
curl http://114.215.201.147:3001/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "GLM-5.2",
"messages": [
{"role": "user", "content": "你好,请介绍一下盈倍云"}
],
"stream": false
}'
模型对话
登录后打开“模型对话”,选择可用模型并输入问题。平台默认启用实时联网能力;支持上传图片及常见文档附件,具体能力取决于所选模型。
模型列表与平台已接入渠道保持同步,可通过搜索快速定位。
同一会话保留上下文,可新建、切换、重命名和删除会话。
上传图片、TXT、PDF、Word 或 Excel 文件并结合问题分析。
回答完成后同步更新 Token 余量,可在用量监控中查看详情。
API Key 生命周期管理
建议为不同应用、环境和团队成员分别创建密钥。这样可以独立限制模型范围、定位用量,并在单个密钥泄露时快速停用而不影响其他业务。
生产、测试和个人调试使用不同密钥,名称中标明应用与环境。
仅勾选应用实际需要的模型,减少误调用和异常消费风险。
先创建新密钥并更新服务,确认正常后再删除旧密钥,避免业务中断。
用量、余额与渠道状态
“用量监控”展示套餐余量、累计消耗和分模型记录;“渠道状态”用于查看当前模型服务是否可用。账户余额与 Token 余量相互独立:余额用于购买套餐,Token 用于模型调用。
一次调用由输入 Token 与输出 Token 共同构成,输出 Token 已包含模型隐藏思考。工具调用的每一轮模型请求分别计费:工具调用参数计入输出,工具结果回传计入下一轮输入。API 与网页端统一以 New API 已扣额度为最终账单。
申请发票
在账户中心维护个人或企业发票抬头,选择已支付订单提交申请。申请进入后台审批,通过后由管理员开具并更新发票状态。
接口概览
所有接口均使用 JSON。当前公开 Base URL 如下:
http://114.215.201.147:3001/v1Authorization: Bearer <API_KEY>将 API Key 放入每次请求的 Authorization Header。不要将 Key 放在查询参数中。
/models获取当前 API Key 可调用的模型列表。建议应用启动时读取并缓存,避免硬编码过期模型名称。
/chat/completions创建模型对话。支持 model、messages、stream、temperature、max_tokens 等 OpenAI 兼容参数。
/messages使用 Anthropic Messages 协议创建对话。同一枚平台 API Key 可通过 x-api-key 或 Authorization: Bearer 鉴权,支持非流式与 Anthropic SSE 流式响应。
http://114.215.201.147:3001/v1http://114.215.201.147:3001curl http://114.215.201.147:3001/v1/messages \
-H "x-api-key: YOUR_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "z-ai/glm-5.2",
"max_tokens": 1024,
"messages": [
{"role": "user", "content": "你好,请介绍一下盈倍云"}
]
}'
Key 本身没有“OpenAI Key”和“Anthropic Key”之分。协议由请求路径、Header 和请求体决定;模型 ID 仍应以该 Key 调用 GET /v1/models 的返回值为准。
请求参数
以下是 POST /chat/completions 的常用参数。未传递的生成参数由模型采用默认值;不同模型对高级参数的支持可能不同。
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
model | string | 是 | 模型 ID,必须与 GET /models 返回值完全一致。 |
messages | array | 是 | 对话消息数组,按发生顺序排列。 |
stream | boolean | 否 | 是否使用 SSE 流式返回,默认 false。 |
temperature | number | 否 | 采样随机性,常见范围 0 至 2;事实和代码任务建议使用较低值。 |
top_p | number | 否 | 核采样参数,常见范围 0 至 1。通常只调整它或 temperature 之一。 |
max_tokens | integer | 否 | 限制最大输出长度,实际可用值受模型上下文窗口约束。 |
presence_penalty | number | 否 | 鼓励模型谈及新内容,通常范围 -2 至 2。 |
frequency_penalty | number | 否 | 降低重复内容,通常范围 -2 至 2。 |
response_format | object | 否 | 请求文本或 JSON 输出;仅在所选模型支持时生效。 |
tools | array | 否 | 函数工具定义;需由客户端执行工具并回传 tool 消息。 |
reasoning_effort | string | 否 | 推理强度,如 low、medium、high,仅推理模型支持。 |
messages 消息格式
| role | 用途 | content |
|---|---|---|
system | 设置助手身份、风格和任务边界。 | 字符串 |
user | 用户输入,可包含文本与图片。 | 字符串或内容数组 |
assistant | 历史模型回复,用于延续上下文。 | 字符串或工具调用 |
tool | 回传工具执行结果。 | 字符串,并提供 tool_call_id |
标准参数会转发给所选模型,但模型厂商对参数范围、工具调用、JSON 输出和推理字段的实现并不完全一致。收到参数错误时,请先移除高级参数并用最小请求验证。
流式输出
将 stream 设为 true 后,服务通过 SSE 持续返回增量内容。流式方式能更快展示首段回答,也更适合长文本生成。
from openai import OpenAI
client = OpenAI(
base_url="http://114.215.201.147:3001/v1",
api_key="YOUR_API_KEY",
)
stream = client.chat.completions.create(
model="GLM-5.2",
messages=[{"role": "user", "content": "用三点介绍模型聚合平台"}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)
不要假设每个数据块都包含文本;应判空后再拼接。连接结束后保存完整回复,并将其作为下一轮的 assistant 消息加入上下文。
图片理解
对支持视觉能力的模型,可在用户消息中同时发送文字和图片 URL。图片应可被公网访问;能力与文件限制以所选模型为准。
curl http://114.215.201.147:3001/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "YOUR_VISION_MODEL_ID",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "请概括这张图片的内容"},
{"type": "image_url", "image_url": {"url": "https://example.com/image.jpg"}}
]
}]
}'
image_url。非流式响应结构
成功响应通常包含请求 ID、模型、候选结果与 Token 用量。不同上游模型可能增加扩展字段,业务代码应忽略不认识的字段。
{
"id": "chatcmpl_xxx",
"object": "chat.completion",
"model": "GLM-5.2",
"choices": [{
"index": 0,
"message": {"role": "assistant", "content": "..."},
"finish_reason": "stop"
}],
"usage": {
"prompt_tokens": 18,
"completion_tokens": 86,
"total_tokens": 104
}
}
finish_reason: stop模型正常完成回答。
finish_reason: length达到输出或上下文限制,可缩短输入或提高限制。
usage用于观察输入、输出及合计 Token;completion_tokens 已包含隐藏思考,账单以 New API 额度记录为准。
HTTP 状态码与排查
| 状态码 | 含义 | 处理建议 |
|---|---|---|
| 400 | 请求参数错误 | 检查 JSON、模型 ID、messages 格式及模型是否支持所传高级参数。 |
| 401 | 认证失败 | 检查 Bearer 格式、密钥是否完整、是否已被删除。 |
| 403 | 无模型权限 | 检查密钥模型白名单、套餐权益或内容安全限制。 |
| 404 | 接口或模型不存在 | Base URL 应以 /v1 结尾;模型名以 GET /models 为准。 |
| 429 | 请求过快或额度不足 | 降低并发并指数退避;同时检查 Token 余量。 |
| 500 | 服务内部错误 | 记录时间、模型与错误信息,短暂退避后重试。 |
| 502 / 503 | 上游暂时不可用 | 查看渠道状态,采用有限次数重试或切换可用模型。 |
请提供发生时间、接口路径、模型 ID、HTTP 状态码和错误正文。API Key 只提供前后少量字符用于定位,切勿发送完整密钥。
Python SDK 示例
import os
from openai import OpenAI
client = OpenAI(
base_url=os.environ["OPENAI_BASE_URL"],
api_key=os.environ["OPENAI_API_KEY"],
)
response = client.chat.completions.create(
model="GLM-5.2",
messages=[{"role": "user", "content": "你好"}],
)
print(response.choices[0].message.content)
Node.js SDK 示例
import OpenAI from "openai";
const client = new OpenAI({
baseURL: process.env.OPENAI_BASE_URL,
apiKey: process.env.OPENAI_API_KEY,
});
const response = await client.chat.completions.create({
model: "GLM-5.2",
messages: [{ role: "user", content: "你好" }],
});
console.log(response.choices[0].message.content);
生产环境接入建议
按业务场景设置连接和总请求超时;长回答优先使用流式接口。
仅对 429、500、502、503 等暂时性错误重试,并使用指数退避和随机抖动。
在应用侧设置并发上限与队列,避免突发请求耗尽额度或触发限流。
记录耗时、状态码、模型和 Token 用量,但不要记录完整密钥及敏感原文。
定期压缩历史消息,避免上下文持续增长导致延迟和费用上升。
关键业务预设可替代模型,并在渠道不可用时返回清晰的用户提示。
兼容工具与客户端接入
凡是允许自定义 OpenAI Base URL 的客户端,通常都可以接入盈倍云。配置时填写 Base URL、API Key 和接口实际返回的模型 ID。
将 base_url 设为 http://114.215.201.147:3001/v1,密钥放在服务端环境变量中。
Header 添加 Authorization: Bearer YOUR_API_KEY 与 Content-Type: application/json。
供应商类型选择 OpenAI 兼容,填写盈倍云 Base URL、API Key 与平台返回的模型 ID。
设置 ANTHROPIC_BASE_URL 和 ANTHROPIC_AUTH_TOKEN 后,可通过原生 Anthropic Messages 协议调用;模型名仍以 GET /models 返回值为准。
平台使用规则
- 用户应妥善保管账户和 API Key,对密钥产生的调用负责。
- 不得使用平台生成或传播违法违规、侵权或危害网络安全的内容。
- 模型能力、上下文长度和可用性可能随上游渠道调整,以平台实时状态为准。
- 套餐为数字化服务,购买前请确认额度、适用范围和账户信息。
- 平台按实际 Token 用量记录计费,异常账单可联系管理员核查。
常见问题
为什么账户有余额,API 仍提示额度不足?
人民币余额用于购买套餐,API 调用消耗的是 Token 余量。请先在充值页使用余额购买 Token 套餐。
为什么提示所选模型不存在?
模型名称必须与 GET /v1/models 返回的 ID 完全一致。请刷新模型列表后重新选择。
API Key 创建后还能再次查看完整内容吗?
不能。完整 Key 只在创建成功时显示一次;遗失后请删除旧 Key 并重新创建。
如何查看每次调用消耗?
进入“用量监控”查看分模型调用记录、Token 消耗、时间和当前套餐余量。
调用失败是否会扣除 Token?
通常只有成功产生有效模型用量的请求才会计入消耗;如发现异常,请保留时间和请求信息联系管理员核查。
Base URL 应该填写到哪一级?
SDK 的 Base URL 填写 http://114.215.201.147:3001/v1,不要只填主机地址,也不要把 /chat/completions 一并填入。
为什么网页对话能联网,API 回答却没有联网信息?
网页端会额外执行搜索与上下文编排,标准 /chat/completions 只负责模型推理。外部应用如需联网,需要自行接入搜索服务并把结果作为上下文交给模型。
为什么流式调用偶尔收到空数据块?
SSE 数据块可能只携带角色、结束原因或用量信息。客户端应先判断 delta.content 是否存在,再追加到显示内容。
如何降低响应延迟?
启用 stream: true 改善首字展示速度,减少过长的历史上下文和输出上限,并选择延迟更低且当前渠道正常的模型。
temperature 和 top_p 应该怎样设置?
事实问答和代码任务可先使用较低 temperature,创意任务适当提高。一般只调整 temperature 或 top_p 其中一个,并通过固定测试集比较效果。
OpenAI 和 Anthropic 协议需要分别创建 Key 吗?
不需要。同一枚网页生成的 API Key 可以调用 /v1/chat/completions 和 /v1/messages;只需按所用 SDK 配置对应 Base URL 和鉴权方式。