DeepInfra 介绍
了解工具的详细功能和使用方法
DeepInfra 是托管 AI 模型推理平台,开发者可调用文本生成、Embedding、图像等模型。对需要迅速接入多个开放权重 LLM 的应用,核心价值是兼容 OpenAI 的 Chat Completions 接口和按模型公布的价格;它本身不是面向终端用户的聊天应用。平台目录也包含部分合作方模型,因此“DeepInfra 平台”不等于“目录内每个模型都开放权重”。
适合谁
- 已有 OpenAI SDK 调用代码,想对同一任务比较不同模型的开发团队。
- 要为 Agent、RAG 或文本处理服务接入托管推理,同时跟踪输入、输出 token 成本的产品。
- 希望在部署专属 GPU 前,先用 Serverless 验证模型质量、时延和并发需求的团队。
接入和能力
官方兼容接口使用 https://api.deepinfra.com/v1/openai 作为 base URL,聊天请求走 /chat/completions,凭 API key 认证。文档列出流式输出、工具调用、结构化输出等能力,但并不承诺每个参数、每款模型与 OpenAI API 完全一致。选定模型后应跑功能用例,尤其是工具调用 JSON、上下文长度和中断重试。
价格和限制
DeepInfra 没有可以套用全平台的“每百万 token 单价”。文本模型通常分别计输入和输出 token,图像等任务可能按单次推理计费;专属 GPU 另有小时价格。官网实时价格页在 2026 年 10 月 7 日显示,示例 DeepSeek-V4-Flash-0731 的标准层为每百万输入 token 0.06 美元、输出 token 0.18 美元、缓存输入 token 0.015 美元。它只能用于该模型与当前层级,不能拿来估计其他模型。计费前查看所选模型卡与账号账单,试点时记录响应中的 usage 与 estimated_cost。
官方限流文档写的是默认每模型 200 个并发请求,超过限额或资源繁忙会遇到 429;这不是每分钟 200 次请求。应用应设置自身并发阈值、超时、指数退避与预算上限,不能把上游限额当成本控制。隐私方面,官方说明普通文本推理的输入输出通常只在内存中处理,但批量任务、图像产物以及合作方模型各有例外;敏感数据须按模型和任务类型核对数据政策。