N°586 PROVIDER DETAIL · 提供商详情
Updated · 2026.07.26

Groq

LPU 推理芯片,全球最快速度
国际厂商
6
Views · 浏览

Groq 使用自研 LPU 推理芯片,提供极高推理速度(每秒数百 Token),免费层支持 Llama、Mixtral、Gemma 等开源模型,是低延迟场景的首选。

SECTION · 01

关键信息一览

免费额度

免费层:30 RPM / 14400 RPD

使用限制

需海外网络,部分模型有 RPM 限制

网络要求
需海外网络 访问需自备海外网络环境
所属分组
国际厂商
模型列表
llama-3.3-70b mixtral-8x7b gemma2-9b
收录时间
2026-07-26
SECTION · 02

特色功能标签

极速推理(500+ TPS)|OpenAI 兼容|多模型可选|永久免费层
SECTION · 03

详细介绍

Groq 是一家专注于 AI 推理芯片的公司,其自研的 LPU(Language Processing Unit)芯片能够提供业界领先的推理速度,单 Token 生成延迟低至毫秒级,是实时对话、低延迟场景的最佳选择。

核心优势

  • 极速推理:每秒可生成 500+ Token,是 GPU 推理的 10 倍以上
  • 开源模型:支持 Llama、Mixtral、Gemma、Qwen 等主流开源模型
  • OpenAI 兼容:直接替换 base_url 即可使用
  • 永久免费层:30 RPM / 14400 RPD,足够个人使用

免费额度

  • 30 RPM(每分钟请求数)
  • 14400 RPD(每日请求数)
  • 支持所有开源模型
  • 最大上下文 128K Token

接入方式

from openai import OpenAI
client = OpenAI(
    api_key="YOUR_GROQ_API_KEY",
    base_url="https://api.groq.com/openai/v1"
)
response = client.chat.completions.create(
    model="llama-3.3-70b-versatile",
    messages=[{"role": "user", "content": "Hello!"}]
)

适用场景

  • 实时聊天机器人
  • 代码补全、IDE 助手
  • 低延迟推理服务
  • 开源模型测试