N°586
PROVIDER DETAIL · 提供商详情
Updated · 2026.07.26
Groq
LPU 推理芯片,全球最快速度
国际厂商
6
Views · 浏览
Groq 使用自研 LPU 推理芯片,提供极高推理速度(每秒数百 Token),免费层支持 Llama、Mixtral、Gemma 等开源模型,是低延迟场景的首选。
SECTION · 01
关键信息一览
免费额度
免费层:30 RPM / 14400 RPD
使用限制
需海外网络,部分模型有 RPM 限制
网络要求
需海外网络
访问需自备海外网络环境
所属分组
国际厂商
模型列表
llama-3.3-70b
mixtral-8x7b
gemma2-9b
收录时间
2026-07-26
SECTION · 02
特色功能标签
极速推理(500+ TPS)|OpenAI 兼容|多模型可选|永久免费层
SECTION · 03
详细介绍
Groq 是一家专注于 AI 推理芯片的公司,其自研的 LPU(Language Processing Unit)芯片能够提供业界领先的推理速度,单 Token 生成延迟低至毫秒级,是实时对话、低延迟场景的最佳选择。
核心优势
- 极速推理:每秒可生成 500+ Token,是 GPU 推理的 10 倍以上
- 开源模型:支持 Llama、Mixtral、Gemma、Qwen 等主流开源模型
- OpenAI 兼容:直接替换 base_url 即可使用
- 永久免费层:30 RPM / 14400 RPD,足够个人使用
免费额度
- 30 RPM(每分钟请求数)
- 14400 RPD(每日请求数)
- 支持所有开源模型
- 最大上下文 128K Token
接入方式
from openai import OpenAI
client = OpenAI(
api_key="YOUR_GROQ_API_KEY",
base_url="https://api.groq.com/openai/v1"
)
response = client.chat.completions.create(
model="llama-3.3-70b-versatile",
messages=[{"role": "user", "content": "Hello!"}]
)
适用场景
- 实时聊天机器人
- 代码补全、IDE 助手
- 低延迟推理服务
- 开源模型测试