N°01 FREE LLM APIS · 免费大模型索引
Updated · 2026.09.09

免费大模型API

Free LLM APIs Directory
26
服务提供商
12+
永久免费
04
分类维度

精选 26 家提供免费 API Key 的大模型服务商,覆盖国际厂商、国内厂商、聚合中转和开源自部署四大类。每家均附详细介绍、申请入口、API 文档和免费额度说明,助您快速搭建零成本 AI 应用。

CATEGORY · 01

国际厂商

提供业界顶尖的开源模型免费推理,部分模型能力对标 GPT-4。需要海外网络访问,但免费额度慷慨、模型选择丰富。

Google Gemini
Google 出品,Gemini Flash 永久免费
Google Gemini API 提供免费的 Gemini 1.5 Flash / 2.0 Flash 等模型,支持文本、图像、音频、视频多模态输入,是当前最值得使用的免费大模型 API 之一。
额度 免费层:15 RPM / 100万 TPM / 1500 RPD
限制 需海外网络访问,免费层不支持商用
模型 gemini-1.5-flash, gemini-2.0-flash, gemini-1.5-pro(限免)
多模态理解 100万+ Token 上下文 免费 Flash 模型 OpenAI 兼容
Groq
LPU 推理芯片,全球最快速度
Groq 使用自研 LPU 推理芯片,提供极高推理速度(每秒数百 Token),免费层支持 Llama、Mixtral、Gemma 等开源模型,是低延迟场景的首选。
额度 免费层:30 RPM / 14400 RPD
限制 需海外网络,部分模型有 RPM 限制
模型 llama-3.3-70b, mixtral-8x7b, gemma2-9b
极速推理(500+ TPS) OpenAI 兼容 多模型可选 永久免费层
Cerebras
WSE 晶圆级引擎,超高通量
Cerebras 基于自研 Wafer Scale Engine 晶圆级芯片提供推理服务,免费层支持 Llama 3 系列、Qwen3 等模型,速度极快,适合批量任务。
额度 免费层:30 RPM / 60 RPH
限制 需海外网络,按分钟/小时限速
模型 llama-3.3-70b, llama-4-scout, qwen3-32b
晶圆级芯片 超高吞吐 Llama 系列免费 OpenAI 兼容
SambaNova
RDU 自研芯片,免费 Llama 405B
SambaNova Cloud 提供免费的 Llama 3.1 405B、70B、8B 等超大模型推理,自研 RDU 芯片速度惊人,是免费体验最强开源模型的好去处。
额度 免费层:10 RPM / 50 RPD (405B)
限制 需海外网络,每日请求数有限
模型 Meta-Llama-3.1-405B, Llama-3.1-70B, Llama-3.1-8B
免费 405B 巨兽 RDU 芯片 Llama 全系列 OpenAI 兼容
Together AI
$5 免费额度,200+ 开源模型
Together AI 提供 200+ 开源模型的 API 服务,新用户注册赠送 $5 免费额度,支持 Llama、Qwen、DeepSeek、Mixtral 等主流开源模型,性价比极高。
额度 新用户 $5 免费额度
限制 额度用完需付费,需海外网络
模型 meta-llama/Llama-3.3-70B, Qwen/Qwen2.5-72B, deepseek-ai/DeepSeek-V3
200+ 模型 $5 赠金 微调服务 OpenAI 兼容
Cloudflare Workers AI
全球边缘网络,每天 10000 次免费
Cloudflare Workers AI 在全球边缘节点提供大模型推理,每天免费 10000 次神经元计算,支持 Llama、Mistral、Qwen 等模型,全球低延迟。
额度 免费层:10000 神经元/天
限制 需海外网络,按神经元计费
模型 @cf/meta/llama-3.3-70b-instruct-fp8-fast, @hf/mistral/mistral-7b-instruct
全球边缘节点 10000 次/天 REST & Worker API 无需服务器
HuggingFace Inference API
开源模型仓库,免费推理 API
HuggingFace 提供免费的 Inference API,可调用平台上海量开源模型,包括 Llama、Qwen、Mistral、DeepSeek 等,是研究、测试开源模型的最佳平台。
额度 免费层:每小时有限调用次数
限制 免费层有冷却时间,需海外网络
模型 meta-llama/Meta-Llama-3-70B, Qwen/Qwen2.5-72B-Instruct
百万模型仓库 免费推理 API Serverless 调用 多模态支持
Mistral AI
欧洲大模型,免费 La Plateforme
Mistral AI 是欧洲领先的大模型公司,提供 Mistral Large、Small、Nemo 等模型,La Plateforme 平台有免费额度,部分模型可自由调用。
额度 免费层:有限调用次数
限制 需海外网络,免费额度较少
模型 mistral-large-latest, mistral-small-latest, open-mistral-nemo
欧洲合规 开源权重模型 函数调用 OpenAI 兼容
GitHub Models
GitHub 出品,免费体验 GPT-4o
GitHub Models 面向开发者提供主流大模型的免费体验,包括 GPT-4o、Llama、Phi、Mistral 等,通过 GitHub Token 即可调用,每日有免费额度。
额度 免费层:每日有限调用次数
限制 需 GitHub 账号,需海外网络
模型 gpt-4o, Phi-3.5-mini, Mistral-Nemo, Llama-3.3-70B
GPT-4o 免费 GitHub Token 鉴权 低代码集成 Playground
OpenRouter
聚合网关,部分模型完全免费
永久免费
OpenRouter 是大模型聚合 API 网关,统一接口调用 200+ 模型,提供部分完全免费的模型(如 Llama、Mistral),新用户赠送少量免费额度。
额度 部分模型完全免费
限制 免费模型有限,需海外网络
模型 meta-llama/llama-3.3-70b-instruct:free, mistralai/mistral-7b-instruct:free
统一 API 200+ 模型 部分模型免费 OpenAI 兼容
NVIDIA NIM
NVIDIA 出品,1000 次免费调用
NVIDIA NIM 平台提供 Llama、Mistral、Qwen 等开源模型的免费推理 API,注册即送 1000 次调用额度,是体验 NVIDIA 推理优化的好选择。
额度 新用户 1000 次免费调用
限制 额度有限,需海外网络
模型 meta/llama-3.1-405b-instruct, meta/llama-3.3-70b-instruct
NVIDIA 推理优化 TensorRT-LLM OpenAI 兼容 微调支持
Meta Llama API
Meta 官方 Llama API 免费预览
Meta 推出官方 Llama API,目前以免费预览模式面向全球开发者开放,可测试最新的 Llama 4 Scout 和 Maverick 模型,速度极快。
额度 免费预览:有限调用次数
限制 预览阶段,需海外网络,需排队
模型 Llama-4-Scout-17B-16E, Llama-4-Maverick-17B-128E
Meta 官方 Llama 4 首发 Cerebras/Groq 后端 免费预览
CATEGORY · 02

国内厂商

国内直连无需代理,新用户赠送免费额度或提供永久免费模型,是企业级应用和个人开发的合规选择。

硅基流动 SiliconFlow
国内首选,14元赠金 + 多免费模型
永久免费
硅基流动是国内领先的大模型推理平台,注册即送 14 元额度,并提供 Qwen2.5-7B、DeepSeek-V2-Lite、GLM-4-9B 等多个完全免费的模型,国内直连无需代理。
额度 14 元赠金 + 多个完全免费模型
限制 免费模型有 RPM 限制
模型 Qwen/Qwen2.5-7B-Instruct, deepseek-ai/DeepSeek-V2-Lite, THUDM/glm-4-9b-chat
国内直连 多个免费模型 OpenAI 兼容 充值便宜
DeepSeek
国产黑马,超低价格 + 免费额度
国内直连
DeepSeek 是国产大模型的黑马,DeepSeek-V3 / R1 性能媲美 GPT-4o,价格仅为后者 1/10。新用户注册赠送免费额度,国内直连,价格极低。
额度 新用户免费额度(5000万 Token)
限制 额度用完按量付费
模型 deepseek-chat, deepseek-reasoner, deepseek-coder
DeepSeek-V3 / R1 价格极低 国内直连 OpenAI 兼容
智谱 ChatGLM
GLM-4-Flash 永久免费
永久免费
智谱 AI 是清华系大模型公司,提供 GLM-4-Flash 完全免费模型,支持 128K 上下文、函数调用、代码执行等高级特性,国内直连无需代理。
额度 GLM-4-Flash 永久免费 + 新用户赠金
限制 免费模型能力略弱于 GLM-4-Plus
模型 glm-4-flash, glm-4-flashx, glm-4-air, glm-4-plus
GLM-4-Flash 免费 128K 上下文 函数调用 国内直连
Kimi Moonshot
200 万长上下文,新用户赠金
国内直连
Moonshot AI 提供 Kimi 大模型 API,支持 200 万字超长上下文,是处理长文档、代码库分析的利器。新用户注册赠送 15 元免费额度,国内直连。
额度 新用户 15 元免费额度
限制 额度用完按量付费
模型 moonshot-v1-8k, moonshot-v1-32k, moonshot-v1-128k
200 万上下文 函数调用 国内直连 OpenAI 兼容
讯飞星火 Spark
Spark Lite 永久免费
永久免费
科大讯飞星火大模型 Spark Lite 版本永久免费,支持文本对话、代码生成、数学计算等场景,国内直连,是国内合规稳定的免费 API 选择。
额度 Spark Lite 永久免费
限制 免费模型仅 Lite 版本
模型 spark-lite, spark-pro, spark-max, spark-4.0-ultra
Spark Lite 免费 国内合规 WebSocket 接入 多模态
Coze 扣子
字节出品,Bot API 免费调用
国内直连
Coze 是字节跳动推出的智能体开发平台,提供 Bot API 可免费调用,支持接入豆包、GPT、Claude 等模型,可快速构建聊天机器人并部署到各平台。
额度 免费层:有限调用次数
限制 免费额度有限,模型可选性受平台控制
模型 doubao-pro, doubao-lite, GPT-4o(中转)
智能体编排 多模型接入 Bot API 多平台部署
阿里通义千问
Qwen-Turbo 免费额度 + 限时免费
国内直连
阿里云百炼平台提供通义千问大模型 API,新用户赠送 100 万 Token 免费额度,部分模型(如 Qwen-Long)限时免费,国内直连,企业可用。
额度 新用户 100 万 Token 免费额度
限制 额度用完需付费
模型 qwen-turbo, qwen-plus, qwen-max, qwen-long
通义千问系列 100 万免费 Token 国内直连 企业合规
百度千帆
ERNIE-Speed 永久免费
永久免费
百度千帆平台提供 ERNIE-Speed 系列模型永久免费调用,支持 8K / 128K 上下文,国内直连,是国内企业级应用的首选免费 API。
额度 ERNIE-Speed 永久免费
限制 免费模型仅 Speed 系列
模型 ernie-speed-pro-128k, ernie-speed-8k, ernie-4.0
ERNIE-Speed 免费 国内合规 128K 上下文 企业可用
腾讯混元
新用户免费额度 + lite 免费
国内直连
腾讯云混元大模型 API,新用户赠送 50 万 Token 免费额度,部分 lite 模型限时免费,国内直连,企业级 SLA 保障,适合企业应用集成。
额度 新用户 50 万 Token + lite 限时免费
限制 免费额度有限
模型 hunyuan-lite, hunyuan-standard, hunyuan-pro
混元大模型 企业级 SLA 国内直连 多模态
MiniMax
新用户赠金 + abab 系列模型
国内直连
MiniMax 提供自研 abab 系列大模型 API,新用户注册赠送免费额度,支持文本、语音、视频多模态生成,国内直连,特色是语音合成和视频生成能力。
额度 新用户免费赠金
限制 额度有限,需企业认证升级
模型 abab6.5s-chat, abab6.5-chat, speech-01-turbo
abab 系列模型 语音合成 视频生成 国内直连
CATEGORY · 03

聚合中转

聚合多家大模型 API 的中转服务,统一接口调用多个模型,国内直连,适合快速测试不同模型。

GPT_API_free
免费 GPT-4 中转 API
国内直连
GPT_API_free 是 GitHub 开源项目,提供免费的 ChatGPT API 中转服务,支持 GPT-3.5 / GPT-4 / GPT-4o 模型,国内直连无需代理,适合个人开发者测试使用。
额度 免费额度:200万 Token / 月
限制 易封 IP,限速 RPM,仅个人测试
模型 gpt-3.5-turbo, gpt-4o, gpt-4-free
GPT-4 免费中转 国内直连 OpenAI 兼容 社区维护
智汇 API
聚合中转,免费切换主流大模型
国内直连
智汇 API 是国内大模型聚合中转服务,注册开发者账号后即可获得 APPKEY,可切换市面上所有主流大语言模型,兼容 OpenAI API,国内直连。
额度 免费层:仅限制 QPS
限制 聚合服务稳定性有限
模型 gpt-4o, claude-3.5-sonnet, deepseek-v3
多模型聚合 OpenAI 兼容 国内直连 QPS 限制
CATEGORY · 04

开源自部署

完全开源、永久免费的本地部署方案,无任何调用限制,依赖本地算力,适合隐私敏感场景。

Ollama
本地部署,永久完全免费
永久免费
Ollama 是开源的本地大模型运行框架,可一键在本地部署 Llama、Qwen、DeepSeek、Gemma 等开源模型,永久完全免费,无任何限制,是隐私敏感场景的最佳选择。
额度 完全免费(需本地算力)
限制 依赖本地 GPU/CPU 算力
模型 llama3.3, qwen2.5, deepseek-r1, gemma2
本地部署 完全免费 无网络限制 OpenAI 兼容
vLLM
高吞吐推理引擎,自部署免费
永久免费
vLLM 是加州大学伯克利分校开源的高吞吐大模型推理引擎,支持 PagedAttention 技术,可高效部署主流开源模型,是自建推理服务的首选。
额度 完全免费(需本地算力)
限制 需要 NVIDIA GPU
模型 Llama-3.3, Qwen2.5, Mixtral
高吞吐推理 PagedAttention 分布式部署 OpenAI 兼容

免费额度构建你的 AI 应用

将多家免费 API 提供商组合使用,可大幅降低成本。建议:国际应用使用 Gemini + Groq + Cerebras;国内应用使用硅基流动 + 智谱 + DeepSeek;隐私敏感场景使用 Ollama 本地部署。每家均提供 OpenAI 兼容接口,可平滑切换。