编程 AMD Token Factory 免费模型 API:DeepSeek-V4-Flash 百万 Token 上下文,兼容 OpenAI/Anthropic

2026-09-03 18:37:56

AMD Token Factory 免费模型 API:DeepSeek-V4-Flash 百万 Token 上下文,兼容 OpenAI/Anthropic

AMD 在 Radeon Cloud 上线了 Token Factory,直接提供 Public Free Model APIs。里面包含了多个开源模型调用入口,同时提供 OpenAI 和 Anthropic 两套兼容接口。

AMD 专门给出了中国区地址,国内直接访问即可。

怎么领取?

进入 Token Factory 后先注册或登录 AMD 开发者账号,然后找到页面里的 Public Free Model APIs。

点开任意一个免费模型,会看到模型名称、Base URL 和自己的 API Key,把 API Key 复制下来即可。

这个 Key 是共享的,不需要每个模型单独创建一套 Key。同一个 Key 可以调用当前 Token Factory 里提供的多个免费模型,只需要在请求里切换 model 字段。

最简单的测试方式:

export AMD_API_KEY="你的 API Key"

curl https://developer.amd.com.cn/radeon/api/v1/chat/completions \
  -H "Authorization: Bearer $AMD_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "DeepSeek-V4-Flash",
    "messages": [
      {
        "role": "user",
        "content": "写一个 Go 实现的 LRU Cache"
      }
    ]
  }'

如果能正常返回内容,说明 Key 已经可以用了。

有哪些免费模型?

包括:

  • DeepSeek-V4-Flash
  • DeepSeek-V4-Flash-Vision-Exp
  • Qwen3.8-Flash-Next
  • MiniCPM5-1B
  • 以及部分时间段出现过的其他 MiniCPM 模型

截至 AMD 官方文档 8 月 31 日的记录,GET /v1/models 能看到当前可用模型的最终列表。实际请求如下:

curl https://developer.amd.com.cn/radeon/api/v1/models \
  -H "Authorization: Bearer $AMD_API_KEY"

返回什么,就说明当前这个 Key 可以用什么。

其中最值得试的是 DeepSeek-V4-Flash。AMD 当前提供的版本拥有 1,048,576 Token 上下文,也就是差不多 100 万 Token。

Qwen3.8-Flash-Next 则是 262,144 Token,也就是 256K 上下文。

两款目前都支持 Streaming、Tool Calling 和 Thinking。如果拿来跑 Coding Agent,100 万上下文相当够用。

免费额度有多少?

AMD 提供了专门的 Usage API,可以查询 RPM 限制以及当天已经消费的额度。

官方文档给出的返回示例:

rpm_limit: 30
daily_cost_limit_usd: 10
daily_cost_used_usd: 1.8412
daily_cost_remaining_usd: 8.1588

也就是示例账户每天拥有 10 美元的模型调用额度

不过这里有一个重要的细节:AMD 明确说明,不同账户的额度可能不同,而且以后也可能调整。

所以自己账号到底有多少,直接查接口最准确:

curl "https://radeon-global.anruicloud.com/api/profile/model-usage?include_recent=true" \
  -H "Authorization: Bearer $AMD_API_KEY"

看返回里的这两个字段:

daily_cost_limit_usd
daily_cost_remaining_usd

有限速吗?

有,而且 AMD 这次把具体数字也写出来了。

Public Free Model API 的典型限制:

  • 单 API Key:30 请求/分钟
  • 单 IP:120 请求/分钟
  • 单 API Key 并发:8
  • 账户网关:20 请求/分钟

也就是说,对于普通个人账号,实际最容易先碰到的是账户层面的 20 RPM,平均每 3 秒才能请求一次,同时建议最多控制在 8 个并发以内。

所以如果接进 Agent 或批处理程序里,最好自己做队列,把并发限制在 8 以内,并且对 429 响应做退避重试。

对于普通 AI Coding、聊天、翻译、代码 Review、Agent Tool Call 来说,这个额度完全够用。

复制全文 生成海报 API AI Coding Agent DeepSeek

推荐文章

程序员茄子在线接单