深度介绍
Together AI详细介绍 🚀 Serverless 推理:一行改地址就能接 官网把 Serverless Inference 描述为「以 API 形式提供的高性能推理」,覆盖 Chat、Image、Code、Vision、Video 五类模型,文档提供 Python 与 Node.js 的调用方式。这类服务的典型用法是把现有代码里的 base_url 换成 Together 的地址、填上自己的 API Key 即可跑通,无需自己准备显卡或维护推理进程;官方定价页同时给出每个模型的价格与 Batch API 价格,选型时可以直接横向比价。对于用量不大或流量波动明显的团队,这一档是官方建议的起点。
💸 价格公开到输入、输出、缓存三档 定价页把主流模型的「每 100 万 token」价格逐项列出,并区分输入、输出与缓存命中三档,这是评估真实成本时最有用的一栏。页面上的几个例子:Kimi K3 输入 3 美元、输出 15 美元;GLM-5.3 为 1.40 / 4.40 美元;GLM-5.3-Flash 为 0.15 / 0.50 美元;DeepSeek V4 Pro 0813 为 1.32 / 3.96 美元;Qwen3.8-2.4T-A95B 为 2.00 / 6.00 美元;DeepSeek V4.1 Flash 为 0.30 / 1.20 美元。图像、视频与语音模型则按件计价,例如 FLUX.2 [pro] 每张 0.03 美元、Imagen 4.0 Ultra 每张 0.06 美元、Sora 2 每条 0.80 美元、Whisper Large v3 每分钟 0.0015 美元,页面也注明显示价对应最低分辨率或时长档位。
📦 Batch 推理与专属吞吐 除了即时调用,平台提供面向批量任务的 Batch Inference:定价表为同一批模型单独列出 Batch API 价格,适合把离线打分、数据清洗、内容批量生成这类不要求即时返回的活集中跑完。再往上一档是 Provisioned Throughput,官方的描述是「按 token 的容量并附带 SLA」,也就是预先约定吞吐量而不是与其他人共享弹性池,用来稳住高峰期的延迟表现;官方在推理页写得很直白:多数团队从 Serverless 起步,规模化之后转向专属端点。
🖥 GPU 集群:H100 / H200 / B200 / GB200 算力这一侧,官方提供 GPU Clusters,芯片档位包括 HGX H100、HGX H200、HGX B200 与 GB200 NVL72,定价页明确写「All prices per gpu per hour」,并同时给出按需与多档预留价格,越长周期的预留单价越低;页面另标注了一个促销价及截止日期,以及支持「按小时付费的按需 GPU 容量」。官网顶部公告显示按需 B200 现已在 GPU Clusters 开放。对训练或大规模推理来说,这一档的关键是可以按自己的并行与显存需求选卡型,而不必被单一机型绑住。
🧰 专用推理与自定义容器 当模型或依赖无法直接用标准 Serverless 端点时,官方提供两条路:Dedicated Model Inference 在自有硬件上跑指定模型,Dedicated Container Inference 则允许把自定义模型连同运行环境一起部署。配套还有 AI Factory 一档,官方描述为「面向前沿规模的定制基础设施」。这些档位没有公开单价(定价页对应位置写的是联系销售),因此成本需要按集群报价单独谈;对已有自研模型权重、又不想自建 Kubernetes 推理栈的团队,这类托管方式是折中方案。
🎛 微调:按训练数据 token 计费 Fine-Tuning 支持主流开源模型。定价页写明了计费口径:费用按「训练数据集大小 × 训练轮数」得出的 token 总量计算,若附带评估数据集,再叠加「评估集大小 × 评估次数」的 token;每个模型都设有一个最低收费额,低于该额度也按最低额结算。这样一来微调成本是可以预先估算的:先看数据量与轮数,再对照该模型的单价与最低收费。页面上还分列了按需与预留两套微调价格,预留单价明显更低。
🧪 Sandbox 与共享存储 面向开发与验证环节,官方提供 Sandbox 开发环境,定价按资源逐项列出:每 vCPU 每小时 0.0446 美元、每 GiB 内存每小时 0.0149 美元,代码解释器会话按 60 分钟 0.03 美元计,另有共享文件系统 0.16 美元/GiB/月。这类档位的意义在于把「跑一段代码看看效果」和「长期占一张卡」分开计价,适合在正式采购推理或集群容量之前做小规模验证;它的计费粒度也说明平台整体思路是把算力拆细再卖。
📚 模型库以开放权重模型为主 模型库里能看到 Kimi K3 与 Kimi K2.7 Code、DeepSeek V4 Pro 0813 与 V4.1 Flash、Qwen3.8-2.4T-A95B 与 Qwen3.5 系列、GLM-5.3 与 GLM-5.2、Gemma 4 31B、Llama 3.3 70B、MiniMax M3、Muse Glimmer 30B、Inkling 等文本模型,以及 FLUX.2 系列、Imagen 4.0、Seedream、Vidu、PixVerse、Veo 2、Hailuo 等图像与视频模型。以开放权重模型为主的组合有个实际好处:如果哪天要自建推理,同一份权重可以在别的平台上跑,迁移成本主要是重新调接口,而不是重训模型。
产品特点
核心功能与独有价值 01 同一家既卖 token 也卖 GPU 小时 多数推理服务只卖 API 调用量,Together AI 的定位是「AI 原生云」:推理侧有 Serverless、Batch、专属吞吐与专用实例,算力侧直接出租 HGX H100/H200/B200 与 GB200 NVL72 集群,再往下还有 Sandbox 开发环境与共享存储。对需要同时用托管 API 和自有集群的团队,这种组合省掉了跨厂商结算与网络打通的麻烦。
02 价格表细到三档 token 与多档预留 官方定价页把输入、输出、缓存命中分开标价,Batch 另有单独价目,GPU 与微调又各自列出按需与多档预留价格。预留周期越长单价越低,且微调写明按训练数据 token 总量计费并设有最低收费。这种透明度方便在动手之前把账单算清楚,也方便在同类平台之间横向比较。
03 官方直说从 Serverless 走向专用 推理页面给出了一句很实用的路径描述:多数团队从 Serverless 推理起步,规模化后再转向专属端点。也就是说同一个 API 形态可以平滑升级到专属容量,而不必一开始就为峰值买单;对预算有限的团队,这比一次性采购集群要稳。
04 以开放权重模型为主,留了退路 平台主推的是 Kimi、DeepSeek、Qwen、GLM、Gemma、Llama、MiniMax、FLUX 这类开放权重模型,而不是自研闭源模型。好处是锁定风险较低:相同权重可以在别处自托管,迁移主要改接口与推理配置;代价是不同平台的推理优化程度不同,实际速度与成本仍需按自己的负载实测。
最近动态
重要更新 2026-09-09 官方博客发布《The Open Source AI Stack》 官方博客 2026 年 9 月 9 日发布《The Open Source AI Stack: models, inference, routers, harnesses & tools》,从模型、推理、路由、harness 到工具链梳理其开源 AI 栈的组成。这篇文章能当作理解该平台产品边界的入口:它把「卖 token」与「卖算力」放在同一条栈里讲,也解释了为什么平台同时提供推理 API、Semantic Router 一类组件与 GPU 集群。
2026-09 定价页公告:GPU 集群促销价设了截止日 定价页在 GPU 集群区域标注了一个促销价并写明「Promotion valid until 09/30/26」,即该档价格在 2026 年 9 月 30 日前有效;同一区域列出 HGX H100、H200、B200 与 GB200 NVL72 的多档价格,并注明越长周期的预留单价越低。涉及采购时,促销与预留档位都应以官网当期页面为准。
2026-09 按需 B200 在 GPU Clusters 开放 官网顶部公告显示「On-demand B200s now available on Together GPU Clusters」,即 HGX B200 已可按需开通,链接指向控制台的集群创建页。对需要大显存与新一代算力的训练或推理任务,这提供了不必长期预留即可试用的入口;同时定价页仍保留了 B200 的预留档位与联系销售档。
2026-08-18 官方博客做成本与路由对比实验 官方博客 2026 年 8 月 18 日发布了一篇把 DeepSeek V4 Pro 0813 与前沿闭源模型放在 DeepSWE 任务上比较成本与路由的文章,结论围绕「同一任务该用哪一档模型、路由后能省多少」。这类文章配合定价页的三档 token 价格一起看,比较适合拿来做自己业务里的模型选型与预算推演,但具体数字仍需按自己的负载复测。
产品总结 Together AI 官方定位是「The AI Native Cloud」,也就是同时做模型推理与 GPU 算力两件事。推理侧提供 Serverless Inference(以 API 形式调用 Chat、Image、Code、Vision、Video 五类模型)、Batch Inference(面向批量任务,定价页单独列出便宜一些的 Batch API 价)、Provisioned Throughput(按 token 的专属容量并附带 SLA)以及 Dedicated Model Inference 与 Dedicated Container Inference 两种专用部署;算力侧直接出租 GPU 集群,芯片档位包括 HGX H100、HGX H200、HGX B200 与 GB200 NVL72,定价页写明「All prices per gpu per hour」并给出按需与多档预留价,越长周期单价越低。 价格透明度是这家平台比较突出的一点:主流模型按每 100 万 token 分别标出输入、输出与缓存命中三档,例如 Kimi K3 是 3 / 15 美元、GLM-5.3 是 1.40 / 4.40 美元、GLM-5.3-Flash 是 0.15 / 0.50 美元、DeepSeek V4 Pro 0813 是 1.32 / 3.96 美元;图像、视频与语音模型按件计价,例如 FLUX.2 [pro] 每张 0.03 美元、Imagen 4.0 Ultra 每张 0.06 美元、Sora 2 每条 0.80 美元。微调按「训练数据大小 × 轮数」的 token 总量计费,评估集再叠加,且每个模型设有最低收费。 开发与验证环节另有 Sandbox 开发环境(每 vCPU 每小时 0.0446 美元、每 GiB 内存每小时 0.0149 美元、代码解释器会话 60 分钟 0.03 美元)与共享文件系统(0.16 美元/GiB/月)。模型库以开放权重模型为主,文本侧有 Kimi、DeepSeek、Qwen、GLM、Gemma、Llama、MiniMax 等系列,图像与视频侧有 FLUX.2、Imagen 4.0、Veo 2 等;文档提供 Python 与 Node.js 的接入方式。 官方在推理页面写明了推荐路径:多数团队从 Serverless 推理起步,规模化后再转向专属端点;定价页面对专用实例与 AI Factory 档位不公开单价,需要联系销售按集群报价。使用时需要注意几点:显示价格对应最低分辨率或时长档位,实际账单会随参数上浮;GPU 集群与微调分按需价与预留价两套,采购前应确认所选档位;开放权重模型本身的许可各不相同,商用前要单独核对模型卡。整体而言,它适合既要托管推理 API、又可能需要自有 GPU 容量,并且希望先把成本算清楚的团队。
产品类型 模型推理云与 GPU 算力平台
支持平台 REST API(OpenAI 兼容) / Python SDK / Node.js SDK / Serverless 推理 / Batch 推理 / 专属吞吐与专用实例 / GPU 集群 / Sandbox 开发环境
资费模式 按用量计费:Serverless 按每百万 token 分输入、输出、缓存三档价格,Batch 单独标价;GPU 集群按每 GPU 每小时列出多档。 用户体验调查 Together AI介绍页面对您是否有帮助?
很有帮助 👍 一般 😊 需要改进 👎