企业网关全新版本重磅上线!现可免费开通体验~查看详情

AI模型服务

便捷部署AI模型,在模型调用中享受处理并发能力强、省钱、弹性和按量计费的推理服务

如需企业定制,联系商务:

电话:13311867760

邮箱:zhangjinhui@shengsuanyun.com

imageServerless

为什么选择胜算云的Serverless AI

弹性调度
根据模型推理服务的使用量,动态调整计算资源,在使用量激增时快速扩展计算资源,在使用量下降后缩减闲置的计算资源
快速部署
平台提供ssy工具,仅需1小时即可把模型打包上传至云平台,完成AI模型的部署
按需付费
调用模型进行推理时,平台对使用的算力按量进行计费,用户仅为实际使用的算力支付费用
并发处理能力强
使用了先进的算力调度系统和后端构架,支持高并发请求处理,用户无需再为算力问题担忧

领先的核心技术

实现了大模型在云平台的快速部署、高效推理和弹性服务,全栈优化大模型推理性能

TensorDeck
智能调度器
动态监控和分析资源的使用情况,根据模型需求、节点负载等,自动选择最佳的计算节点
TensorCabin
智算开发SDK
开发者只需按照示例简单编写模型调用代码,即可快速生成推理镜像,将镜像推送至云平台即可完成部署模型
TensorOS
自研极速容器技术
专为AI推理任务设计的容器操作系统,经过专门优化以满足AI模型推理的性能需求,缩短冷启动时间并节省内存
Cold Start Time
冷启动时间加速
团队对容器运行时进行了优化,同时采用三级存储架构,显著缩短了冷启动时间,使启动速度比其他方案快3倍

弹性模型推理

让 AI 模型从镜像交付走向按需服务

胜算云 Serverless AI 面向需要部署自有模型和推理服务的团队,通过模型打包工具、智能调度器和自研容器技术,减少基础设施管理工作,并根据实际请求动态调整算力资源。

按请求弹性调度

根据推理服务使用量扩缩计算资源,兼顾高峰并发处理与低谷资源利用率。

简化模型交付

通过工具和示例完成模型打包、镜像上传和服务部署,缩短从模型到 API 的准备路径。

按实际算力计费

推理调用期间按实际使用的计算资源计费,减少长期预留闲置 GPU 带来的成本。

模型服务上线流程

围绕模型、镜像和推理流量完成一条可持续迭代的交付链路。

  1. 1

    准备模型与推理代码

    确认模型文件、依赖环境、输入输出格式以及预计的显存和并发需求。

  2. 2

    构建并上传镜像

    参考平台工具和示例封装推理服务,将可运行镜像上传到云端。

  3. 3

    发布并验证服务

    配置计算资源和伸缩策略,通过真实请求验证延迟、并发和成本表现。

Serverless AI 常见问题

Serverless AI 适合哪些模型?
适合能够封装为推理服务的 AI 模型。具体支持情况取决于模型依赖、镜像环境、显存需求和部署配置。
使用 Serverless AI 是否需要长期租用 GPU?
页面方案采用按需使用思路,根据推理请求调度资源,用户主要为实际使用的算力付费。
模型如何部署到平台?
开发者按照示例准备调用代码,构建推理镜像并上传,再在平台配置资源后发布服务。
是否支持企业定制?
支持联系商务沟通模型部署、资源规格和企业定制需求,联系方式已在页面首屏展示。