轻量、极速的专业级视频生成模型
官方
全场景高精度视觉文字识别
懂分寸、会认人的全能语音识别专家
懂语义、有情感的端到端语音生成引擎
全能自媒体数据采集与分析助手
个人专享的 AI 有声书制作专家
字节跳动自研的高精度文档解析引擎
化繁为简的“速写式”语音生成引擎
零样本人像一致性生成的标杆工具
革新性的长视频渐进式生成引擎
开启“声音设计”时代的开源语音大模型
高性能图像生成模型
腾讯全能视觉创作大模型
统一角色动画与替换的视觉生成引擎
音视频统一生成的工业级视觉引擎
极致速度与轻量化的视觉引擎
理解与生成一体化的全能视觉大模型
认知级“自回归+扩散”混合图像生成大模型