HeyGen: Avatar IV — это модель преобразования изображения в видео, которая анимирует одну фотографию, превращая ее в выразительное видео с говорящей головой, синхронизированное по губам. Вместо того чтобы просто сопоставлять формы рта со словами, она интерпретирует тон голоса, ритм и эмоции аудио, чтобы управлять движением головы, выражением лица и жестами, создавая выходное изображение с разрешением до 1080p. Речевое аудио поступает из одного из двух источников: текстового сценария, который модель озвучивает с помощью преобразования текста в речь HeyGen, или предоставленной аудиодорожки, с которой изображение напрямую синхронизируется по губам. Параметры сквозной передачи позволяют выбрать голос, настроить параметры голоса, установить выразительность, задать определенное движение, заменить или удалить фон, добавить субтитры и назвать видео.
import requests
r = requests.post(
"https://infergate.ru/api/v1/videos",
headers={"Authorization": "Bearer sk-•••"},
json={
"model": "heygen/avatar-iv",
"prompt": "Кот на волне на закате",
"duration": 8,
},
)
job = r.json()
# опрашивайте polling_url, пока status != "completed"
print(job["id"], job["polling_url"])modelstringобязательныйpromptstringобязательныйГенерация медиа (аудио/изображения) тарифицируется по фактической стоимости провайдера — итоговая цена хода видна в чате сразу после ответа.