Chuyển văn bản thành video có âm thanh
Một cảnh chuyển động hoàn chỉnh được tạo từ câu lệnh bằng văn bản, thể hiện bố cục điện ảnh, chuyển động, nhịp độ và âm thanh nguyên bản mà không cần hình ảnh đầu vào.
Dùng thử MiniMax H3 hoàn toàn miễn phí ngay trên trình duyệt. Biến văn bản, hình ảnh, video và tham chiếu âm thanh thành video giàu biểu cảm với âm thanh stereo đồng bộ, khả năng làm theo chỉ dẫn chính xác, quyền kiểm soát sáng tạo linh hoạt và không cần cài đặt phần mềm.
MiniMax H3 là mô hình tạo sinh đa phương thức đa dụng, được xây dựng để hiểu mối liên hệ giữa văn bản, hình ảnh, video và âm thanh. Mô hình hợp nhất các tác vụ video vốn tách biệt trước đây trong một hệ thống sáng tạo linh hoạt hơn.
Mô tả mối quan hệ giữa câu lệnh, khung hình chính, đoạn video tham chiếu, chủ thể, chuyển động, giọng nói, hiệu ứng âm thanh và âm nhạc. H3 diễn giải ngữ cảnh kết hợp thay vì xem mỗi đầu vào là một tác vụ riêng biệt.
Tạo đồng thời chuyển động hình ảnh và âm thanh stereo 32 kHz được đồng bộ, bao gồm lời thoại, âm thanh môi trường, hiệu ứng và âm nhạc hỗ trợ cho cảnh quay thay vì tạo cảm giác được thêm vào sau.
Hệ thống H3 hoàn chỉnh hỗ trợ video dài từ 4 đến 15 giây, đầu ra 24 FPS, nhiều tỷ lệ khung hình và khả năng tái tạo theo ngữ cảnh để mang lại kết quả 2K có độ chi tiết cao.
Bắt đầu chỉ từ văn bản, tạo chuyển động cho khung hình đầu hoặc cuối, kết nối khung hình đầu và cuối, hoặc định hướng video mới bằng nhiều hình ảnh tham chiếu, đoạn video và nguồn âm thanh.
H3 được thiết kế cho công việc sáng tạo thương mại, nơi văn bản dễ đọc, yếu tố thương hiệu dễ nhận diện, độ trung thực của sản phẩm, khả năng tuân thủ chỉ dẫn và các chỉnh sửa có kiểm soát đều quan trọng.
Lên kế hoạch chuyển động máy quay, chuyển cảnh, tính liên tục của chủ thể, nhịp độ hành động và âm thanh phát triển xuyên suốt nhiều cảnh quay để tạo nên câu chuyện có chủ đích đạo diễn rõ ràng.
Xem các kết quả có thể tái tạo được công bố trong kho lưu trữ MiniMax H3 chính thức. Bật âm thanh để trải nghiệm khả năng tạo âm thanh-video đồng thời của mô hình.
Một cảnh chuyển động hoàn chỉnh được tạo từ câu lệnh bằng văn bản, thể hiện bố cục điện ảnh, chuyển động, nhịp độ và âm thanh nguyên bản mà không cần hình ảnh đầu vào.
H3 sử dụng một hoặc hai khung hình chính để xác lập hướng hình ảnh, sau đó tạo chuyển động liền mạch và âm thanh stereo giữa các điểm neo hình ảnh được cung cấp.
Hình ảnh, đoạn video, chuyển động hoặc âm thanh tham chiếu có thể định hướng danh tính, diện mạo, hành động, giọng nói và bầu không khí trong kết quả mới được tạo.
Nhà phát triển có thể tải các checkpoint H3-Base đã phát hành và phục vụ quy trình chuyển văn bản thành video, khung hình thành video hoặc tham chiếu thành video bằng các framework suy luận mở được hỗ trợ.
Sử dụng FL2VA để chuyển văn bản thành video và tạo video từ khung hình đầu/cuối. Chọn Ref2VA khi quy trình của bạn cần kết hợp hình ảnh, video và âm thanh tham chiếu.
Chỉ tải nhóm tác vụ mà hệ thống triển khai của bạn cần từ MiniMaxAI/MiniMax-H3 trên Hugging Face, bao gồm processor, tokenizer, encoder, transformer, visual VAE và audio VAE.
Làm theo hướng dẫn chính thức dành cho SGLang, vLLM, Diffusers hoặc ComfyUI. Xác thực bằng các script 768p có thể tái tạo của kho lưu trữ trước khi điều chỉnh pipeline cho sản phẩm của bạn.
hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "FL2VA/*"sglang serve --model-path MiniMaxAI/MiniMax-H3 --num-gpus 4 --model-variant fl2vaQuan trọng: bản phát hành mở hiện bao gồm các checkpoint H3-Base để tạo video 768p. H3-Context-IR và H3-Regenerate-2K là các mô-đun được lưu trữ và không có trong bản phát hành mã nguồn mở hiện tại. Hãy xem xét Giấy phép cộng đồng MiniMax H3 và hướng dẫn phần cứng chính thức trước khi triển khai trong môi trường production.
Khám phá MiniMax H3 trên GitHubChuyển từ trải nghiệm miễn phí trên trình duyệt sang endpoint sẵn sàng cho nhà phát triển. Chọn chế độ API H3 phù hợp với tư liệu nguồn và quy trình production của bạn.
Tạo các đoạn video có âm thanh từ câu lệnh ngôn ngữ tự nhiên cho ý tưởng câu chuyện, cảnh điện ảnh, quảng cáo, nội dung mạng xã hội, ý tưởng sản phẩm và pipeline video tự động.
Xem chi tiết APITạo chuyển động cho hình ảnh nguồn hoặc khung hình chính, đồng thời kiểm soát chuyển động của chủ thể, hướng máy quay, diễn biến cảnh, nhịp độ và âm thanh đồng bộ bằng chỉ dẫn văn bản.
Xem chi tiết APIXây dựng quy trình dựa trên tham chiếu, sử dụng hình ảnh, video và âm thanh để định hướng chủ thể, danh tính, chuyển động, giọng nói, bầu không khí, biên tập và phong cách trong một yêu cầu duy nhất.
Xem chi tiết APIH3 được thiết kế cho nhiều mục đích hơn các đoạn video riêng lẻ. Ngữ cảnh đa phương thức và khả năng tạo âm thanh đồng thời hỗ trợ sản xuất nội dung sáng tạo thực tế trong tiếp thị, giải trí, thương mại và thiết kế sản phẩm.
Tạo video ra mắt sản phẩm, ý tưởng chiến dịch, chuyển động mang thương hiệu, cảnh phong cách sống, lời thoại quảng bá, poster động và nhiều biến thể quảng cáo nhanh chóng với độ nhất quán cao hơn về văn bản và sản phẩm.
Điều khiển chuyển động máy quay, hành động nhân vật, thay đổi cảnh quay, lời thoại, âm thanh môi trường, hiệu ứng và âm nhạc trong một câu lệnh hợp nhất để tạo chuỗi cảnh điện ảnh và nguyên mẫu kể chuyện.
Sử dụng tham chiếu hình ảnh và chuyển động để giữ nguyên chủ thể hoặc mẫu chuyển động trong khi thay đổi môi trường, phong cách, phần trình diễn, giọng nói hoặc định hướng sáng tạo.
Tạo nguyên mẫu cảnh điện ảnh trong game, chuyển động giao diện, hình ảnh ra mắt, website sản phẩm, bản trình diễn ý tưởng và tài nguyên trải nghiệm tương tác trước khi đầu tư vào sản xuất hoàn chỉnh.
Tiếp tục sáng tạo với các trình tạo ảnh AI, công cụ chỉnh sửa và công cụ đa phương thức miễn phí dành cho ý tưởng hình ảnh, quảng cáo, sản phẩm, chân dung, nội dung mạng xã hội và thử nghiệm production.
Khám phá các công cụ AI mới được thêm vào Artiverse AI và tìm thêm lựa chọn cho quy trình sáng tạo của bạn.
Gửi công cụ AI lên Artiverse AI để nhận liên kết dofollow, tiếp cận nhiều khách truy cập hơn, tăng traffic giới thiệu và nâng cao uy tín website.
Các giải đáp quan trọng về trải nghiệm trực tuyến miễn phí, đầu vào được hỗ trợ, chất lượng đầu ra, triển khai mở, tùy chọn API và cách sử dụng có trách nhiệm.
Khám phá hướng dẫn thực tế, so sánh mô hình, ý tưởng viết câu lệnh, quy trình video đa phương thức và kỹ thuật sáng tạo để sản xuất video và âm thanh do AI tạo ra tốt hơn.