แปลงข้อความเป็นวิดีโอพร้อมเสียง
ฉากเคลื่อนไหวที่สมบูรณ์ซึ่งสร้างจากพรอมต์ข้อความ แสดงให้เห็นการจัดองค์ประกอบแบบภาพยนตร์ การเคลื่อนไหว จังหวะเวลา และเสียงในตัว โดยไม่ต้องใช้รูปภาพอินพุต
ทดลอง MiniMax H3 ได้ฟรีบนเบราว์เซอร์ เปลี่ยนข้อความ รูปภาพ วิดีโอ และเสียงอ้างอิงให้เป็นวิดีโอที่ถ่ายทอดอารมณ์ พร้อมเสียงสเตอริโอที่ซิงค์กัน ทำตามคำสั่งได้แม่นยำ ควบคุมงานสร้างสรรค์ได้ยืดหยุ่น และไม่ต้องติดตั้งซอฟต์แวร์
MiniMax H3 คือโมเดลสร้างเนื้อหาแบบมัลติโมดัลอเนกประสงค์ที่ออกแบบมาเพื่อเข้าใจความสัมพันธ์ระหว่างข้อความ รูปภาพ วิดีโอ และเสียง โดยรวมงานวิดีโอที่เคยแยกจากกันไว้ในระบบสร้างสรรค์เดียวที่ยืดหยุ่นยิ่งขึ้น
อธิบายความสัมพันธ์ระหว่างพรอมต์ คีย์เฟรม คลิปอ้างอิง ตัวแบบ การเคลื่อนไหว เสียงพูด เอฟเฟกต์เสียง และดนตรี โดย H3 จะตีความบริบททั้งหมดร่วมกัน แทนการมองแต่ละอินพุตเป็นงานที่แยกออกจากกัน
สร้างภาพเคลื่อนไหวและเสียงสเตอริโอ 32 kHz ที่ซิงค์กันไปพร้อมกัน ทั้งบทสนทนา เสียงบรรยากาศ เอฟเฟกต์ และดนตรีที่ส่งเสริมฉากอย่างเป็นธรรมชาติ ไม่เหมือนเสียงที่เติมเข้ามาภายหลัง
ระบบ H3 แบบครบถ้วนรองรับคลิปความยาว 4 ถึง 15 วินาที เอาต์พุต 24 FPS อัตราส่วนภาพหลากหลาย และการสร้างใหม่ตามบริบทเพื่อผลลัพธ์ 2K ที่มีรายละเอียดสูง
เริ่มจากข้อความเพียงอย่างเดียว ทำให้เฟรมแรกหรือเฟรมสุดท้ายเคลื่อนไหว เชื่อมต่อเฟรมแรกกับเฟรมสุดท้าย หรือกำหนดทิศทางวิดีโอใหม่ด้วยรูปภาพอ้างอิง คลิปวิดีโอ และแหล่งเสียงหลายรายการ
H3 ออกแบบมาเพื่องานสร้างสรรค์เชิงพาณิชย์ที่ให้ความสำคัญกับข้อความที่อ่านชัดเจน องค์ประกอบแบรนด์ที่จดจำได้ ความถูกต้องของผลิตภัณฑ์ การทำตามคำสั่ง และการแก้ไขที่ควบคุมได้
วางแผนการเคลื่อนกล้อง การเปลี่ยนฉาก ความต่อเนื่องของตัวแบบ จังหวะการกระทำ และเสียงที่พัฒนาไปตลอดหลายช็อต เพื่อสร้างเรื่องราวที่ให้ความรู้สึกเหมือนผ่านการกำกับอย่างตั้งใจ
รับชมผลลัพธ์ที่ทำซ้ำได้ซึ่งเผยแพร่ในที่เก็บ MiniMax H3 อย่างเป็นทางการ เปิดเสียงเพื่อสัมผัสการสร้างเสียงและวิดีโอร่วมกันของโมเดล
ฉากเคลื่อนไหวที่สมบูรณ์ซึ่งสร้างจากพรอมต์ข้อความ แสดงให้เห็นการจัดองค์ประกอบแบบภาพยนตร์ การเคลื่อนไหว จังหวะเวลา และเสียงในตัว โดยไม่ต้องใช้รูปภาพอินพุต
H3 ใช้คีย์เฟรมหนึ่งหรือสองเฟรมเพื่อกำหนดทิศทางภาพ จากนั้นสร้างการเคลื่อนไหวที่ต่อเนื่องและเสียงสเตอริโอระหว่างจุดยึดภาพที่กำหนด
รูปภาพ คลิป การเคลื่อนไหว หรือเสียงอ้างอิงสามารถกำหนดอัตลักษณ์ รูปลักษณ์ การกระทำ เสียงพูด และบรรยากาศภายในผลลัพธ์ที่สร้างขึ้นใหม่ได้
นักพัฒนาสามารถดาวน์โหลดเช็กพอยต์ H3-Base ที่เปิดตัวแล้ว และให้บริการเวิร์กโฟลว์แปลงข้อความเป็นวิดีโอ เฟรมเป็นวิดีโอ หรือข้อมูลอ้างอิงเป็นวิดีโอด้วยเฟรมเวิร์กอนุมานแบบเปิดที่รองรับ
ใช้ FL2VA สำหรับการแปลงข้อความเป็นวิดีโอและการสร้างจากเฟรมแรกหรือเฟรมสุดท้าย เลือก Ref2VA เมื่อเวิร์กโฟลว์ต้องใช้รูปภาพ วิดีโอ และเสียงอ้างอิงร่วมกัน
ดาวน์โหลดเฉพาะชุดงานที่การปรับใช้ของคุณต้องการจาก MiniMaxAI/MiniMax-H3 บน Hugging Face ซึ่งรวมถึง processor, tokenizer, encoder, transformer, visual VAE และ audio VAE
ทำตามแนวทางอย่างเป็นทางการสำหรับ SGLang, vLLM, Diffusers หรือ ComfyUI ตรวจสอบความถูกต้องด้วยสคริปต์ 768p ที่ทำซ้ำได้จากที่เก็บ ก่อนปรับไปป์ไลน์ให้เข้ากับผลิตภัณฑ์ของคุณ
hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "FL2VA/*"sglang serve --model-path MiniMaxAI/MiniMax-H3 --num-gpus 4 --model-variant fl2vaสำคัญ: รุ่นเปิดในปัจจุบันมีเช็กพอยต์ H3-Base สำหรับการสร้างที่ 768p ส่วน H3-Context-IR และ H3-Regenerate-2K เป็นโมดูลที่ให้บริการบนโฮสต์และไม่รวมอยู่ในรุ่นโอเพนซอร์สปัจจุบัน โปรดตรวจสอบ MiniMax H3 Community License และคำแนะนำด้านฮาร์ดแวร์อย่างเป็นทางการก่อนปรับใช้จริง
สำรวจ MiniMax H3 บน GitHubต่อยอดจากการใช้งานฟรีบนเบราว์เซอร์ไปสู่ endpoint ที่พร้อมสำหรับนักพัฒนา เลือกโหมด H3 API ที่เหมาะกับสื่อต้นฉบับและเวิร์กโฟลว์การผลิตของคุณ
สร้างคลิปวิดีโอพร้อมเสียงจากพรอมต์ภาษาธรรมชาติสำหรับแนวคิดเรื่องราว ฉากภาพยนตร์ โฆษณา เนื้อหาโซเชียล ไอเดียผลิตภัณฑ์ และไปป์ไลน์วิดีโออัตโนมัติ
ดูรายละเอียด APIทำให้รูปภาพต้นฉบับหรือคีย์เฟรมเคลื่อนไหว พร้อมควบคุมการเคลื่อนไหวของตัวแบบ ทิศทางกล้อง พฤติกรรมของฉาก จังหวะเวลา และเสียงที่ซิงค์กันผ่านคำสั่งข้อความ
ดูรายละเอียด APIสร้างเวิร์กโฟลว์ที่ขับเคลื่อนด้วยข้อมูลอ้างอิง โดยใช้รูปภาพ วิดีโอ และเสียงเพื่อกำหนดตัวแบบ อัตลักษณ์ การเคลื่อนไหว เสียงพูด บรรยากาศ การตัดต่อ และสไตล์ได้ในคำขอเดียว
ดูรายละเอียด APIH3 ออกแบบมาเพื่อมากกว่าการสร้างคลิปเดี่ยว บริบทมัลติโมดัลและการสร้างเสียงร่วมกับวิดีโอรองรับงานสร้างสรรค์ที่ใช้งานได้จริงทั้งด้านการตลาด ความบันเทิง การค้า และการออกแบบผลิตภัณฑ์
สร้างวิดีโอเปิดตัวผลิตภัณฑ์ แนวคิดแคมเปญ ภาพเคลื่อนไหวของแบรนด์ ฉากไลฟ์สไตล์ บทสนทนาโปรโมชัน โปสเตอร์เคลื่อนไหว และโฆษณาหลากหลายเวอร์ชันได้อย่างรวดเร็ว พร้อมความสม่ำเสมอของข้อความและผลิตภัณฑ์ที่ดียิ่งขึ้น
กำกับการเคลื่อนกล้อง การกระทำของตัวละคร การเปลี่ยนช็อต บทสนทนา เสียงบรรยากาศ เอฟเฟกต์ และดนตรีด้วยพรอมต์เดียว สำหรับลำดับภาพแบบภาพยนตร์และต้นแบบการเล่าเรื่อง
ใช้ภาพและการเคลื่อนไหวอ้างอิงเพื่อรักษาตัวแบบหรือรูปแบบการเคลื่อนไหวไว้ พร้อมเปลี่ยนสภาพแวดล้อม สไตล์ การแสดง เสียงพูด หรือทิศทางสร้างสรรค์
สร้างต้นแบบฉากภาพยนตร์ในเกม ภาพเคลื่อนไหวของอินเทอร์เฟซ ภาพสำหรับการเปิดตัว เว็บไซต์ผลิตภัณฑ์ การสาธิตแนวคิด และแอสเซตสำหรับประสบการณ์เชิงโต้ตอบ ก่อนเดินหน้าสู่การผลิตเต็มรูปแบบ
สร้างสรรค์ต่อด้วยเครื่องมือสร้างภาพ AI โปรแกรมแก้ไข และเครื่องมือมัลติโมดัลฟรี สำหรับแนวคิดด้านภาพ โฆษณา ผลิตภัณฑ์ ภาพบุคคล เนื้อหาโซเชียล และการทดลองงานผลิต
สำรวจเครื่องมือ AI ที่เพิ่งเพิ่มใน Artiverse AI และค้นหาตัวเลือกใหม่สำหรับเวิร์กโฟลว์การสร้างสรรค์ของคุณ
ApiFlux AI - แพลตฟอร์มจัดการ API ที่ขับเคลื่อนด้วย AI สำหรับวงจรชีวิต API และการผสานรวมแบบอัตโนมัติ
ส่งเครื่องมือ AI ของคุณไปยัง Artiverse AI เพื่อรับลิงก์ dofollow เข้าถึงผู้เข้าชมมากขึ้น เพิ่ม referral traffic และเสริมความน่าเชื่อถือของเว็บไซต์
คำตอบสำคัญเกี่ยวกับการใช้งานออนไลน์ฟรี อินพุตที่รองรับ คุณภาพเอาต์พุต การปรับใช้แบบเปิด ตัวเลือก API และการใช้งานอย่างรับผิดชอบ
สำรวจคู่มือเชิงปฏิบัติ การเปรียบเทียบโมเดล ไอเดียการเขียนพรอมต์ เวิร์กโฟลว์วิดีโอมัลติโมดัล และเทคนิคสร้างสรรค์สำหรับผลิตวิดีโอและเสียงที่สร้างด้วย AI ให้ดียิ่งขึ้น