Qwen Draw2Photo: তোমার স্কেচকে বাস্তবসম্মত ফটোতে রূপান্তর করো
তুমি যদি একটি মোটামুটি স্কেচ আঁকো, কারো ছবি তোলো, আর AI সেগুলোকে মিশিয়ে বাস্তবসম্মত একটা ছবি বানিয়ে দেয় — যেটা সত্যিই সেই ব্যক্তির মতো দেখায়? Qwen Draw2Photo ঠিক এটাই করে।
Draw2Photo কী?
Draw2Photo হলো আলিবাবার Tongyi Lab-এর নতুন ইমেজ জেনারেশন টেকনিক। এটা দুই ধরনের ইনপুট নেয়:
১. একটি সাদামাটা স্কেচ — মোটামুটি লাইন ড্রইং, স্টিক ফিগার বা doodle ২. একটি রেফারেন্স ফটো — কোনো ব্যক্তির ছবি
মডেল তখন একটি বাস্তবসম্মত ছবি জেনারেট করে যা স্কেচের পোজ এবং কম্পোজিশন অনুসরণ করে — আর রেফারেন্স ফটোর ব্যক্তিটির আইডেন্টিটি সংরক্ষণ করে।
এটি কীভাবে কাজ করে
মূল উদ্ভাবন হলো আইডেন্টিটি-প্রিজারভিং LoRA ফিউশন:
- স্কেচ কন্ডিশনিং — মডেল স্কেচ থেকে স্পেশাল লেআউট, পোজ এবং শেপ বুঝতে পারে
- আইডেন্টিটি প্রিজারভেশন — LoRA অ্যাডাপ্টার রেফারেন্স ফটো থেকে ফেসিয়াল ফিচার এবং চেহারা এক্সট্রাক্ট করে
- ফিউশন — জেনারেশনের সময় উভয় সিগন্যাল একত্রিত হয়, যাতে আউটপুট স্কেচের স্ট্রাকচার ম্যাচ করে আর রেফারেন্স ব্যক্তির সাদৃশ্য রাখে
প্রথাগত ইমেজ-টু-ইমেজ ট্রান্সলেশন থেকে ভিন্ন যা শুধু স্টাইল ট্রান্সফার করে, Draw2Photo আসলে উভয় ইনপুট বুঝে এবং একটি সুসংহত ফিউশন তৈরি করে।
নিজে试试 দেখো
টিম দুটি রিসোর্স শেয়ার করেছে:
- ইন্টারঅ্যাকটিভ ডেমো: Draw2Photo অনলাইনে试 করো — তোমার স্কেচ এবং ফটো আপলোড করো, ফলাফল দেখো
- LoRA ওয়েটস: LoRA ডাউনলোড করো লোকাল এক্সপেরিমেন্টেশনের জন্য
দুটোই পাবলিকলি অ্যাভেইলেবল।
কেন এটা গুরুত্বপূর্ণ
- ক্যারেক্টার ডিজাইন — গেম আর্টিস্টরা ক্যারেক্টার স্কেচ করতে পারে, রিয়েল ফেস রেফারেন্স করতে পারে, আর সাথে সাথে রিয়ালিস্টিক রেন্ডার দেখতে পারে
- কনসেপ্ট আর্ট — পূর্ণ রেন্ডারিং পাইপলাইন ছাড়াই আইডিয়া ভিজুয়ালাইজ করা
- কন্টেন্ট ক্রিয়েশন — বিভিন্ন পোজ এবং সিন জুড়ে কনসিস্টেন্ট ক্যারেক্টার ভিজুয়াল জেনারেট করা
- অ্যাক্সেসিবিলিটি — দামি GPU বা জটিল ওয়ার্কফ্লোর প্রয়োজন নেই; ডেমো অনলাইনে চলে
বিগার পিকচার
Draw2Photo AI টুলের ক্রমবর্ধমান ইকোসিস্টেমে যোগ দেয় যা ইন্টেনশন এবং আউটপুটের মধ্যে রেখা অস্পষ্ট করে দিচ্ছে। স্ট্রাকচারাল কন্ট্রোল (স্কেচ) আর আইডেন্টিটি প্রিজারভেশন (রেফারেন্স ফটো) একত্রিত করার ক্ষমতা মানে ক্রিয়েটররা আরও দ্রুত ইটারেট করতে পারে — একটা আইডিয়া স্কেচ করে সেকেন্ডের মধ্যে বাস্তবসম্মত প্রিভিউ দেখা যায়।
আরেকটা reminder যে ২০২৬ হলো সেই বছর যখন AI ইমেজ জেনারেশন “যেকোনো কিছু জেনারেট করো” থেকে “ঠিক আমি কী বোঝাতে চাই তাই জেনারেট করো”-তে স্থানান্তরিত হচ্ছে।