যুক্তরাষ্ট্রের ক্যালিফোর্নিয়ায় মেটা তাদের নতুন এআই ট্রান্সক্রিপশন মডেল ‘মিউজ ভয়েস ট্রান্সক্রাইব’ উন্মোচন করেছে। মেটা সুপার ইন্টেলিজেন্স ল্যাব (এমএসআই) থেকে আনা এই মডেলটি রিয়েল-টাইমে একই সঙ্গে একাধিক ভাষা ও ২০ জনেরও বেশি বক্তার কথা আলাদাভাবে শনাক্ত করতে পারে। মেটার প্রধান নির্বাহী কর্মকর্তা মার্ক জাকারবার্গ জানিয়েছেন, নতুন এই প্রযুক্তিটি একই বাক্যে ব্যবহৃত একাধিক ভাষাও সাবলীলভাবে বুঝতে সক্ষম।
প্রযুক্তিটি কীভাবে কাজ করে
মার্ক জাকারবার্গ জানান, এই মডেলটি অডিও শোনার সময় ‘অ্যাডাপ্টিভ ডিলে’ পদ্ধতি ব্যবহার করে। কঠিন শব্দ শোনার সময় এটি কিছুটা সময় নেয় এবং সহজ শব্দ দ্রুত শনাক্ত করে নির্ভুল ফলাফল নিশ্চিত করে। মডেলটি ৭০টিরও বেশি ভাষায় প্রশিক্ষণপ্রাপ্ত এবং বর্তমানে ২৫টি ভাষা সম্পূর্ণভাবে কার্যকর। এটি এক ঘণ্টার দীর্ঘ কথোপকথন এবং একই বাক্যের মধ্যে ভাষা পরিবর্তনের বিষয়টিও নিখুঁতভাবে সামলাতে পারে।
ব্যবহারের সুযোগ
বর্তমানে মেটার ম্যাক অ্যাপে এই প্রযুক্তির ডিকটেশন ফিচারটি যুক্ত করা হয়েছে। এছাড়া ডেভেলপাররা মেটা মডেল এপিআই-এর মাধ্যমে এটি ব্যবহার করতে পারবেন। প্রতি ১,০০০ মিনিট অডিও ট্রান্সক্রিপশনের জন্য এর মূল্য নির্ধারণ করা হয়েছে ৩ ডলার। তবে গুগল জেমিনি ৩.৫ ট্রান্সক্রাইব মডেলের মতো এটি ভবিষ্যতে মেটার মূল অ্যাপগুলোতে যুক্ত করা হবে কি না, তা এখনো স্পষ্ট নয়।
মেটা সুপার ইন্টেলিজেন্স ল্যাবের এটি একটি গুরুত্বপূর্ণ নতুন সংযোজন। গত কয়েক সপ্তাহে প্রতিষ্ঠানটি কোডিং এজেন্টসহ বেশ কিছু এআই মডেল বাজারে এনেছে, যা কৃত্রিম বুদ্ধিমত্তার গবেষণায় মেটার অগ্রযাত্রাকে আরও বেগবান করছে।