
Photo by Filip Szyller on Pexels
বাংলা অডিও বা ভিডিও ফাইল থেকে হাতে লিখে টেক্সট বা সাবটাইটেল তৈরি করাটা রীতিমতো যুদ্ধ জেতার মতো। গবেষণা, কনটেন্ট তৈরি, বা ক্লাসের লেকচার—যে কোনো ক্ষেত্রেই এই কাজটি সময় ও শ্রমের দিক থেকে বেশ চ্যালেঞ্জিং। যখনই কোনো গুরুত্বপূর্ণ বাংলা অডিওকে টেক্সটে রূপান্তর করতে হয়, তখনই মনে হয় যদি কোনো ম্যাজিক টুল থাকতো যা এই কাজটি চুটকিতে করে দিত! সুসংবাদ হলো, সেই ম্যাজিক টুলটি এখন আপনার হাতের মুঠোয়, এবং এর নাম Whisper। OpenAI দ্বারা তৈরি এই ওপেন-সোর্স এআই মডেলটি বাংলাসহ অসংখ্য ভাষার অডিওকে নির্ভুলভাবে টেক্সটে রূপান্তর করতে পারে, এবং সবচেয়ে ভালো দিক হলো, আপনি এটি বিনামূল্যে ব্যবহার করতে পারবেন।
Whisper হলো OpenAI দ্বারা তৈরি একটি ওপেন-সোর্স এআই মডেল যা বিশ্বজুড়ে বহু ভাষার অডিওকে টেক্সটে (speech-to-text) রূপান্তর করতে অসাধারণ পারফরম্যান্স দেখায়, বিশেষ করে বাংলা ভাষার ক্ষেত্রে এর উচ্চ নির্ভুলতা একে অত্যন্ত কার্যকর করে তোলে।
Whisper (হুইস্পার) হলো একটি শক্তিশালী অটোমেটিক স্পিচ রিকগনিশন (ASR) সিস্টেম, যা OpenAI তৈরি করেছে। এটি লক্ষ লক্ষ ঘণ্টা মাল্টিলিঙ্গুয়াল এবং মাল্টিটাস্ক সুপারভাইজড ডেটার উপর প্রশিক্ষণপ্রাপ্ত। এর মানে হলো, এটি শুধু অডিওকে টেক্সটে রূপান্তর করতেই পারদর্শী নয়, বরং এটি ভাষা সনাক্তকরণ (language identification), ভয়েস অ্যাক্টিভিটি ডিটেকশন (VAD) এবং ভাষা অনুবাদ (language translation) এর মতো কাজগুলোও করতে পারে।
বাংলা ভাষার জন্য Whisper-এর কার্যকারিতা কয়েকটি কারণে অসাধারণ:
উদাহরণস্বরূপ, একটি পডকাস্টের প্রায় ৩০ মিনিটের বাংলা অডিও ফাইল যা সাধারণ разговорের গতিতে ধারণ করা হয়েছে, Whisper তাকে প্রায় ৯০-৯৫% নির্ভুলতার সাথে টেক্সটে রূপান্তর করতে পারে। এটি কেবল শব্দের প্রতিশব্দই নয়, বরং সঠিক বাক্য গঠন এবং অর্থও বুঝতে চেষ্টা করে, যা পরবর্তীতে এডিটিংয়ের কাজকে অনেক সহজ করে তোলে। এই ধরনের সেরা এআই টুলস শিক্ষার্থীদের এবং কনটেন্ট ক্রিয়েটরদের জন্য অপরিহার্য হয়ে উঠেছে।
Whisper বিনামূল্যে বাংলা অডিও ট্রান্সক্রিপশন এবং সাবটাইটেল তৈরির জন্য অতুলনীয় গতি, নির্ভুলতা এবং খরচ-সাশ্রয়ী সুবিধা প্রদান করে, তবে এর ব্যবহারের জন্য কিছু কম্পিউটেশনাল রিসোর্সের প্রয়োজন হয় এবং কোলাব বা স্থানীয় সেটআপের জন্য কিছুটা টেকনিক্যাল জ্ঞান দরকার হতে পারে।
অন্য যেকোনো প্রযুক্তির মতো, Whisper-এরও নিজস্ব সুবিধা এবং সীমাবদ্ধতা রয়েছে। এগুলো ভালোভাবে জানা থাকলে আপনি এর থেকে সর্বোচ্চ সুবিধা নিতে পারবেন।
বৈশিষ্ট্য | ম্যানুয়াল ট্রান্সক্রিপশন | Whisper AI ট্রান্সক্রিপশন |
|---|---|---|
গতি | খুব ধীর (যেমন: ১ ঘণ্টার অডিওতে ৫-১০ ঘণ্টা) | অত্যন্ত দ্রুত (যেমন: ১ ঘণ্টার অডিওতে ৫-১৫ মিনিট, হার্ডওয়্যার নির্ভর) |
খরচ | সময়=টাকা, তাই অনেক ব্যয়বহুল | বিনামূল্যে (হার্ডওয়্যার/কোলাব রিসোর্স খরচ বাদে) |
নির্ভুলতা | মানুষের নির্ভুলতা (তবে ক্লান্তি বা মনোযোগের অভাব ভুল বাড়ায়) | উচ্চ নির্ভুলতা (তবে অ্যাকসেন্ট বা নয়েজে সামান্য ভুল হতে পারে) |
সমন্বয় | কঠিন (বারবার প্লে-ব্যাক) | স্বয়ংক্রিয় টাইমস্ট্যাম্প সহ সাবটাইটেল তৈরি |
প্রাপ্যতা | কেবল মানুষ দ্বারা সম্ভব | এআই দ্বারা যেকোনো সময় |
প্রয়োজনীয়তা | শুধু অডিও প্লেয়ার | শক্তিশালী কম্পিউটার/ক্লাউড রিসোর্স (যেমন Google Colab) |
সুবিধা:
সীমাবদ্ধতা:
Whisper দিয়ে বিনামূল্যে বাংলা অডিও ট্রান্সক্রাইব করার সবচেয়ে সহজ পদ্ধতি হলো Google Colab ব্যবহার করা, যেখানে আপনাকে স্থানীয়ভাবে কোনো কিছু ইনস্টল না করেই ক্লাউড GPU-এর সুবিধা নিয়ে কয়েকটি সহজ ধাপ অনুসরণ করে কাজ করতে পারবেন।
ফ্রি ট্রান্সক্রিপশনের জন্য Whisper ব্যবহারের সবচেয়ে সহজ উপায় হলো Google Colab ব্যবহার করা। এটি একটি ক্লাউড-ভিত্তিক জুপাইটার নোটবুক পরিবেশ যা Google বিনামূল্যে প্রদান করে। এখানে আপনি GPU-এর সুবিধা পাবেন, যা Whisper মডেল দ্রুত চালানোর জন্য অপরিহার্য।
এখানে একটি ধাপে ধাপে নির্দেশিকা দেওয়া হলো:
1. Google Account লগইন: প্রথমে আপনার Google অ্যাকাউন্টে লগইন করুন।
2. Google Colab নোটবুক ওপেন করুন: একটি নতুন Google Colab নোটবুক তৈরি করুন (File > New notebook) অথবা কমিউনিটির তৈরি কোনো Whisper Colab নোটবুক ব্যবহার করুন (যেমন, বিভিন্ন GitHub প্রোজেক্টে এর জন্য রেডিমেড কোলাব নোটবুক পাওয়া যায়)। আপনি Google Colab ওয়েবসাইটে গিয়ে এটি করতে পারেন।
3. GPU রানটাইম নির্বাচন করুন: Colab নোটবুকে গিয়ে "Runtime" মেনু থেকে "Change runtime type" অপশনটি সিলেক্ট করুন। "Hardware accelerator" হিসেবে "GPU" নির্বাচন করুন এবং "Save" বাটনে ক্লিক করুন। এটি Whisper-এর কার্যকারিতা অনেক বাড়িয়ে দেবে।
4. প্রয়োজনীয় লাইব্রেরি ইনস্টল করুন: নোটবুকের একটি কোড সেলে নিচের কমান্ডগুলো লিখে রান করুন। এটি Whisper এবং FFMPEG (অডিও প্রসেসিংয়ের জন্য) ইনস্টল করবে।
```python
!pip install openai-whisper

!sudo apt update && sudo apt install ffmpeg
```
5. Whisper মডেল লোড করুন: Whisper-এর বিভিন্ন মডেল সাইজ রয়েছে (tiny, base, small, medium, large)। 'large' মডেলটি সবচেয়ে নির্ভুল, তবে এটি সবচেয়ে বেশি সময় ও রিসোর্স নেয়। বাংলার জন্য 'medium' বা 'large' মডেল সবচেয়ে ভালো। একটি কোড সেলে এটি লোড করুন:
```python
import whisper
model = whisper.load_model("medium") # অথবা "large" ব্যবহার করতে পারেন
```
6. অডিও ফাইল আপলোড করুন: আপনার অডিও ফাইলটি (mp3, wav, m4a ইত্যাদি) Colab নোটবুকে আপলোড করুন। ফাইল এক্সপ্লোরার প্যানেলে (বাম দিকে) গিয়ে 'Upload' আইকনে ক্লিক করে ফাইলটি আপলোড করতে পারেন, অথবা Google Drive থেকে মাউন্ট করেও ফাইল ব্যবহার করতে পারেন।
7. ট্রান্সক্রিপশন শুরু করুন: অডিও ফাইল আপলোড হয়ে গেলে, আরেকটি কোড সেলে নিচের কমান্ডটি ব্যবহার করে ট্রান্সক্রিপশন প্রক্রিয়া শুরু করুন। 'your_audio_file.mp3' এর জায়গায় আপনার আপলোড করা ফাইলের নাম দিন।
```python
result = model.transcribe("your_audio_file.mp3", language="bn")
print(result["text"])
```
`language="bn"` অংশটি উল্লেখ করে যে এটি বাংলা ভাষা। এটি নির্ভুলতা বাড়াতে সাহায্য করবে।
8. ফলাফল ডাউনলোড করুন (ঐচ্ছিক): যদি আপনি সাবটাইটেল ফাইল (.srt) বা অন্য কোনো ফরম্যাটে আউটপুট চান, তবে ট্রান্সক্রাইব কমান্ডের সাথে `word_timestamps=True` যোগ করতে পারেন এবং `whisper.utils` মডিউল ব্যবহার করে ফাইল তৈরি করতে পারেন।
```python
from whisper.utils import get_writer
options = dict(word_timestamps=False, language="bn")
result = model.transcribe("your_audio_file.mp3", **options)
srt_writer = get_writer("srt", ".")
srt_writer(result, "your_audio_file.srt")
print("SRT ফাইল তৈরি হয়েছে: your_audio_file.srt")
```

এই প্রক্রিয়া শেষে, আপনার ট্রান্সক্রাইব করা বাংলা টেক্সট বা সাবটাইটেল ফাইলটি Colab-এর ফাইল এক্সপ্লোরারে পাওয়া যাবে, যা আপনি ডাউনলোড করে নিতে পারবেন।
Whisper কেবল বাংলা অডিওকে টেক্সটে রূপান্তর করে না, বরং স্বয়ংক্রিয়ভাবে প্রতিটি কথার টাইমস্ট্যাম্প সহ .SRT বা .VTT ফরম্যাটে সাবটাইটেল ফাইলও তৈরি করে, যা ভিডিও কন্টেন্টের অ্যাক্সেসিবিলিটি এবং দর্শকসংখ্যা বাড়াতে অত্যন্ত সহায়ক।
ভিডিও কন্টেন্টের যুগে সাবটাইটেল অপরিহার্য। এটি শুধু বধির বা শ্রবণ প্রতিবন্ধী ব্যক্তিদের জন্য নয়, বরং যেসব দর্শক শব্দহীন পরিবেশে ভিডিও দেখতে পছন্দ করেন বা ভিডিওর ভাষা পুরোপুরি বোঝেন না, তাদের জন্যও অত্যন্ত গুরুত্বপূর্ণ। Whisper এই কাজটি খুব সহজে এবং কার্যকরভাবে সম্পন্ন করতে পারে।
Whisper দ্বারা সাবটাইটেল তৈরির মূল ধাপগুলো:
1. টাইমস্ট্যাম্প জেনারেশন: Whisper যখন অডিও ট্রান্সক্রাইব করে, তখন এটি প্রতিটি শব্দ বা বাক্যের শুরুর এবং শেষের টাইমস্ট্যাম্প (সময়সীমা) রেকর্ড করে। এই ডেটা সাবটাইটেল তৈরির ভিত্তি।
2. SRT/VTT ফরম্যাট: সাবটাইটেল সাধারণত .SRT (SubRip Subtitle) বা .VTT (WebVTT) ফরম্যাটে থাকে। Whisper এই উভয় ফরম্যাটেই আউটপুট দিতে পারে। এই ফাইলগুলোতে টেক্সটের পাশাপাশি সেই টেক্সটটি ভিডিওর কোন অংশে প্রদর্শিত হবে তার সময়কাল উল্লেখ থাকে।
3. ভাষা নির্ধারণ: `language="bn"` প্যারামিটার ব্যবহার করে Whisper-কে বলে দেওয়া হয় যে এটি বাংলা অডিও, ফলে এটি সঠিক বাংলা শব্দচয়নের উপর ফোকাস করে।
একটি ব্যবহারিক উদাহরণ:
ধরুন, আপনার কাছে একটি ইউটিউব ভিডিওর বাংলা অডিও ট্র্যাক রয়েছে, যার জন্য আপনি সাবটাইটেল তৈরি করতে চান। আপনি প্রথমে ভিডিও থেকে অডিও এক্সট্র্যাক্ট করে নেবেন (অনেক অনলাইন টুল দিয়ে এটি করা যায়)। এরপর সেই অডিও ফাইলটি Whisper-এর মাধ্যমে ট্রান্সক্রাইব করবেন। উপরোক্ত কোলাব গাইড অনুসরণ করে, আপনি `whisper.utils.get_writer("srt", ".")` ব্যবহার করে সরাসরি একটি `.srt` ফাইল তৈরি করতে পারবেন। এই `.srt` ফাইলটি এরপর যেকোনো ভিডিও এডিটিং সফটওয়্যার বা ইউটিউবের সাবটাইটেল আপলোড অপশনে ব্যবহার করা যাবে।
কেন এটি গুরুত্বপূর্ণ?
Whisper থেকে সর্বোচ্চ নির্ভুল বাংলা ট্রান্সক্রিপশন পেতে, ভালো মানের অডিও রেকর্ডিং নিশ্চিত করা, ব্যাকগ্রাউন্ড নয়েজ কমানো, সঠিক মডেল নির্বাচন করা এবং ট্রান্সক্রিপশন শেষে ম্যানুয়াল রিভিশন করা অত্যন্ত গুরুত্বপূর্ণ।
যদিও Whisper বেশ শক্তিশালী, তবুও কিছু কৌশল অবলম্বন করলে এর ট্রান্সক্রিপশনের মান আরও উন্নত করা যায়। পড়াশোনা সংক্রান্ত বা যেকোনো পেশাদার কাজে নির্ভুল ট্রান্সক্রিপশন অত্যন্ত জরুরি।
যদিও Whisper বিনামূল্যে উচ্চ-মানের বাংলা ট্রান্সক্রিপশন অফার করে, কিছু পেইড এআই সার্ভিস যেমন Google Cloud Speech-to-Text বা Happy Scribe অতিরিক্ত সুবিধা যেমন উন্নত স্পিকার ডায়ারাইজেশন বা ইন্টিগ্রেটেড এডিটর সরবরাহ করে, যা বড় প্রকল্পের জন্য মূল্যবান হতে পারে।
Whisper একটি গেম-চেঞ্জার হলেও, বাজারে আরও অনেক এআই ট্রান্সক্রিপশন টুল রয়েছে। বেশিরভাগই পেইড সার্ভিস, তবে তাদের কিছু অতিরিক্ত বৈশিষ্ট্য থাকতে পারে যা কিছু নির্দিষ্ট ব্যবহারের ক্ষেত্রে সহায়ক হতে পারে।
বৈশিষ্ট্য | Whisper AI (ফ্রি ব্যবহার) | Google Cloud Speech-to-Text | Happy Scribe |
|---|---|---|---|
খরচ | বিনামূল্যে (কম্পিউটেশনাল রিসোর্স খরচ বাদে) | প্রতি মিনিট অনুযায়ী চার্জ (বিনামূল্যে ব্যবহারের সীমা আছে) | প্রতি মিনিট অনুযায়ী চার্জ (সাবস্ক্রিপশন ভিত্তিক) |
অ্যাক্সেস | কোড-ভিত্তিক (Colab/লোকাল সেটআপ) | API-ভিত্তিক (ডেভেলপারদের জন্য) | ওয়েব-ভিত্তিক GUI |
বাংলা নির্ভুলতা | খুব উচ্চ | উচ্চ | উচ্চ |
সাবটাইটেল | হ্যাঁ (SRT/VTT) | হ্যাঁ | হ্যাঁ (ইন্টিগ্রেটেড এডিটর সহ) |
স্পিকার ডায়ারাইজেশন | সীমিত/কাস্টম কোড প্রয়োজন | হ্যাঁ (উন্নত) | হ্যাঁ (উন্নত) |
ইন্টিগ্রেটেড এডিটর | না | না (ডেভেলপমেন্ট প্রয়োজন) | হ্যাঁ |
ফাইল সাইজ সীমা | কম্পিউটার/ক্লাউড মেমরি দ্বারা সীমিত | উচ্চ (API নির্ভর) | উচ্চ |
প্রাথমিক সেটআপ | কিছুটা টেকনিক্যাল জ্ঞান প্রয়োজন | API সেটআপ, কোডিং জ্ঞান প্রয়োজন | ব্যবহারকারী-বান্ধব ইন্টারফেস |
কখন Whisper ব্যবহার করবেন:
কখন বিকল্প টুলস ব্যবহার করবেন:
শেষ পর্যন্ত, আপনার প্রয়োজন, বাজেট এবং টেকনিক্যাল দক্ষতার উপর নির্ভর করে সঠিক টুলটি নির্বাচন করতে হবে। তবে, বাংলা ট্রান্সক্রিপশন এবং সাবটাইটেল তৈরির জন্য বিনামূল্যে Whisper একটি অসাধারণ এবং শক্তিশালী বিকল্প, যা সঠিক পদ্ধতিতে ব্যবহার করলে পেশাদার মানের ফলাফল দিতে পারে।
হ্যাঁ, Whisper বহু ভাষার ডেটার উপর প্রশিক্ষণপ্রাপ্ত হওয়ায় এটি বাংলার বিভিন্ন আঞ্চলিক উচ্চারণ বা টান কিছুটা হলেও বুঝতে পারে। তবে, খুব কঠিন বা অপরিচিত অ্যাকসেন্টযুক্ত অডিওর ক্ষেত্রে নির্ভুলতা কিছুটা কম হতে পারে এবং ম্যানুয়াল রিভিশনের প্রয়োজন হতে পারে।
হ্যাঁ, Whisper স্বয়ংক্রিয়ভাবে .SRT বা .VTT ফরম্যাটে সাবটাইটেল ফাইল তৈরি করতে পারে, যা ইউটিউব, ভিমিও (Vimeo) বা অন্যান্য ভিডিও হোস্টিং প্ল্যাটফর্মে আপলোড করার জন্য সম্পূর্ণ উপযুক্ত।
Whisper সরাসরি বাংলা অডিওকে ইংরেজিতে অনুবাদ করতে সক্ষম, তবে এর প্রাথমিক উদ্দেশ্য হলো স্পিচ-টু-টেক্সট ট্রান্সক্রিপশন। আপনি ট্রান্সক্রাইব করা বাংলা টেক্সটটি বের করে তা [ChatGPT](https://chat.openai.com) বা Google Translate-এর মতো ডেডিকেটেড অনুবাদ টুল ব্যবহার করে আরও উন্নত মানের অনুবাদ পেতে পারেন।

এই আর্টিকেলের বিষয়ের সাথে সরাসরি সম্পর্কিত সেরা এআই টুলস, ব্যবহারের প্রম্পটস ও ওপেন সোর্স প্রজেক্ট নিচে তুলে ধরা হলো।
পড়ার নোট, PDF Q&A, অডিও ওভারভিউ
Google-এর NotebookLM সম্পূর্ণ ফ্রি — নিজের PDF/নোট/ইউআরএল আপলোড করে সেগুলো নিয়ে প্রশ্নোত্তর করা যায়। অডিও ওভারভিউ (পডকাস্ট স্টাইলে পড়া শোনা) শিক্ষার্থীদের জন্য দারুণ। পরীক্ষার প্রস্তুতিতে কার্যকর।
রিসার্চ ও ফ্যাক্ট-চেক (citation সহ)
Perplexity একটি অ্যানসার ইঞ্জিন — লাইভ ওয়েব থেকে তথ্য এনে উত্তর দেয় এবং প্রতিটি দাবির পাশে উৎস (citation) যোগ করে। রিসার্চ, মার্কেট অ্যানালাইসিস, ফ্যাক্ট-চেকের জন্য সেরা। সৃজনশীল লেখার জন্য নয়।
বৈজ্ঞানিক গবেষণা নিবন্ধ ও একাডেমিক পেপার অনুসন্ধান করার জন্য।
এই সার্চ ইঞ্জিনটি কোটি কোটি পেপার বিশ্লেষণ করে সরাসরি গবেষণালব্ধ তথ্যের মাধ্যমে যেকোনো প্রশ্নের উত্তর দেয়। এর বিশেষ 'Consensus Meter' দেখে বুঝে নেওয়া যায় যে গবেষকরা কোনো বিষয়ে একমত কি না। বিশ্ববিদ্যালয়ের শিক্ষার্থী, শিক্ষক এবং গবেষকদের নির্ভুল তথ্য ও সাইটেশন খুঁজে পেতে এটি অত্যন্ত সহায়ক।
LLM-ভিত্তিক AI Agent ও RAG অ্যাপ তৈরিতে।
awesome-llm-apps একটি ওপেন সোর্স লাইব্রেরি যা LLM-ভিত্তিক অ্যাপ্লিকেশন তৈরির জন্য ডিজাইন করা হয়েছে। এটি AI Agents, Agent Skills এবং RAG apps তৈরিতে ডেভেলপার, গবেষক ও শিক্ষার্থীদের সাহায্য করে। কৃত্রিম বুদ্ধিমত্তা এবং ন্যাচারাল ল্যাঙ্গুয়েজ প্রসেসিং নিয়ে কাজ করা প্রফেশনালদের জন্য এটি বিশেষভাবে উপযোগী।
নিজের ডকুমেন্টে প্রাইভেট AI প্রশ্নোত্তর
AnythingLLM দিয়ে নিজের ডকুমেন্ট (PDF, ওয়েবপেজ, নোট) লোকালভাবে ইনডেক্স করে সেগুলোর ওপর সম্পূর্ণ প্রাইভেট AI প্রশ্নোত্তর করা যায় — ডেটা নিজের মেশিনেই থাকে। ডেস্কটপ অ্যাপ বা Docker, দুইভাবেই চালানো যায় এবং Ollama-র লোকাল মডেলের সঙ্গে জুড়ে শূন্য খরচে চলে। কনফিডেনশিয়াল রিপোর্ট, থিসিস বা কোম্পানির ফাইল নিয়ে কাজের জন্য আদর্শ।
নিজের ডকুমেন্টের ওপর AI সার্চ (RAG)
LlamaIndex ব্যক্তিগত ডেটা — PDF, ওয়েবপেজ, ডেটাবেস — AI মডেলের বোধগম্য করে তোলার জন্য বানানো ডেটা ফ্রেমওয়ার্ক। এটি দিয়ে নিজের নোট, রিপোর্ট বা কোডবেসের ওপর প্রশ্ন করে সরাসরি উত্তর পাওয়া যায়। রিসার্চ ও ডকুমেন্ট-ভিত্তিক চ্যাটবট বানাতে খুব কার্যকর।
৫ মিনিটের পড়া। ফ্রিল্যান্সিং ও পড়াশোনায় কাজে লাগবেই — সম্পূর্ণ ফ্রি।