ಸ್ಥಳೀಯ AI ಸಂಗೀತ ತಯಾರಿಕೆಯು ಸೃಜನಶೀಲತೆಯ ಮೇಲಿನ ಮಿತಿಗಳನ್ನು ತೆಗೆದುಹಾಕುತ್ತದೆ. ACE-Step 1.5 ನಂತಹ ಪರಿಕರಗಳು ಸಂಪೂರ್ಣವಾಗಿ Mac ನಲ್ಲಿ ಕಾರ್ಯನಿರ್ವಹಿಸಬಲ್ಲವು, ಯಾವುದೇ ಕ್ಲೌಡ್ ಕ್ರೆಡಿಟ್ಗಳು ಅಥವಾ ಅಪ್ಲೋಡ್ ಕ್ಯೂ ಇಲ್ಲದೆ ನಿಮಿಷಗಳಲ್ಲಿ ಪಠ್ಯ ಪ್ರಾಂಪ್ಟ್ಗಳನ್ನು ಪೂರ್ಣ ಹಾಡುಗಳನ್ನಾಗಿ ಪರಿವರ್ತಿಸುತ್ತವೆ. ಆ ಸ್ವಾತಂತ್ರ್ಯವು ಒಂದು ಹೊಸ ಸಮಸ್ಯೆಯನ್ನು ಸೃಷ್ಟಿಸುತ್ತದೆ: ಅದುವೇ ಪ್ರಮಾಣ (volume). ತಯಾರಿಕೆಯು ಅಗ್ಗ ಮತ್ತು ತಕ್ಷಣದವಾಗಿದ್ದಾಗ, ನೀವು ಹಾಡನ್ನು ತಯಾರಿಸಲು ಸಾಧ್ಯವೇ ಎಂದು ಕೇಳುವುದನ್ನು ನಿಲ್ಲಿಸಿ, ನಿಮ್ಮ ಡ್ರೈವ್ನಲ್ಲಿರುವ ಐವತ್ತು ಆವೃತ್ತಿಗಳಲ್ಲಿ ಯಾವುದು ಉಳಿಸಿಕೊಳ್ಳಲು ಯೋಗ್ಯವಾಗಿದೆ ಎಂದು ಯೋಚಿಸಲು ಪ್ರಾರಂಭಿಸುತ್ತೀರಿ.
ನಾನು ಇದನ್ನು ಕಷ್ಟಪಟ್ಟು ಕಲಿತೆ. ಸರಾಸರಿ ದಿನದಲ್ಲಿ, ಒಂದು ಉತ್ತಮವಾದ ಟೇಕ್ ಅನ್ನು ಹುಡುಕಲು ನಾನು ACE-Step 1.5 ನಿಂದ ಸುಮಾರು ನಾಲ್ಕು ಪ್ರಯತ್ನಗಳನ್ನು ಮಾಡಬೇಕಾಗುತ್ತದೆ. ಆದರೆ ಸರಾಸರಿಗಳು ಯಾವಾಗಲೂ ನಿಜವಾಗಿರುವುದಿಲ್ಲ. ಇತ್ತೀಚಿನ ಒಂದು ಸೆಷನ್ನಲ್ಲಿ, ನಾನು ಒಂದೇ ಒಂದು ಅರೇಂಜ್ಮೆಂಟ್ ಹುಡುಕಲು ಮೂವತ್ತೆರಡು ಟೇಕ್ಗಳನ್ನು ತಯಾರಿಸಿದೆ. ಮೂವತ್ತೆರಡು ಎರಡು ನಿಮಿಷಗಳ ಹಾಡುಗಳನ್ನು ಕೇಳುವುದು ಅಂದರೆ ಒಂದು ಗಂಟೆಗಿಂತ ಹೆಚ್ಚು ಸಮಯದ ವಿಮರ್ಶಾತ್ಮಕ ಕೇಳುವಿಕೆಯಾಗಿದೆ. ಏಳನೇ ಟ್ರ್ಯಾಕ್到了, ನನ್ನ ಕಿವಿಗಳು ಅಸ್ಪಷ್ಟವಾದ ಸ್ವರಗಳನ್ನು (vowels) ಸಹ ಸಹಿಸಿಕೊಳ್ಳತೊಡಗಿದವು. ಹದಿನೈದನೆಯ ಟ್ರ್ಯಾಕ್到了, ನಾನು ಪದಗಳನ್ನು ಸಂಪೂರ್ಣವಾಗಿ ಮರೆತಿದ್ದರೂ, ರಾಗಗಳಿಗೆ ತಲೆಯಾಡಿಸುತ್ತಿದ್ದೆ. ಕೇಳುಗರ ಆಯಾಸ ಎಂದರೆ ಸೋಮಾರಿತನವಲ್ಲ; ಅದು ಗ್ರಹಣದ ನಿಖರತೆಯ ನಿಜವಾದ ಕುಸಿತವಾಗಿದೆ. ನನ್ನ ಕಿವಿಗಳು ಕೆಲಸ ಮಾಡುವ ಮೊದಲೇ ಕೆಲಸ ಮಾಡುವ ಒಂದು ಫಿಲ್ಟರ್ ನನಗೆ ಬೇಕಾಗಿತ್ತು.
ಆದ್ದರಿಂದ ನಾನು OpenAI ನ ಸ್ಪೀಚ್-ರೆಕಗ್ನಿಷನ್ ಮಾಡೆಲ್ನ Apple Silicon-optimised ಪೋರ್ಟ್ ಆದ mlx-whisper ಸುತ್ತ ಒಂದು ಸ್ಥಳೀಯ QA ಪೈಪ್ಲೈನ್ ಅನ್ನು ನಿರ್ಮಿಸಿದೆ. ಇದರ ಉದ್ದೇಶ ಸರಳವಾಗಿತ್ತು: ನಾನು ಪ್ರತಿಯೊಂದು ಟೇಕ್ ಅನ್ನು ಸ್ವಯಂಚಾಲಿತವಾಗಿ ಲಿಪ್ಯಂತರ ಮಾಡಿ (transcribe) ಅದನ್ನು ಮೂಲ ಸಾಹಿತ್ಯದೊಂದಿಗೆ ಹೋಲಿಸಿದರೆ, ನನಗೆ ಒಂದು ವಸ್ತುನಿಷ್ಠ ಸಾಹಿತ್ಯ-ಹೊಂದಾಣಿಕೆಯ ದರ (lyric-match rate) ಸಿಗುತ್ತದೆ. ಆ ಸಂಖ್ಯೆಯು ಮೂವತ್ತೆರಡು ಟೇಕ್ಗಳನ್ನು ನಿರ್ವಹಿಸಬಹುದಾದ ಅಲ್ಪ ಸಂಖ್ಯೆಯಾಗಿ ಇಳಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ.
ಪೈಪ್ಲೈನ್ ಹೇಗೆ ಕೆಲಸ ಮಾಡುತ್ತದೆ
ಈ ಕಾರ್ಯವಿಧಾನವು ನಾಲ್ಕು ಹಂತಗಳನ್ನು ಹೊಂದಿದೆ, ಮತ್ತು ನಾನು ಪ್ರತಿಯೊಂದನ್ನೂ ಕಟ್ಟುನಿಟ್ಟಾಗಿ ಪಾಲಿಸುತ್ತೇನೆ.
ತಯಾರಿಸುವುದು (Generate). ನಾನು ACE-Step 1.5 ಬಳಸಿ ಕಚ್ಚಾ ಆಡಿಯೋವನ್ನು ಸೃಷ್ಟಿಸುತ್ತೇನೆ. ಈ ಹಂತದಲ್ಲಿ ನಾನು ಯಾವುದನ್ನೂ ನಿರ್ಧರಿಸುವುದಿಲ್ಲ. ನನ್ನ ಗುರಿ ಹೆಚ್ಚಿನ ಪ್ರಮಾಣದ ಆಡಿಯೋ ಪಡೆಯುವುದು.
ಲಿಪ್ಯಂತರ ಮಾಡುವುದು (Transcribe). ಪ್ರತಿಯೊಂದು WAV ಫೈಲ್ ನನ್ನ Mac ನಲ್ಲಿರುವ mlx-whisper ಗೆ ಹೋಗುತ್ತದೆ. MLX ಅನ್ನು Apple ನ Metal ಮತ್ತು ನ್ಯೂರಲ್ ಇಂಜಿನ್ಗಾಗಿ ನಿರ್ಮಿಸಲಾಗಿರುವುದರಿಂದ, ಇದು ಸಂಪೂರ್ಣವಾಗಿ ಸ್ಥಳೀಯವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ. ಇಲ್ಲಿ ಯಾವುದೇ API ವೆಚ್ಚಗಳು, ನೆಟ್ವರ್ಕ್ ವಿಳಂಬ (latency) ಅಥವಾ ಕಚ್ಚಾ ಆಡಿಯೋವನ್ನು ರಿಮೋಟ್ ಸರ್ವರ್ಗೆ ಕಳುಹಿಸುವ ಬಗ್ಗೆ ಗೌಪ್ಯತೆಯ ಕಾಳಜಿಗಳಿಲ್ಲ. ನಾನು ಕಾಫಿ ತಯಾರಿಸುವಷ್ಟರಲ್ಲೇ ಮೂವತ್ತೆರಡು ಫೈಲ್ಗಳ ಬ್ಯಾಚ್ ಲಿಪ್ಯಂತರಗೊಳ್ಳುತ್ತದೆ.
ಅಂಕ ನೀಡುವುದು (Score). ನಾನು Whisper ಲಿಪ್ಯಂತರವನ್ನು ಮೂಲ ಸಾಹಿತ್ಯದ ಪ್ರಾಂಪ್ಟ್ಗೆ ಹೋಲಿಸುತ್ತೇನೆ. ಈ ಹೊಂದಾಣಿಕೆಯ ದರವು ನಿಖರತೆಯನ್ನು ಅಳೆಯುತ್ತದೆ: ಗಾಯಕ ಪ್ರತಿಯೊಂದು ಪದವನ್ನು ಸರಿಯಾಗಿ ಹೇಳಿದ್ದಾರೆಯೇ, ಅಥವಾ ಸಾಲುಗಳನ್ನು ಬಿಟ್ಟಿದ್ದಾರೆಯೇ, ಪದಗಳನ್ನು ಅಸ್ಪಷ್ಟವಾಗಿ ಉಚ್ಚರಿಸಿದ್ದಾರೆಯೇ ಅಥವಾ ಅಕ್ಷರಗಳನ್ನು ಭ್ರಮೆ ಮಾಡಿ (hallucinate) ಹೇಳಿದ್ದಾರೆಯೇ? ನಾನು ಶೇಕಡಾವಾರು ಹೊಂದಾಣಿಕೆಯನ್ನು ಲೆಕ್ಕಹಾಕುತ್ತೇನೆ. ಇದು ಸೌಂದರ್ಯದ ನಿರ್ಧಾರವಲ್ಲ; ಇದು ಪಠ್ಯದ ನಿಖರತೆಯ ಕಟ್ಟುನಿಟ್ಟಿನ ಲೆಕ್ಕಾಚಾರವಾಗಿದೆ.
ಫಿಲ್ಟರ್ ಮಾಡುವುದು (Filter). ನಾನು ಆ ಹೊಂದಾಣಿಕೆಯ ದರಕ್ಕೆ ಅನುಗುಣವಾಗಿ ಟೇಕ್ಗಳನ್ನು ವಿಂಗಡಿಸುತ್ತೇನೆ. ಅತಿ ಹೆಚ್ಚು ಅಂಕ ಪಡೆದ ಐದನೇ ಒಂದು ಭಾಗವು (top quintile) ನನ್ನ ಆಡಿಷನ್ ಪೂಲ್ ಆಗುತ್ತದೆ. ಉಳಿದವುಗಳನ್ನು ಎರಡನೇ ಫೋಲ್ಡರ್ಗೆ ವರ್ಗಾಯಿಸಲಾಗುತ್ತದೆ. ನಾನು ಕಡಿಮೆ ಅಂಕ ಪಡೆದವುಗಳನ್ನು ಇನ್ನೂ ಅಳಿಸಿಹಾಕಿಲ್ಲ, ಆದರೆ ಅವುಗಳಿಗಾಗಿ ನನ್ನ ಅಮೂಲ್ಯವಾದ ಕೇಳುವಿಕೆಯ ಸಮಯವನ್ನು ವ್ಯರ್ಥ ಮಾಡುವುದಿಲ್ಲ.
ಜ್ಯೂರಿಯನ್ನು ಸ್ವತಂತ್ರವಾಗಿಡಿ
ನಾನು ಒಂದು ಕಟ್ಟುನಿಟ್ಟಿನ ನಿಯಮವನ್ನು ಪಾಲಿಸುತ್ತೇನೆ: ತಯಾರಿಕಾ ಮಾಡೆಲ್ ತನ್ನದೇ ಕೆಲಸಕ್ಕೆ ಅಂಕ ನೀಡುವುದಿಲ್ಲ. ACE-Step 1.5 ತನ್ನದೇ ಆದ ಔಟ್ಪುಟ್ ಅನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುವುದಿಲ್ಲ. ನಾನು ಲಿಪ್ಯಂತರಕ್ಕಾಗಿ ಸಂಪೂರ್ಣವಾಗಿ ಪ್ರತ್ಯೇಕ ಪ್ರಕ್ರಿಯೆಯನ್ನು ಬಳಸುತ್ತೇನೆ ಏಕೆಂದರೆ ತನ್ನನ್ನು ತಾನು ಪರೀಕ್ಷಿಸಿಕೊಳ್ಳುವ ಮಾಡೆಲ್ ಯಾವಾಗಲೂ ತುಂಬಾ ದಯಾಮಯಿಯಾಗಿರುತ್ತದೆ. ಅದು ತನ್ನದೇ ಆದ ದೋಷಗಳನ್ನು ಗುರುತಿಸುವುದಿಲ್ಲ. ತಯಾರಿಕಾ ಮಾಡೆಲ್ ಅಲ್ಪತೆಯನ್ನು ಅಥವಾ ಉಚ್ಚಾರಣೆಯ ದೋಷಗಳನ್ನು ನಿರ್ಲಕ್ಷಿಸುವ ಪ್ರವೃತ್ತಿ ಹೊಂದಿದ್ದರೆ, ಸ್ವಯಂ-ಮೌಲ್ಯಮಾಪನ ಲೂಪ್ ಕೂಡ ಅಂತಹ ದೋಷಗಳನ್ನು ನಿರ್ಲಕ್ಷಿಸಲು ಕಲಿಯುತ್ತದೆ. ಸ್ವತಂತ್ರ ಸ್ಪೀಚ್-ರೆಕಗ್ನಿಷನ್ ಮಾಡೆಲ್ಗೆ ಸಂಗೀತದ ಬಗ್ಗೆ ಯಾವುದೇ ನಿಷ್ಠೆ ಇರುವುದಿಲ್ಲ. ಅದು ಕೇಳಿದದ್ದನ್ನು ಅಷ್ಟೇ ವರದಿ ಮಾಡುತ್ತದೆ, ಆ ವರದಿ ಎಷ್ಟೇ ಕಠಿಣವಾಗಿದ್ದರೂ ಸರಿ.
ಅಂಕಿಅಂಶಗಳು ಏನನ್ನು ಬಹಿರಂಗಪಡಿಸಿದವು
ಮೂವತ್ತೆರಡು ಟೇಕ್ಗಳ ಬ್ಯಾಚ್ನಲ್ಲಿ, ಪೈಪ್ಲೈನ್ ಎಂಟು ಅಭ್ಯರ್ಥಿಗಳನ್ನು ಮಾತ್ರ ಗಂಭೀರವಾಗಿ ಗಮನಿಸಲು ಉಳಿಸಿತು. ಆ ಎಂಟರ ಸರಾಸರಿ ಸಾಹಿತ್ಯ-ಹೊಂದಾಣಿಕೆಯ ದರ 83.9% ಆಗಿತ್ತು. ನಾನು ಅವುಗಳನ್ನು ಸರಿಯಾಗಿ ಕೇಳಿದ ನಂತರ ಮತ್ತು ನನ್ನದೇ ಗುಣಮಟ್ಟದ ಮಾನದಂಡಗಳ ಮೇಲೆ ಅಂಕ ನೀಡಿದ ನಂತರ, ಅವು 100ಕ್ಕೆ ಸರಾಸರಿ 94.1 ಅಂಕಗಳನ್ನು ಪಡೆದವು. ಈ ವ್ಯತ್ಯಾಸವು ಇಡೀ ಕಥೆಯನ್ನು ಹೇಳುತ್ತದೆ. ಯಂತ್ರವು ಸ್ಪಷ್ಟವಾದ ರಚನಾತ್ಮಕ ವೈಫಲ್ಯಗಳನ್ನು—ಸಾಹಿತ್ಯದ ಬಿಟ್ಟುಪೋಗುವಿಕೆ, ಸಮಯದ ವ್ಯತ್ಯಾಸ, ವೋಕಲ್ ಆರ್ಟಿಫ್ಯಾಕ್ಟ್ಗಳು—ಪತ್ತೆಹಚ್ಚಿತು, ಇದರಿಂದಾಗಿ ನನ್ನ ಮಾನವೀಯ ಅಂಕಮಾಪನವು ಮೊದಲೇ ಶುದ್ಧೀಕರಿಸಲ್ಪಟ್ಟ ಸೆಟ್ ಮೇಲೆ ಕಾರ್ಯನಿರ್ವಹಿಸಲು ಸಾಧ್ಯವಾಯಿತು. ಆಟೊಮೇಷನ್ ನನ್ನ ನಿರ್ಧಾರವನ್ನು ಬದಲಿಸಲಿಲ್ಲ; ಅದು ನನ್ನ ನಿರ್ಧಾರವನ್ನು ಉಳಿಸಿತು.
ಯಂತ್ರವು ತಪ್ಪಾದಾಗ
ಕಡಿಮೆ ಅಂಕ ಎಂದರೆ ಯಾವಾಗಲೂ ಕೆಟ್ಟ ಹಾಡಲ್ಲ. ನಾನು ಇಷ್ಟಪಟ್ಟ ಒಂದು ಟ್ರ್ಯಾಕ್ ಕನಿಷ್ಠ ಮಿತಿಗಿಂತ ಬಹಳ ಕಡಿಮೆ ಅಂಕ ಪಡೆದಾಗ ಇದನ್ನು ಮೊದಲೇ ಗಮನಿಸಿದೆ. ಅದರ ಸಾಹಿತ್ಯವು ಸರಳವಾದ ಅಕ್ಷರಗಳ ಪಠಣವಾಗಿತ್ತು: ಪ್ರತ್ಯೇಕ ಶಬ್ದಗಳಾಗಿ ಹಾಡಲಾದ ಏಕಬೆಲೆ ಅಕ್ಷರಗಳು. Whisper ನನ್ನು ನೈಸರ್ಗಿಕ ವಾಕ್ಯ ರಚನೆಗಳ ಮೇಲೆ ತರಬೇತಿಗೊಳಿಸಲಾಗಿದೆ. ಅದಕ್ಕೆ "A B C D" ಎಂದು ನೀಡಿದರೆ, ಅದು ಪದಗಳನ್ನು ಭ್ರಮೆ ಮಾಡಿ (hallucinate) ಸೃಷ್ಟಿಸಬಹುದು ಅಥವಾ ಅಕ್ಷರಗಳನ್ನು ಅಸ್ಪಷ್ಟವಾಗಿ ಮಾಡಬಹುದು. ಅಲ್ಲಿ ಲಿಪ್ಯಂತರ ವಿಫಲವಾಯಿತು, ಆದರೆ ವೋಕಲ್ ಪರ್ಫಾರ್ಮೆನ್ಸ್ ವಾಸ್ತವವಾಗಿ ಸ್ಪಷ್ಟವಾಗಿತ್ತು.
ಆ ಘಟನೆಯು ನನಗೆ ಪ್ರಾಯೋಗಿಕ ಮಿತಿಯನ್ನು ಕಲಿಸಿಕೊಟ್ಟಿತು. ಹೊಂದಾಣಿಕೆಯ ದರವು ಕೇವಲ ಒಂದು ಪೂರ್ವ-ಫಿಲ್ಟರ್ ಆಗಿದೆಯೇ ಹೊರತು ಅಂತಿಮ ತೀರ್ಪಲ್ಲ. ಕಡಿಮೆ ಅಂಕ ಪಡೆಯುವ ಯಾವುದೇ ಟೇಕ್ ಅನ್ನು ನಾನು ಅಳಿಸುವ ಮೊದಲು ಹತ್ತು ಸೆಕೆಂಡುಗಳ ಮಾನವೀಯ ಆಡಿಷನ್ ಮಾಡಿಯೇ ಕೇಳುತ್ತೇನೆ. ಆ ಸಂಖ್ಯೆಯು ನಿಮಗೆ ಸಂಭವನೀಯತೆಯನ್ನು ತೋರಿಸುತ್ತದೆಯೇ ಹೊರತು ಖಚಿತತೆಯನ್ನು ಅಲ್ಲ. ನೀವು ಅಂಕವನ್ನು ದಿಕ್ಸೂಚಿಯ ಬದಲಿಗೆ ಸುತ್ತಿಗೆಯಂತೆ ಬಳಸಿದರೆ, ನೀವು ಉತ್ತಮ ಸಂಗೀತವನ್ನು ಕಳೆದುಕೊಳ್ಳುತ್ತೀರಿ.
ತಾಂತ್ರಿಕ ಅಡೆತಡೆ
ನೀವು Apple Silicon ಮೇಲೆ MLX ಅನ್ನು ರನ್ ಮಾಡುತ್ತಿದ್ದರೆ, ದೊಡ್ಡ ಬ್ಯಾಚ್ಗಳನ್ನು ಪ್ರೊಸೆಸ್ ಮಾಡುವ ಮೊದಲು ನಿಮ್ಮ Python architecture ಅನ್ನು ಪರಿಶೀಲಿಸಿ. Python binary ಅನ್ನು Rosetta emulation ಮೂಲಕ ರನ್ ಮಾಡುವುದು ಒಂದು ಸಾಮಾನ್ಯ ಸೆಟಪ್ ತಪ್ಪು. ಸ್ಕ್ರಿಪ್ಟ್ ಇನ್ನೂ ಕಾರ್ಯಗತಗೊಳ್ಳುತ್ತದೆ, ಆದರೆ ಸ್ಥಳೀಯ ಟ್ರಾನ್ಸ್ಕ್ರಿಪ್ಶನ್ ಅನ್ನು ಸುಲಭವಾಗಿಸುವ ಹಾರ್ಡ್ವೇರ್ ಅಕ್ಸೆಲರೇಶನ್ ಅನ್ನು ನೀವು ಕಳೆದುಕೊಳ್ಳುತ್ತೀರಿ.
ಇದನ್ನು ನಿಮ್ಮ ಟರ್ಮಿನಲ್ನಲ್ಲಿ ರನ್ ಮಾಡಿ:
python3 -c "import platform; print(platform.machine())"
ನೀವು arm64 ಅನ್ನು ನೋಡಬೇಕಾಗುತ್ತದೆ. ಅದು x86_64 ಎಂದು ತೋರಿಸಿದರೆ, ನಿಮ್ಮ ಎನ್ವಿರಾನ್ಮೆಂಟ್ ಎಮ್ಯುಲೇಟೆಡ್ ಆಗಿದೆ. ನೇಟಿವ್ Python build ಅಥವಾ ನೇಟಿವ್ conda ಎನ್ವಿರಾನ್ಮೆಂಟ್ಗೆ ಬದಲಾಯಿಸಿ, ನಂತರ mlx-whisper ಅನ್ನು ಮರು-ಸ್ಥಾಪಿಸಿ. ದೊಡ್ಡ ಬ್ಯಾಚ್ಗಳ ವಿಷಯದಲ್ಲಿ, ಎಮ್ಯುಲೇಟೆಡ್ ಮತ್ತು ನೇಟಿವ್ ಎಕ್ಸಿಕ್ಯೂಷನ್ ನಡುವಿನ ವ್ಯತ್ಯಾಸವು ಮಧ್ಯಾಹ್ನದ ಊಟಕ್ಕೆ ಮೊದಲು ಮುಗಿಸುವುದು ಮತ್ತು ರಾತ್ರಿಯ ಊಟಕ್ಕೆ ಮೊದಲು ಮುಗಿಸುವುದು ಎಂಬಷ್ಟರ ಮಟ್ಟದ್ದಾಗಿರುತ್ತದೆ.
ನಿಜವಾದ ಮೌಲ್ಯ
ಜನರೇಟಿವ್ ಆಡಿಯೋವು ಪರಿಶ್ರಮಕ್ಕೆ ಪ್ರತಿಫಲ ನೀಡುತ್ತದೆ, ಆದರೆ ಮಾನವನ ಗಮನವು ಸೀಮಿತವಾಗಿದೆ. ನೀವು ಪರಿಣತರು ಎಂದು ಸಾಬೀತುಪಡಿಸಲು ಮೂವತ್ತೆರಡು ಸಾಧಾರಣ ಟೇಕ್ಗಳನ್ನು ಕೇಳುವುದರಲ್ಲಿ ಯಾವುದೇ ಕೀರ್ತಿಯಿಲ್ಲ. ಜನರೇಟರ್ ಮತ್ತು ನನ್ನ ಕಿವಿಯ ನಡುವೆ mlx-whisper ಅನ್ನು ಬಳಸುವ ಮೂಲಕ, ನಾನು ಗಂಟೆಗಟ್ಟಲೆ ಏಕಾಗ್ರತೆಯ ಸೃಜನಾತ್ಮಕ ಸಮಯವನ್ನು ಮರಳಿ ಪಡೆದಿದ್ದೇನೆ. ಯಾವ ಹಾಡು ಉಳಿಯಬೇಕು ಮತ್ತು ಯಾವುದು ಹೋಗಬೇಕು ಎಂಬುದನ್ನು ನಾನು ಇನ್ನೂ ನಿರ್ಧರಿಸುತ್ತೇನೆ. ಯಂತ್ರವು ಕೇವಲ ನಾನು ಆ ನಿರ್ಧಾರವನ್ನು ಅತ್ಯುತ್ತಮ ಅಭ್ಯರ್ಥಿಗಳಿಗೆ ಅನ್ವಯಿಸುತ್ತಿದ್ದೇನೆ ಎಂದು ಖಚಿತಪಡಿಸುತ್ತದೆ.
ಈ ಪೈಪ್ಲೈನ್ನ ಹಿಂದಿನ ಸಂಪೂರ್ಣ ವಿವರಣೆಯನ್ನು ಇಲ್ಲಿ ಪಡೆಯಬಹುದು. ನೀವು ಇದೇ ರೀತಿಯ ಸ್ಥಳೀಯ QA ಪರಿಕರಗಳನ್ನು ನಿರ್ಮಿಸುತ್ತಿದ್ದರೆ, ಮಾಹಿತಿಯನ್ನು ವಿನಿಮಯ ಮಾಡಿಕೊಳ್ಳಲು GyaanSetu community ಒಂದು ಉತ್ತಮ ಸ್ಥಳವಾಗಿದೆ.
