PrismML-ன் புதிய Bonsai 27B 1-bit மாடல் 3.9 GB கோப்பிற்குள் அடங்குகிறது மற்றும் iPhone 17 Pro Max-ல் ஒரு வினாடிக்கு சுமார் 11 டோக்கன்கள் (tokens) வேகத்தில் இயங்குகிறது; இது ஒரு 27-பில்லியன் அளவுருக்களைக் (parameters) கொண்ட மொழி மாடல் ஒரு நுகர்வோர் ஸ்மார்ட்போனில் இயங்க முடியும் என்பதற்கான சான்றாகும். இந்தத் தகவல் முக்கியமானது, ஏனெனில் இது தரவுகளை கிளவுடிற்கு (cloud) அனுப்பாமலேயே, சிறந்த ஆஃப்லைன் உதவியாளர்களை (offline assistants) வழங்கும் வகையில், சாதனத்திலேயே இயங்கும் AI-ன் (on-device AI) எல்லையை விரிவுபடுத்துகிறது.

இந்தச் சுருக்கம் ஏன் முக்கியமானது

முழுத் துல்லியத்தன்மை கொண்ட (full-precision) Bonsai 27B மாடல் 54.7 GB அளவு கொண்டது. இந்த மாடலை ஒரு ஒற்றை-பிட் (single-bit) பிரதிநிதித்துவத்திற்கு குவாண்டைஸ் (quantising) செய்வதன் மூலம், PrismML அதை 3.9 GB ஆகச் சுருக்கியுள்ளது—இது 14 மடங்கு அளவு குறைப்பு ஆகும். இந்தச் சுருக்கத்தினால், மாடலை உயர்தர ஐபோன்களில் (high-end iPhones) தொழில்நுட்ப ரீதியாகச் சேமிக்க முடியும்; இதற்கு முன்பு சில நூறு மெகாபைட்டுகளைத் தாண்டும் எதையும் சேமிக்க முடியாது என்ற நிலை இருந்தது.

ஆப்பிள் வன்பொருளில் (Apple hardware) இந்த மாடல் எவ்வாறு செயல்படுகிறது

டெவலப்பர்கள் நியூரல் நெட்வொர்க்குகளை (neural nets) நேரடியாக நியூரல் என்ஜினில் (neural engine) இயக்க அனுமதிக்கும் API தொகுப்பான ஆப்பிளின் MLX stack-க்காக PrismML இந்த மாடலை உருவாக்கியுள்ளது. அதன் சொந்தச் சோதனையில், iPhone 17 Pro Max-ல் இந்த மாடல் ஒரு வினாடிக்குத் தோராயமாக 11 டோக்கன்களை உருவாக்கியது. 15 தரப்படுத்தப்பட்ட மொழி-மாடல் பெஞ்ச்மார்க் (benchmarks) சோதனைகளில், இந்த 1-bit பதிப்பு அசல் மாடலின் தர மதிப்பெண்களில் 89.5% ஐத் தக்கவைத்துக் கொண்டுள்ளது; இது இந்தச் சுருக்கம் அதன் பயனுள்ளத்தன்மையைக் குறைக்கவில்லை என்பதைக் காட்டுகிறது.

நீங்கள் எதிர்கொள்ளும் நடைமுறை வரம்புகள்

  • நினைவக அழுத்தம் (Memory pressure) – 3.9 GB கோப்பு சரியாகப் பொருந்தினாலும், சமீபத்திய சூழலைச் (context) சேமிக்க மாடலுக்கு ஒரு கீ-வேல்யூ (key-value/KV) கேச் (cache) தேவைப்படுகிறது. உரையாடலின் நீளத்தைப் பொறுத்து அந்த கேச் வளரும், இது போனின் RAM பயன்பாட்டை அதிகரித்து வேகத்தைக் குறைக்கக்கூடும்.
  • வெப்பம் மற்றும் பேட்டரி – 27-பில்லியன் அளவுருக்கள் கொண்ட நெட்வொர்க்கை இயக்குவது நியூரல் என்ஜினுக்கு அதிகச் சுமையை அளிக்கிறது. தொடர்ச்சியான பயன்பாட்டின் போது போன்கள் வெப்பமடையும் தன்மை கொண்டவை, மேலும் வன்பொருளைப் பாதுகாக்க ஆப்பிளின் தெர்மல் மேனேஜ்மென்ட் (thermal management) செயல்திறனைக் குறைக்கும். PrismML இன்னும் துல்லியமான பேட்டரித் தேய்மானத் தரவுகளை வெளியிடவில்லை என்பதால், ஒரு நாள் முழுமையான பயன்பாட்டில் இதன் உண்மையான பாதிப்பு தெரியவில்லை.
  • சாதனத் தனித்தன்மை (Device specificity) – இந்தச் செயல்திறன் குறித்த தகவல் சமீபத்திய iPhone 17 Pro Max-க்கு மட்டுமே பொருந்தும். பழைய ஐபோன்கள், குறைந்த தரத்திலான iOS சாதனங்கள் அல்லது ஆண்ட்ராய்டு போன்களில் அதே போன்ற நியூரல்-என்ஜின் திறன்கள் இல்லாததால், அவை மெதுவான இன்ஃபரன்ஸை (inference) வெளிப்படுத்தும் அல்லது மாடலைச் சுத்தமாகச் சேமிக்கவே முடியாது.

யாருக்குப் பயன் கிடைக்கும், யார் பின் தள்ளப்படுவார்கள்

தனியுரிமைக்கு முன்னுரிமை அளிக்கும் (privacy-first) செயலிகளை உருவாக்கும் டெவலப்பர்கள், இப்போது பயனர் தரவை போனுக்குள்ளேயே வைத்துக்கொண்டு, ஒரு பெரிய மொழி மாடலை சாதனத்திலேயே இயக்க முடியும். இதன் மூலம் கிளவுட் சந்தா (cloud subscription) இல்லாமலேயே, அதிகத் துரிதமான குரல் உதவியாளர்கள் (voice assistants), ஆஃப்லைன் மொழிபெயர்ப்பு அல்லது சூழல் சார்ந்த உரை உருவாக்கம் (contextual text generation) போன்றவற்றைச் செய்ய முடியும்.

ஆண்ட்ராய்டு உற்பத்தியாளர்கள் மற்றும் நடுத்தர விலையிலான போன்களைப் பயன்படுத்துபவர்கள் இதில் பயனடைய முடியாது. இந்த மாடல் ஆப்பிளின் பிரத்யேக ஸ்டேக் (proprietary stack) மீது தங்கியிருப்பதால், இதே போன்ற சுருக்க முறையை மற்ற இயங்குதளங்களில் (ecosystems) தானாகவே பயன்படுத்த முடியாது.

இன்னும் சோதிக்கப்பட வேண்டியவை

PrismML-ன் புள்ளிவிவரங்கள் அதன் உள்நிலை பெஞ்ச்மார்க்குகளில் (internal benchmarks) இருந்து பெறப்பட்டவை. நீண்ட நேரப் பயன்பாட்டின் போது வினாடிக்கு டோக்கன்களின் விகிதத்தைச் சரிபார்க்கவும், உண்மையான பேட்டரி நுகர்வை அளவிடவும் மற்றும் KV கேச் விரிவடையும் போது செயல்திறன் எவ்வளவு விரைவாகக் குறைகிறது என்பதையும் சுயாதீனமான சோதனையாளர்கள் சரிபார்க்க வேண்டும். ஒரு மணிநேரம் அரட்டை அடிப்பது, உள்ளடக்கங்களை ஸ்ட்ரீம் செய்வது அல்லது பிற செயலிகளுடன் மாடலை இயக்குவது போன்ற நிஜ உலகப் பயன்பாடுகள், கட்டுப்படுத்தப்பட்ட ஆய்வகத்திற்கு வெளியே அந்த 11-டோக்கன்-ஒரு-வினாடி என்ற அளவு நிலைத்திருக்குமா என்பதை வெளிப்படுத்தும்.

சுருக்கம்

27-பில்லியன் அளவுருக்கள் கொண்ட மொழி மாடல்களை ஒரு ஃபிளாக்ஷிப் (flagship) ஐபோனில் இயங்கும் அளவுக்குச் சுருக்க முடியும் என்பதையும், மிதமான வேகத்தில் கிட்டத்தட்ட முழுமையான தரத்தை வழங்க முடியும் என்பதையும் Bonsai 27B காட்டுகிறது. இந்த முன்னேற்றம் ஆப்பிளின் MLX stack-ஐச் சார்ந்துள்ளது மற்றும் நினைவகச் சுமை (memory overhead), வெப்பத் தணிகையினால் ஏற்படும் வேகக் குறைப்பு (thermal throttling) மற்றும் தெரியாத பேட்டரி பாதிப்பு போன்ற நடைமுறைத் தடைகளையும் எதிர்கொள்கிறது. அடுத்தகட்டச் சோதனைகள் இந்தத் தகவல்களை உறுதிப்படுத்தினால், iOS ஃபிளாக்ஷிப் போன்களுக்கும் மற்ற சந்தைக்கும் இடையிலான வன்பொருள் இடைவெளி குறையும் பட்சத்தில், சாதனத்திலேயே இயங்கும் AI என்பது ஒரு சிறிய டெமோவாக இல்லாமல் அன்றாடப் பயன்பாட்டுச் செயலிகளாக மாறக்கூடும்.