Automatic Prompt Engineer (APE) ஒரு குறிப்பிட்ட பணிக்காக ஒரு மொழி மாதிரி (language model) சிறந்த ப்ராம்ப்ட்டை எழுதவும், சோதிக்கவும் மற்றும் தேர்ந்தெடுக்கவும் அனுமதிக்கிறது. இது ஒரு காலத்தில் முயற்சி மற்றும் தவறு (trial-and-error) மூலம் செய்யப்படும் ஒரு கலையாக இருந்ததை, மீண்டும் மீண்டும் செய்யக்கூடிய தரவு சார்ந்த தேடலாக மாற்றுகிறது.

ஏன் ப்ராம்ப்ட் எழுதுவது ஒரு தடையாக மாறியுள்ளது

ப்ராம்ப்ட் இன்ஜினியரிங் (Prompt engineering)—அதாவது ஒரு மாதிரி என்ன செய்ய வேண்டும் என்று சொல்லும் துல்லியமான சொற்களை உருவாக்குவது—நீண்ட காலமாக உள்ளுணர்வு மற்றும் அதிர்ஷ்டத்தின் கலவையாக இருந்து வருகிறது. பயிற்சியாளர்கள் ஒரு வார்த்தையை இங்கே மாற்றுகிறார்கள், ஒரு சொற்றொடரை அங்கே மாற்றுகிறார்கள், மாதிரியை இயக்கி, வெளியீடு "சரியாகத் தோன்றுகிறது" என்று நினைக்கும் போது நிறுத்திவிடுகிறார்கள். இந்த அணுகுமுறை நீண்ட நேரம் எடுப்பதோடு, பொறியாளரின் கற்பனையைச் சார்ந்து இருப்பதாலும், செயல்திறனைத் தடுப்பதாலும் சிக்கலை ஏற்படுத்துகிறது. பயன்பாட்டு நிலையில் (production), இது நீண்ட சுழற்சிகள், நிலையற்ற முடிவுகள் மற்றும் வெளியீட்டிற்குப் பிறகு மட்டுமே தெரியவரும் மறைமுகச் செலவுகளுக்கு வழிவகுக்கிறது.

APE-இன் மூன்று படிநிலை பணிப்பாய்வு

APE, ப்ராம்ப்ட் உருவாக்கத்தை ஒரு தேடல் சிக்கலாக (search problem) treats செய்கிறது. பயனர் ஒரு சிறிய உள்ளீடு-வெளியீடு (input-output) உதாரணத் தொகுப்பை வழங்குகிறார். பின்னர் அமைப்பு மூன்று தானியங்கி நிலைகளை இயக்குகிறது:

  1. Propose (முன்மொழிதல்) – மாதிரி உதாரணங்களை ஆய்வு செய்து, "எதிரானதைத் திருப்பித் தருக" அல்லது "எதிர்ச்சொல்லை எழுதுக" போன்ற சாத்தியமான அறிவுறுத்தல்களின் தொகுப்பை வழங்குகிறது.
  2. Score (மதிப்பெண் வழங்குதல்) – அமைப்பு ஒவ்வொரு சாத்தியமான அறிவுறுத்தலையும் பார்க்கப்படாத ஒரு தனித் தொகுப்பு உதாரணங்களின் மூலம் இயக்கி, எத்தனை பதில்கள் எதிர்பார்க்கப்பட்ட வெளியீட்டுடன் பொருந்துகின்றன என்பதைக் கணக்கிடுகிறது, இது ஒரு நேரடித் துல்லிய எண்ணைத் தருகிறது. இந்த நிலையில் மனிதத் தலையீடு ஏதும் இருக்காது.
  3. Select (தேர்ந்தெடுத்தல்) – மிக உயர்ந்த துல்லியத்தைக் கொண்ட அறிவுறுத்தல் இறுதி ப்ராம்ப்ட்டாகத் தேர்ந்தெடுக்கப்படுகிறது.

இந்தச் சுழற்சியைத் திரும்பத் திரும்பச் செய்யலாம். வெற்றி பெற்ற ப்ராம்ப்ட் புதிய தொடக்கப் புள்ளியாக (seed) மாறுகிறது, மேலும் மாதிரி அதன் மாறுபாடுகளைப் பரிந்துரைக்கிறது. அறிக்கையிடப்பட்ட சோதனைகளில், 83% மதிப்பெண் பெற்ற ஒரு பொதுவான அறிவுறுத்தல், சோதனைத் தொகுப்பில் 100% துல்லியத்தை எட்டும் வகையில் மேம்படுத்தப்பட்டது.

மனித உழைப்பை விட இந்த அணுகுமுறை ஏன் சிறந்தது

  • உள்ளடக்கம் (Coverage) – ஒரு LLM வினாடி கணங்களில் டஜன் கணக்கான சொற்றொடர் மாற்றுகளை உருவாக்குகிறது, இது ஒரு மனிதரால் சோதிக்க முடிந்ததை விட மிக அதிகம்.
  • புறநிலைத்தன்மை (Objectivity) – தேர்வு என்பது சொற்கள் எவ்வளவு மெருகூட்டப்பட்டதாக இருக்கின்றன என்பதன் அடிப்படையில் அல்லாமல், அளவிடக்கூடிய துல்லியத்தின் அடிப்படையில் அமைகிறது. ஒரு பாடப்புத்தக பாணி அறிவுறுத்தல், மாதிரி சிறப்பாகப் புரிந்துகொள்ளும் ஒரு சுருக்கமான அல்லது விசித்திரமான மாறுபாட்டை விடத் தோல்வியடையக்கூடும்.

மதிப்பெண் அளவுகோல் பயனரிடமிருந்து வருவதால்—பொதுவாக ஒரு துல்லியமான பொருத்தம் சரிபார்ப்பு அல்லது ஒரு யூனிட் டெஸ்ட் (unit test)—குறியீடு உருவாக்கம் முதல் உணர்வுப் பகுப்பாய்வு (sentiment analysis) வரை எந்தவொரு அடுத்தகட்டத் தேவைக்கும் இந்த அமைப்பை மாற்றியமைக்க முடியும்.

தானியங்கி முறையின் விலை

இதன் சவால் கணக்கீட்டுத் திறன் (compute) ஆகும். ஒவ்வொரு சாத்தியமான அறிவுறுத்தலுக்கும் மதிப்பெண் வழங்க பல மாடல் அழைப்புகள் (model calls) தேவைப்படுவதால், மேம்பாட்டு நிலையில் குறிப்பிடத்தக்க அளவு API பயன்பாடு செலவிடப்படுகிறது. APE அந்தச் செலவை ஒருமுறை செய்யும் முதலீடாகக் கருதுகிறது: உகந்த ப்ராம்ப்ட் கண்டறியப்பட்டவுடன், நீங்கள் கூடுதல் செலவின்றி அதை எப்போதும் மீண்டும் பயன்படுத்தலாம்.

இரண்டு முன்நிபந்தனைகளும் இதன் பயன்பாட்டைக் கட்டுப்படுத்துகின்றன:

  • லேபிளிடப்பட்ட உதாரணங்கள் (Labeled examples) – முறைப்படியான உள்ளீடுகள் மற்றும் சரியான வெளியீடுகளின் பிரதிநிதித்துவத் தொகுப்பு அமைப்புக்குத் தேவை.
  • மதிப்பெண் வழங்கும் செயல்பாடு (Scoring function) – பயனர்கள் தங்கள் பணிக்கு "சரியானது" என்பதன் அர்த்தத்தை வரையறுக்க வேண்டும்; அது ஒரு துல்லியமான சொல் பொருத்தமாகவோ, எண் சார்ந்த சகிப்புத்தன்மையாகவோ (numeric tolerance) அல்லது ஒரு தனிப்பயனாக்கப்பட்ட சரிபார்ப்பியாகவோ இருக்கலாம்.

எங்கே இந்த யோசனை தடுமாறலாம்

ஆரம்ப உதாரணத் தொகுப்பு மிகச் சிறியதாகவோ அல்லது முறையற்றதாகவோ இருந்தால், தேர்ந்தெடுக்கப்பட்ட ப்ராம்ப்ட் ஓவர்ஃபிட் (overfit) ஆகி நிஜ உலகப் பயன்பாட்டில் தோல்வியடையக்கூடும்.

அடுத்து கவனிக்க வேண்டியவை

இந்தக் கருவி ஒரு மாற்றாக அமைகிறது: சில உதாரணங்களை வழங்கவும், மாதிரி மீண்டும் மீண்டும் செயல்பட அனுமதிக்கவும், அதன் முயற்சிகளில் அமைப்பு மிக உயர்ந்த தரவரிசையில் வைக்கும் ஒரு ப்ராம்ப்ட்டைப் பெறவும் முடியும். இதன் டெமோ (demo) அசல் அறிவிப்பில் உள்ள இணைப்பில் உள்ளது, மேலும் டெலிகிராமில் (Telegram) ஒரு கற்றல் சமூகம் இணைந்துள்ளது.

முக்கியக் கருத்து: ப்ராம்ப்ட் இன்ஜினியரிங்கைத் தானியக்கமாக்குவது யூகங்களுக்குப் பதிலாக அளவிடக்கூடிய செயல்திறனை வழங்குகிறது, ஆனால் அதற்கு முன்கூட்டியே தரவு, கணக்கீட்டுத் திறன் மற்றும் தெளிவான வெற்றி வரையறை தேவைப்படுகிறது.