பெருமொழி மாதிரி
பெருமொழி மாதிரி (Large Language Model-LLM) என்பது சுய மேற்பார்வை மொழி கற்றல் செயற்கை நுண்ணறிவின் ஒரு வகையாகும். இது மனித மொழியைப் புரிந்துகொள்ளவும், உருவாக்கவும் பயிற்சி பெற்ற ஆழமான கற்றல் (Deep Learning) நுட்பங்களைப் பயன்படுத்தி வடிவமைக்கப்பட்ட கணினி நிரலாகும்.[1] குறிப்பாக டிரான்ஸ்ஃபார்மர் (Transformer) கட்டமைப்பு என்ற ஒரு குறிப்பிட்ட வகை நரம்பியல் வலையமைப்பை (Neural Network) இவை பயன்படுத்துகின்றன. இந்த மாதிரிகள் இணையத்தில் உள்ள கோடிக்கணக்கான வார்த்தைகள் கொண்ட மிகப்பெரிய தரவுத் தொகுப்புகளில் பயிற்சி பெறுகின்றன. இந்த தரவுகளில் புத்தகங்கள், கட்டுரைகள், இணையப் பக்கங்கள், உரையாடல்கள் போன்றவை அடங்கும். இந்த பரந்த பயிற்சி காரணமாக பெரிய மொழி மாதிரிகள் வார்த்தைகளின் அமைப்பை இலக்கண விதிகளை வெவ்வேறு தலைப்புகளில் உள்ள தகவல்களை கற்றுக்கொள்கின்றன. பெரிய மொழி மாதிரியின் சிறந்த எடுத்துக்காட்டுகள் சாட்ஜிபிடி மற்றும் கூகுள் ஜெமினி ஆகும்.
இந்த மாதிரிகள் வாக்கியத்தின் அடுத்து வரும் வார்த்தைகளை கணிக்க வடிவமைக்கப்பட்டுள்ளன. ஒரு வாக்கியத்தின் தொடக்கத்தைக் கொடுத்தால் அடுத்து என்ன வார்த்தை வரும் என்பதை அவை யூகிக்கின்றன. இது ஒரு மனிதன் பேசும் அல்லது எழுதும் விதத்தை பிரதிபலிக்கிறது. இந்த மாதிரிகள் இயற்கையான மொழி செயலாக்கத்தின் (Natural Language Processing) ஒரு மேம்பட்ட வடிவம். அவை கற்றுக்கொண்ட தகவல்களைப் பயன்படுத்தி புதிய மற்றும் அர்த்தமுள்ள உரையை உருவாக்கும் திறனைக் கொண்டுள்ளன.
பெரிய மொழி மாதிரிகள் பல்வேறு பணிகளுக்குப் பயன்படுத்தப்படுகின்றன. கேள்விகளுக்குப் பதிலளித்தல், கட்டுரைகள் எழுதுதல், மொழிகளை மொழிபெயர்த்தல், திரட்டு (சுருக்கங்கள்) உருவாக்குதல் போன்ற பலவற்றை அவை செய்கின்றன. எடுத்துக்காட்டாக ஒரு பயனர் ஒரு கேள்வியைக் கேட்டால் மொழி மாதிரி தனது அறிவைப் பயன்படுத்தி பொருத்தமான பதிலை உருவாக்கும். மேலும் ஒரு குறிப்பிட்ட தலைப்பில் எழுதச் சொன்னால் அது புதிய உள்ளடக்கத்தை உருவாக்கும்.
இந்த மாதிரிகளின் செயல்திறன் மற்றும் அவற்றின் அளவு, பயிற்சி தரவின் தரத்தைப் பொறுத்தது. அதிகமான தரவு மற்றும் பெரிய மாதிரி அளவு சிறந்த முடிவுகளைத் தருகிறது. இவை கற்றல் திறனுடன் செயல்படுகின்றன. அதாவது புதிய தகவல்களை உள்வாங்கி செயல்திறனை மேம்படுத்திக்கொள்ளும் ஆற்றல் கொண்டவை. ஆனாலும் சில நேரங்களில் அவை தவறான தகவல்களை அல்லது பாரபட்சமான பதில்களை வழங்கலாம். ஏனெனில் அவற்றின் பயிற்சி தரவில் உள்ள குறைபாடுகளை அவை பிரதிபலிக்கக்கூடும். இந்த சவால்களை ஆராய்ச்சியாளர்கள் தொடர்ந்து சரிசெய்து வருகின்றனர்.
பெரிய மொழி மாதிரிகள் செயற்கை நுண்ணறிவு துறையில் ஒரு குறிப்பிடத்தக்க முன்னேற்றத்தைக் குறிக்கின்றன. இவை மனிதர்கள் கணினிகளுடன் தொடர்பு கொள்ளும் விதத்தை மாற்றியமைக்கின்றன. மேலும் இது தகவல் அணுகல், கல்வி ஆராய்ச்சி போன்ற பல துறைகளில் புரட்சியை ஏற்படுத்தும் ஆற்றல் கொண்டவை. எதிர்காலத்தில் இந்த மாதிரிகள் மேலும் மேம்படுத்தப்பட்டு மனிதர்களுடன் இன்னும் இயல்பான தொடர்புகளை உருவாக்கும் என்று எதிர்பார்க்கப்படுகிறது.
மேற்கோள்கள்
[தொகு]- ↑ Brown, Tom B.; Mann, Benjamin; Ryder, Nick; Subbiah, Melanie; Kaplan, Jared; Dhariwal, Prafulla; Neelakantan, Arvind; Shyam, Pranav et al. (Dec 2020). Larochelle, H.; Ranzato, M.; Hadsell, R. et al.. eds. "Language Models are Few-Shot Learners". Advances in Neural Information Processing Systems (Curran Associates, Inc.) 33: 1877–1901. https://proceedings.neurips.cc/paper/2020/file/1457c0d6bfcb4967418bfb8ac142f64a-Paper.pdf. பார்த்த நாள்: 2023-03-14.