AI models आपको कैसे समझते हैं: tokens, context और hallucinations
तकनीकी परत सरल भाषा में — tokens, context window, temperature और hallucination — ताकि आप AI के बारे में सटीक बात कर सकें।
जब आप साफ़ prompt लिखना जान जाते हैं, अगला स्तर यह समझना है कि model के अंदर उसका क्या होता है: गणित नहीं, बल्कि अवधारणाएँ और वह English जो उन्हें बयान करती है। ये वे terms हैं जो AI की किसी भी गंभीर बातचीत में सामने आते हैं, और इनका सटीक इस्तेमाल उस इंसान को अलग करता है जिसने सिर्फ़ सुर्ख़ी पढ़ी उससे जिसने औज़ार के बारे में सोचा।
Tokens
Model शब्द नहीं पढ़ती। वह tokens पढ़ती है — text के टुकड़े, लगभग एक शब्द या शब्द का हिस्सा। unhappy एक token हो सकता है; unbelievable दो।
- The model splits the text into tokens.
- This model has a large token limit.
एक उपयोगी नतीजा है token limit, वह अधिकतम जो model एक बार में ले या दे सकती है। जब prompt «बहुत लंबा» हो, तो ख़त्म हुए tokens ही होते हैं।
Context window
Context window यह है कि model एक साथ कितना ध्यान में रख सकती है, उसकी अल्पकालिक याददाश्त, tokens में नापी गई। अंदर आपकी पूरी बातचीत plus prompt होती है।
- The whole document fits inside the context window.
- Once the conversation exceeds the context window, the model forgets the beginning.
यही वजह है कि chatbot से लंबी बातचीत कभी-कभी धागा खो देती है: शुरुआत window से बाहर गिर गई। सटीक English में कहा जाता है कि model runs out of context, न कि वह भूल गई — «भूल गई» याददाश्त का संकेत देती है, जो model के पास sessions के बीच होती ही नहीं।
Temperature
Temperature जवाब की पूर्वानुमेयता को नियंत्रित करती है। यह विचार physics से लिया गया है — temperature जितनी ऊँची, गति उतनी ज़्यादा।
कम temperature — पूर्वानुमेय, सुरक्षित, शाब्दिक। facts और code के लिए अच्छी।
ऊँची temperature — विविध, अप्रत्याशित, रचनात्मक। विचारों और drafts के लिए अच्छी।
Set the temperature low for a technical answer.
The model's temperature was high, so it gave three very different drafts.
यह शब्द अब इतना मानक है कि लोग the response felt high-temperature — यानी अप्रत्याशित — बिना व्याख्या के कहते हैं।
Hallucination
Hallucination एक आत्मविश्वास से भरा जवाब है जो बस झूठा होता है। Model ने कोई तथ्य, नाम, स्रोत गढ़ लिया और उसे निर्विवाद बताकर पेश किया।
- The model hallucinated a citation.
- That reference is a hallucination — it doesn't exist.
यह वह term है जो हर सावधान AI उपयोगकर्ता को चाहिए, क्योंकि यह औज़ार की मुख्य ख़राबी को नाम देता है। Verb सही है: hallucinate, hallucinated, has hallucinated। और noun गिनती वाला है: a hallucination, two hallucinations।
Hallucination झूठ नहीं है। झूठ के लिए सच जानना और उसके ख़िलाफ़ जाना ज़रूरी है। Model नहीं जानती कि सच क्या है; वह अनुमान लगाती है कि आगे कौन-सा text आएगा। झूठे नतीजे को hallucination कहना ठीक उतना ही सटीक है जितना lie और mistake नहीं हैं — model ने कभी हक़ीक़त से मिलान किया ही नहीं।
बाक़ी सेट
ये मूल को पूरा करते हैं, और आप इन्हें सटीक तकनीकी शब्दावली के पास देखते हैं:
| Term | अर्थ |
|---|---|
| training data | वे text जिन पर model ने सीखा |
| parameters | वे संख्याएँ जो model ने सीखीं; तकनीकी शब्दों में «size» |
| inference | वह क्षण जब model जवाब देती है |
| prompt injection | prompt के अंदर छिपा हमला, जो model को निर्देश नज़रअंदाज़ करने पर मजबूर करता है |
| fine-tuning | model को एक ख़ास काम के लिए ढालना |
इसके बारे में सटीक बात करना
पैटर्न पर ध्यान दें: हर term का अपना verb होता है, और जोड़ उतना ही तय है जितने collocations हमेशा तय होते हैं।
- The model splits text into tokens.
- The answer exceeded the context window.
- I lowered the temperature.
- The model hallucinated a source.
सही verb दिखाता है कि आप तंत्र को समझते हैं, सिर्फ़ शब्दों को नहीं।
खुद परखें
नीचे दी गई क्विज़ terms और उनके साथ चलने वाले verbs को जाँचती है।