- पढ़ने का समय
- 0 सेकंड
- ज़ोर से पढ़ने पर
- 0 सेकंड
- शब्द की औसत लंबाई
- 0
- UTF-8 में बाइट
- 0
- UTF-16 इकाइयाँ (String.length)
- 0
- Unicode कोड पॉइंट
- 0
यह कैसे काम करता है
अक्षर गिनना आसान लगता है, जब तक कोई इमोजी न आ जाए। जो व्यक्ति देखता है, वह न डेटाबेस में सहेजी गई गिनती से मेल खाता है न किसी प्रोग्रामिंग भाषा के लौटाए मान से: परिवार वाला इमोजी स्क्रीन पर एक ही अक्षर है, लेकिन यह 5 Unicode कोड पॉइंट, 8 UTF-16 इकाइयाँ (जो JavaScript, Java या C# में String.length लौटाता है) और UTF-8 में 18 बाइट है। यह टूल चारों माप दिखाता है, इसलिए मार्केटिंग टेक्स्ट और VARCHAR कॉलम का आकार तय करने, दोनों में काम आता है।
शब्द, वाक्य और अक्षर ब्राउज़र में बने Unicode विभाजन नियमों से गिने जाते हैं — वही नियम जिनसे वह कर्सर चलाता है या डबल क्लिक से शब्द चुनता है। इसलिए यह चीनी या जापानी जैसी उन भाषाओं में भी काम करता है जो शब्दों के बीच स्पेस नहीं रखतीं, और संयुक्त मात्रा वाले अक्षर को दो अक्षर नहीं गिनता।
पढ़ने का समय 190 अध्ययनों के मेटा-विश्लेषण (Brysbaert, 2019) की औसत गति पर आधारित है: गैर-काल्पनिक टेक्स्ट को मन में पढ़ने पर 238 शब्द प्रति मिनट और ज़ोर से पढ़ने पर 183। टेक्स्ट आपके ब्राउज़र से बाहर नहीं जाता और शेयर लिंक में सहेजा नहीं जाता।
उदाहरण
👨👩👧1 · 5 · 8 · 18एक दिखने वाला अक्षर, 5 कोड पॉइंट (दो अदृश्य जोड़ने वाले अक्षरों से जुड़े तीन इमोजी), 8 UTF-16 इकाइयाँ और UTF-8 में 18 बाइट। अगर कोई API 280 "अक्षरों" की सीमा रखता है, तो यह जानना अच्छा है कि वह इनमें से कौन-सा माप इस्तेमाल करता है।SMS · 151 GSM-7 → 151 UCS-21 SMS → 3 SMS151 अक्षरों वाला SMS GSM वर्णमाला में एक ही संदेश में आ जाता है, लेकिन एक अकेला í फ़ोन को UCS-2 पर ले जाने के लिए काफ़ी है, जहाँ हर हिस्से में 67 अक्षर आते हैं: वही टेक्स्ट अब तीन संदेशों का पड़ता है।café (NFC) · cafe + ◌́ (NFD)4 · 5एक ही शब्द में é को एक कोड पॉइंट के रूप में या e के बाद संयोजक चिह्न के रूप में सहेजा जा सकता है। स्क्रीन पर दोनों एक जैसे दिखते हैं और यह टूल दोनों में 4 अक्षर गिनता है, लेकिन String.length 4 या 5 लौटाता है।उपयोग के मामले
- शीर्षक और मेटा विवरण को उस लंबाई में रखना जिसे Google बिना काटे दिखाता है।
- गणना करना कि कोई अभियान या सत्यापन कोड कितने SMS का पड़ेगा, और वह अक्षर पहचानना जो उसे महँगा बनाता है।
- डेटाबेस कॉलम का आकार तय करना या बाइट सीमा वाले फ़ील्ड की जाँच करना, जैसे utf8mb4 वाले MySQL में VARCHAR।
- किसी असाइनमेंट, सारांश या आवेदन की न्यूनतम या अधिकतम शब्द सीमा पूरी करना।
- अनुमान लगाना कि किसी लेख को पढ़ने या स्क्रिप्ट रिकॉर्ड करने में कितना समय लगेगा।
- किसी टेक्स्ट को प्रकाशित करने से पहले ज़्यादा दोहराए गए शब्द पहचानना।
अक्सर पूछे जाने वाले प्रश्न
दूसरा गणक अलग संख्या क्यों दिखाता है?
क्योंकि गिनने का कोई एक तरीका नहीं है। कई गणक String.length इस्तेमाल करते हैं और UTF-16 इकाइयाँ गिनते हैं, इसलिए एक इमोजी 2 या ज़्यादा गिना जाता है; कुछ रेगुलर एक्सप्रेशन से शब्द बाँटते हैं जो एपॉस्ट्रॉफ़ी पर तोड़ देते हैं और "don't" या "l'eau" को दो शब्द गिनते हैं। यहाँ अक्षर वही हैं जो स्क्रीन पर दिखते हैं और शब्द Unicode नियमों का पालन करते हैं, जो इंसान के गिनने के तरीके के सबसे क़रीब है।
एक मात्रा वाला अक्षर SMS की लागत क्यों बदल देता है?
7-बिट GSM वर्णमाला प्रति संदेश 160 अक्षरों की अनुमति देती है, लेकिन उसमें सभी मात्रा वाले अक्षर नहीं हैं: é, ñ, ü और à हैं, पर á, í, ó और ú नहीं। उस वर्णमाला से बाहर का एक भी अक्षर हो तो पूरा संदेश UCS-2 में चला जाता है और सीमा घटकर 70 हो जाती है, या बाँटने पर प्रति हिस्सा 67। कुछ ऑपरेटर स्पेनिश राष्ट्रीय तालिका इस्तेमाल करते हैं जिसमें ये शामिल हैं, पर उस पर भरोसा न करना ही बेहतर है।
Google के लिए शीर्षक में कितने अक्षर हो सकते हैं?
Google अक्षरों की गिनती से नहीं बल्कि पिक्सेल की चौड़ाई से काटता है, डेस्कटॉप पर लगभग 600, इसलिए असली सीमा अक्षरों पर निर्भर करती है: W, i से कहीं ज़्यादा जगह लेता है। 50 से 60 अक्षर आमतौर पर पूरे दिख जाते हैं; मेटा विवरण लगभग 155 से 160 अक्षरों तक दिखता है। टूल की पट्टियाँ इन्हीं मानों को संदर्भ मानती हैं।
क्या गिनती X (Twitter) से मेल खाती है?
लगभग हमेशा, पर पूरी तरह नहीं। X हर लिंक को उसकी लंबाई चाहे जो हो, 23 अक्षर गिनता है और चीनी, जापानी व कोरियाई अक्षरों को 2। लैटिन वर्णमाला वाले बिना लिंक के टेक्स्ट में संख्या वही रहती है।
डेटाबेस में कोई टेक्स्ट कितने बाइट लेता है?
यह कॉलम की एन्कोडिंग पर निर्भर करता है। UTF-8 में अंग्रेज़ी अक्षर 1 बाइट, मात्रा वाले अक्षर और सिरिलिक 2, चीनी 3 और इमोजी 4 बाइट लेते हैं। utf8mb4 वाला MySQL VARCHAR की लंबाई अक्षरों में पर पंक्ति की सीमा बाइट में गिनता है, और NVARCHAR वाला SQL Server UTF-16 इस्तेमाल करता है, जो इस टूल का UTF-16 इकाइयों वाला माप है।