स्ट्रिंग लेंथ काउंटर

ब्राउज़र में चलता है फ़ॉर्मेटिंग

समझें कि अलग-अलग सिस्टम में "length" अलग क्यों होती है: यह टूल ग्राफ़ीम क्लस्टर, यूनिकोड कोड पॉइंट, UTF-16 कोड यूनिट (JavaScript की .length) और UTF-8 / UTF-16 बाइट साइज़ बताता है — डेटाबेस कॉलम की सीमाओं और API वैलिडेशन के लिए बेहद ज़रूरी।

गोपनीयता: यह टूल पूरी तरह आपके ब्राउज़र में चलता है। आपका इनपुट कभी आपके डिवाइस से बाहर नहीं जाता।
टूल लोड हो रहा है…

स्ट्रिंग लेंथ काउंटर कैसे इस्तेमाल करें

  1. जिस स्ट्रिंग को मापना है उसे पेस्ट करें।
  2. पाँचों लंबाई के आँकड़ों की तुलना अपने सिस्टम की तय सीमा से करें।
  3. छिपे हुए या कॉम्बाइनिंग कैरेक्टर ढूँढ़ने के लिए ब्यौरे का इस्तेमाल करें।

स्ट्रिंग लेंथ काउंटर की खूबियाँ

  • ग्राफ़ीम क्लस्टर, कोड पॉइंट, UTF-16 यूनिट और UTF-8 / UTF-16 बाइट साइज़ साथ-साथ
  • सरोगेट पेयर, कॉम्बाइनिंग मार्क, ज़ीरो-विड्थ और कंट्रोल कैरेक्टर की पहचान
  • हर कैरेक्टर का ब्यौरा — कोड पॉइंट, एन्कोडेड साइज़ और यूनिकोड श्रेणी सहित
  • लिपि की पहचान (लैटिन, अरबी, देवनागरी, CJK, इमोजी…)
  • टाइप या पेस्ट करते ही लाइव नतीजे

स्ट्रिंग लेंथ काउंटर का उदाहरण

इमोजी वाली स्ट्रिंग VARCHAR(10) कॉलम क्यों तोड़ देती है

इनपुट:

🚀👨‍👩‍👧 مرحبا

आउटपुट:

Graphemes 8 · Code points 14 · UTF-16 units 17 · UTF-8 bytes 39

स्ट्रिंग लेंथ काउंटर के बारे में अक्सर पूछे जाने वाले सवाल

JavaScript मेरे डेटाबेस से अलग लंबाई क्यों बताता है?

JavaScript UTF-16 कोड यूनिट गिनता है, इसलिए एक इमोजी 2 होती है। MySQL का VARCHAR(n) कैरेक्टर (कोड पॉइंट) गिनता है, पर उसकी बाइट सीमा collation पर निर्भर करती है, और PostgreSQL कैरेक्टर गिनता है। यह टूल ये सभी आँकड़े साथ-साथ दिखाता है।

ग्राफ़ीम क्लस्टर क्या है?

वह इकाई जिसे पढ़ने वाला एक कैरेक्टर के रूप में देखता है। परिवार वाली इमोजी एक ग्राफ़ीम है पर सात कोड पॉइंट; "é" नॉर्मलाइज़ेशन के आधार पर एक या दो कोड पॉइंट हो सकता है।

UTF-8 साइज़ कैसे निकाला जाता है?

ASCII कैरेक्टर 1 बाइट लेते हैं, ज़्यादातर लैटिन/अरबी/हिब्रू अक्षर 2, देवनागरी और CJK 3, तथा इमोजी या अन्य astral कैरेक्टर 4 बाइट।

क्या ब्यौरे में अदृश्य कैरेक्टर दिखते हैं?

हाँ — ज़ीरो-विड्थ जॉइनर, BOM, कंट्रोल कैरेक्टर और कॉम्बाइनिंग मार्क अपने कोड पॉइंट के साथ सूचीबद्ध होते हैं, ताकि कॉपी किए गए टेक्स्ट में छिपे कैरेक्टर पकड़े जा सकें।

तकनीकी नोट्स

ग्राफ़ीम की गिनती Intl.Segmenter से होती है जब ब्राउज़र उसे उपलब्ध कराता है, वरना कोड पॉइंट पर लौट आती है। UTF-8 साइज़ TextEncoder से आता है, जो किसी भी इनपुट के लिए सटीक होता है — बिना जोड़े वाले सरोगेट सहित (जो U+FFFD के रूप में एन्कोड होते हैं)।