Unicode डेटासेट जनरेटर कैसे इस्तेमाल करें
- श्रेणियाँ लिखें (या "all")।
- और ज़्यादा मात्रा चाहिए तो रैंडम मिली-जुली स्ट्रिंग जोड़ें।
- Generate दबाएँ और लंबाई वाले कॉलम की तुलना उससे करें जो आपका सिस्टम स्टोर करता है।
Unicode डेटासेट जनरेटर की खूबियाँ
- 18 श्रेणियाँ: लैटिन डायाक्रिटिक, अरबी, देवनागरी, CJK, सिरिलिक, यूनानी, हिब्रू, थाई, emoji, संयोजक चिह्न, NFC/NFD जोड़े, surrogate pair, bidi कंट्रोल, zero-width, homoglyph, मिली-जुली लिपियाँ, case mapping और fullwidth रूप
- हर पंक्ति में: escape किया हुआ रूप, code point, UTF-16 यूनिट, UTF-8 बाइट, grapheme और NFC = NFD फ़्लैग
- चुनी हुई श्रेणियों के सैंपल मिलाकर बनी अतिरिक्त रैंडम स्ट्रिंग
- सारांश में एक से ज़्यादा यूनिट वाले grapheme की गिनती
- seed लगाया जा सकता है; JSON, CSV, SQL, XML, JSON Lines या तालिका आउटपुट
Unicode डेटासेट जनरेटर का उदाहरण
परिवार वाला emoji
इनपुट:
Categories: emojiआउटपुट:
text,codePoints,utf16Units,utf8Bytes,graphemes
👨👩👧👦,7,11,25,1Unicode डेटासेट जनरेटर के बारे में अक्सर पूछे जाने वाले सवाल
हर पंक्ति मुझे क्या बताती है?
टेक्स्ट, उसका escape किया हुआ रूप, code point, UTF-16 यूनिट, UTF-8 बाइट और उपयोगकर्ता को दिखने वाले grapheme की संख्या, और यह कि NFC तथा NFD रूप एक जैसे हैं या नहीं — लंबाई और normalisation के बग पकड़ने के लिए ज़रूरी सब कुछ।
कौन-सी लिपियाँ और केस शामिल हैं?
डायाक्रिटिक वाली लैटिन, अरबी, देवनागरी, CJK, सिरिलिक, यूनानी, हिब्रू, थाई, emoji तथा ZWJ अनुक्रम, संयोजक चिह्न, NFC/NFD जोड़े, surrogate pair, bidi कंट्रोल, zero-width कैरेक्टर, homoglyph, मिली-जुली लिपियाँ, case-mapping के edge case और fullwidth रूप।
क्या मैं रैंडम मिली-जुली स्ट्रिंग भी बना सकता हूँ?
हाँ — तय करें कि चुनी हुई श्रेणियों के रैंडम सैंपल से कितनी अतिरिक्त स्ट्रिंग बनानी हैं और हर एक में कितने सैंपल मिलाने हैं।