- Okuma süresi
- 0 saniye
- Sesli okuma
- 0 saniye
- Ortalama kelime uzunluğu
- 0
- UTF-8 bayt
- 0
- UTF-16 birimleri (String.length)
- 0
- Unicode kod noktaları
- 0
Nasıl çalışır
Karakter saymak bir emoji çıkana kadar basit görünür. Bir insanın gördüğü sayı, veritabanının sakladığıyla da bir programlama dilinin döndürdüğüyle de örtüşmez: aile emojisi ekranda tek bir karakterdir ama 5 Unicode kod noktası, 8 UTF-16 birimi (JavaScript, Java veya C#'ta String.length'in döndürdüğü) ve UTF-8'de 18 bayttır. Bu araç dört ölçüyü de gösterir; bu yüzden hem pazarlama metni hem de bir VARCHAR sütununu boyutlandırmak için işe yarar.
Kelimeler, cümleler ve karakterler, tarayıcının imleci hareket ettirmek veya çift tıklamayla seçmek için kullandığı Unicode bölütleme kurallarıyla sayılır. Bu yüzden Çince veya Japonca gibi kelimeleri boşlukla ayırmayan dillerde de çalışır ve birleşik aksanlı bir harfi iki karakter saymaz.
Okuma süresi, 190 çalışmanın meta analizindeki (Brysbaert, 2019) ortalama hızları kullanır: kurgu dışı metinlerde sessiz okumada dakikada 238 kelime, sesli okumada 183. Metin tarayıcınızdan çıkmaz ve paylaşım bağlantısına kaydedilmez.
Örnekler
👨👩👧1 · 5 · 8 · 18Görünen tek bir karakter, 5 kod noktası (iki görünmez birleştirici karakterle bağlanmış üç emoji), 8 UTF-16 birimi ve UTF-8'de 18 bayt. Bir API 280 "karakter" ile sınırlıyorsa, bu ölçülerden hangisini kullandığını öğrenmek iyi olur.SMS · 151 GSM-7 → 151 UCS-21 SMS → 3 SMS151 karakterlik bir SMS, GSM alfabesiyle tek mesaja sığar; ancak tek bir í bile telefonun UCS-2'ye geçmesine yeter ve orada her parça 67 karakter alır: aynı metin artık üç mesaja mal olur.café (NFC) · cafe + ◌́ (NFD)4 · 5Aynı kelime, é tek bir kod noktası olarak ya da ardından birleştirici aksan gelen bir e olarak saklanabilir. Ekranda aynı görünürler ve bu araç her iki durumda da 4 karakter sayar, ancak String.length 4 veya 5 döndürür.Kullanım senaryoları
- Başlıkları ve meta açıklamalarını Google'ın kesmeden gösterdiği uzunluğa uydurmak.
- Bir kampanyanın veya doğrulama kodunun kaç SMS tutacağını hesaplamak ve maliyeti artıran karakteri bulmak.
- Bir veritabanı sütununu boyutlandırmak veya MySQL'de utf8mb4 ile VARCHAR gibi bayt sınırlı bir alanı doğrulamak.
- Bir ödevin, özetin veya çağrının asgari ya da azami kelime sayısına uymak.
- Bir makalenin okunmasının veya bir metnin seslendirilmesinin ne kadar süreceğini tahmin etmek.
- Bir metni yayımlamadan önce aşırı tekrarlanan kelimeleri fark etmek.
Sık sorulan sorular
Başka bir sayaç neden farklı bir sayı veriyor?
Çünkü tek bir sayma yöntemi yoktur. Birçok sayaç String.length kullanır ve UTF-16 birimlerini sayar; bu yüzden bir emoji 2 veya daha fazla sayılır. Diğerleri kelimeleri kesme işaretinde bölen düzenli ifadelerle ayırır ve "don't" ya da "l'eau" ifadelerini iki kelime sayar. Burada karakterler ekranda gördüğünüz şeydir ve kelimeler Unicode kurallarına uyar; bu, bir insanın sayma biçimine en yakın yöntemdir.
Neden bir aksan SMS'in maliyetini değiştirir?
7 bitlik GSM alfabesi mesaj başına 160 karaktere izin verir ama tüm aksanlı harfleri içermez: é, ñ, ü ve à vardır, á, í, ó ve ú yoktur. Bu alfabe dışında tek bir karakter olsa bile mesajın tamamı UCS-2'ye geçer ve sınır 70'e, bölünmesi gerekirse parça başına 67'ye düşer. Bazı operatörler bunları içeren İspanyol ulusal tablosunu kullanır, ancak buna güvenmemek gerekir.
Google için bir başlık kaç karakter olabilir?
Google karakter sayısına göre değil, masaüstünde yaklaşık 600 olan piksel genişliğine göre keser; bu yüzden gerçek sınır harflere bağlıdır: bir W, bir i'den çok daha fazla yer kaplar. 50 ile 60 karakter genellikle tamamen görünür; meta açıklaması yaklaşık 155 ila 160 karaktere kadar gösterilir. Aracın çubukları bu değerleri referans alır.
Sayım X (Twitter) ile aynı mı?
Neredeyse her zaman, ama tam olarak değil. X her bağlantıyı uzunluğundan bağımsız olarak 23 karakter, Çince, Japonca ve Korece karakterleri ise 2 sayar. Latin alfabesiyle yazılmış ve bağlantı içermeyen metinlerde sayı aynıdır.
Bir metin veritabanında kaç bayt yer kaplar?
Sütunun kodlamasına bağlıdır. UTF-8'de İngilizce harfler 1 bayt, aksanlı harfler ve Kiril alfabesi 2, Çince 3 ve emojiler 4 bayt kaplar. utf8mb4 kullanan MySQL, VARCHAR uzunluğunu karakter olarak ama satır sınırını bayt olarak sayar; NVARCHAR kullanan SQL Server ise UTF-16 kullanır, bu da bu araçtaki UTF-16 birimleri ölçüsüdür.