- زمن القراءة
- 0 ثانية
- القراءة بصوت عالٍ
- 0 ثانية
- متوسط طول الكلمة
- 0
- بايتات UTF-8
- 0
- وحدات UTF-16 (String.length)
- 0
- نقاط رموز Unicode
- 0
كيف يعمل
يبدو عدّ الأحرف أمرًا بسيطًا حتى يظهر رمز تعبيري. فما يراه الشخص لا يطابق ما تخزّنه قاعدة البيانات ولا ما تُرجعه لغة البرمجة: رمز العائلة التعبيري حرف واحد على الشاشة، لكنه 5 نقاط رموز Unicode و8 وحدات UTF-16 (ما تُرجعه String.length في JavaScript أو Java أو C#) و18 بايتًا في UTF-8. تعرض هذه الأداة المقاييس الأربعة، فتفيد في نص تسويقي وفي تحديد حجم عمود VARCHAR على حد سواء.
تُعدّ الكلمات والجمل والأحرف وفق قواعد تقسيم Unicode المدمجة في المتصفح، وهي نفسها التي يستخدمها لتحريك المؤشر أو التحديد بنقرة مزدوجة. لذلك تعمل الأداة أيضًا مع اللغات التي لا تفصل الكلمات بمسافات، مثل الصينية واليابانية، ولا تعدّ الحرف ذا العلامة المركّبة حرفين.
يعتمد زمن القراءة على متوسط السرعات في تحليل تجميعي لـ 190 دراسة (Brysbaert، 2019): 238 كلمة في الدقيقة للقراءة الصامتة للنصوص غير الأدبية و183 للقراءة بصوت عالٍ. لا يغادر النص متصفحك ولا يُحفظ في رابط المشاركة.
أمثلة
👨👩👧1 · 5 · 8 · 18حرف واحد ظاهر، و5 نقاط رموز (ثلاثة رموز تعبيرية يربطها حرفا وصل غير مرئيين)، و8 وحدات UTF-16، و18 بايتًا في UTF-8. إذا حدّت واجهة برمجية النص بـ 280 "حرفًا"، فمن المفيد معرفة أي هذه المقاييس تستخدم.SMS · 151 GSM-7 → 151 UCS-21 SMS → 3 SMSتتسع رسالة نصية من 151 حرفًا لرسالة واحدة بأبجدية GSM، لكن يكفي حرف í واحد لينتقل الهاتف إلى UCS-2، حيث يتسع كل جزء لـ 67 حرفًا: فيصبح النص نفسه بتكلفة ثلاث رسائل.café (NFC) · cafe + ◌́ (NFD)4 · 5يمكن تخزين الكلمة نفسها بحرف é كنقطة رمز واحدة أو كحرف e يليه علامة مركّبة. تبدوان متطابقتين على الشاشة وتعدّ هذه الأداة 4 أحرف في الحالتين، لكن String.length تُرجع 4 أو 5.حالات الاستخدام
- ملاءمة العناوين والأوصاف التعريفية للطول الذي يعرضه Google دون اقتطاع.
- حساب عدد الرسائل النصية التي ستكلّفها حملة أو رمز تحقق، واكتشاف الحرف الذي يرفع التكلفة.
- تحديد حجم عمود في قاعدة بيانات أو التحقق من حقل محدود بالبايت، مثل VARCHAR في MySQL مع utf8mb4.
- الالتزام بالحد الأدنى أو الأقصى لعدد كلمات بحث أو ملخص أو دعوة للمشاركة.
- تقدير مدة قراءة مقال أو تسجيل نص صوتي.
- اكتشاف الكلمات المكررة بإفراط قبل نشر نص.
الأسئلة الشائعة
لماذا يعطيني عدّاد آخر رقمًا مختلفًا؟
لأنه لا توجد طريقة واحدة للعدّ. تستخدم عدّادات كثيرة String.length وتعدّ وحدات UTF-16، فيُحسب الرمز التعبيري بـ 2 أو أكثر؛ وأخرى تقسّم الكلمات بتعابير نمطية تقطع عند الفواصل العليا فتعدّ "don't" أو "l'eau" كلمتين. هنا الأحرف هي ما تراه على الشاشة والكلمات تتبع قواعد Unicode، وهو الأقرب إلى طريقة عدّ الإنسان.
لماذا يغيّر حرف مُشكَّل تكلفة الرسالة النصية؟
تسمح أبجدية GSM ذات 7 بتات بـ 160 حرفًا في الرسالة، لكنها لا تتضمن كل الحروف المُشكَّلة: فيها é وñ وü وà، وليس فيها á وí وó وú. ويكفي حرف واحد خارج هذه الأبجدية لتتحول الرسالة كلها إلى UCS-2 وينخفض الحد إلى 70، أو إلى 67 لكل جزء إذا لزم التقسيم. يستخدم بعض المشغّلين الجدول الوطني الإسباني الذي يتضمنها، لكن لا يُنصح بالاعتماد على ذلك.
كم حرفًا يمكن أن يحتوي عنوان في Google؟
لا يقتطع Google حسب عدد الأحرف بل حسب العرض بالبكسل، نحو 600 على سطح المكتب، لذا يتوقف الحد الفعلي على الحروف: فحرف W يشغل مساحة أكبر بكثير من i. عادةً ما يظهر العنوان كاملًا بين 50 و60 حرفًا؛ ويُعرض الوصف التعريفي حتى نحو 155 إلى 160 حرفًا. تستخدم أشرطة الأداة هذه القيم مرجعًا.
هل يطابق العدّ ما يعدّه X (تويتر)؟
غالبًا نعم، لكن ليس تمامًا. يعدّ X كل رابط بـ 23 حرفًا بغض النظر عن طوله، والأحرف الصينية واليابانية والكورية بحرفين. أما النصوص الخالية من الروابط والمكتوبة بالحروف اللاتينية فالرقم نفسه.
كم بايتًا يشغل النص في قاعدة البيانات؟
يعتمد ذلك على ترميز العمود. في UTF-8 تشغل الحروف الإنجليزية بايتًا واحدًا، والحروف المُشكَّلة والسيريلية بايتين، والصينية 3، والرموز التعبيرية 4. يعدّ MySQL مع utf8mb4 طول VARCHAR بالأحرف لكن حد الصف بالبايت، ويستخدم SQL Server مع NVARCHAR ترميز UTF-16، وهو مقياس وحدات UTF-16 في هذه الأداة.