നാല് പ്രധാന മോഡുകൾ
ഓരോ മോഡും അക്ഷരങ്ങളുടെ പരിധിയും സാന്ദ്രതയും തമ്മിൽ ഒത്തുതീർപ്പ് ചെയ്യുന്നു. ന്യൂമെറിക് മോഡ് അക്കങ്ങൾ മാത്രമേ കൈകാര്യം ചെയ്യൂ, പക്ഷേ മൂന്ന് അക്കങ്ങളെ 10 ബിറ്റിൽ പാക്ക് ചെയ്യുന്നു; ബൈറ്റ് മോഡ് ഏത് ബൈറ്റും കൈകാര്യം ചെയ്യും, പക്ഷേ ഓരോന്നിനും 8 ബിറ്റ് ചെലവഴിക്കുന്നു.
ആൽഫാന്യൂമെറിക് മോഡ് 45 അക്ഷരങ്ങളുടെ കൂട്ടത്തെ ഉൾക്കൊള്ളുന്നു: 0–9 അക്കങ്ങൾ, A–Z വലിയക്ഷരങ്ങൾ, സ്പേസ്, $ % * + - . / ചിഹ്നങ്ങൾ, കോളൻ. ചെറിയക്ഷരങ്ങൾ ഈ കൂട്ടത്തിലില്ല; അതുകൊണ്ടാണ് പൂർണ്ണമായും വലിയക്ഷരത്തിലുള്ള URL, ചെറിയക്ഷരത്തിലുള്ള അതേ URL നേക്കാൾ ചെറിയ കോഡ് ഉണ്ടാക്കാൻ കഴിയുന്നത്.
- ന്യൂമെറിക്: 0–9 അക്കങ്ങൾ, 3 അക്കത്തിന് 10 ബിറ്റ്
- ആൽഫാന്യൂമെറിക്: 45 അക്ഷരങ്ങൾ, 2 അക്ഷരത്തിന് 11 ബിറ്റ്
- ബൈറ്റ്: ഏത് 8-ബിറ്റ് മൂല്യവും, ഒരു ബൈറ്റിന് 8 ബിറ്റ്
- കാൻജി: Shift JIS ഡബിൾ-ബൈറ്റ് അക്ഷരങ്ങൾ, ഓരോന്നിനും 13 ബിറ്റ്
മോഡ് ഇൻഡിക്കേറ്ററുകളും സെഗ്മെന്റുകളും
ഡേറ്റയുടെ ഓരോ ഭാഗവും 4-ബിറ്റ് മോഡ് ഇൻഡിക്കേറ്ററും അക്ഷര എണ്ണവും കൊണ്ട് തുടങ്ങുന്നു; എണ്ണത്തിന്റെ നീളം മോഡിനെയും വേർഷനെയും ആശ്രയിക്കുന്നു. ഒരു കോഡിൽ ഇത്തരം പല സെഗ്മെന്റുകൾ ഉണ്ടാകാം, ഉദാഹരണത്തിന് നീണ്ട അക്ക നിരയ്ക്ക് ന്യൂമെറിക്, ബാക്കിയുള്ളവയ്ക്ക് ബൈറ്റ്; ഇത് ഫലം ചെറുതാക്കാൻ സഹായിക്കും.
മറ്റ് 4-ബിറ്റ് ഇൻഡിക്കേറ്ററുകൾ അക്ഷരക്കൂട്ടങ്ങളെയല്ല, സവിശേഷതകളെയാണ് സൂചിപ്പിക്കുന്നത്: അക്ഷര എൻകോഡിംഗ് പ്രഖ്യാപിക്കാൻ ECI, ഡേറ്റ പല കോഡുകളിലായി വിഭജിക്കാൻ സ്ട്രക്ചേർഡ് അപ്പെൻഡ്, GS1 ഉം മറ്റ് വ്യവസായ ഡേറ്റ ഫോർമാറ്റുകൾക്കും FNC1. നാല് പൂജ്യം ബിറ്റുകളുടെ ടെർമിനേറ്റർ ഡേറ്റ അവസാനിപ്പിക്കുന്നു.
- ന്യൂമെറിക് 0001, ആൽഫാന്യൂമെറിക് 0010, ബൈറ്റ് 0100, കാൻജി 1000
- ECI 0111, സ്ട്രക്ചേർഡ് അപ്പെൻഡ് 0011
- FNC1 ഒന്നാം സ്ഥാനം 0101, രണ്ടാം സ്ഥാനം 1001
- ടെർമിനേറ്റർ 0000
ബൈറ്റ് മോഡും അക്ഷരക്കൂട്ടങ്ങളും
ബൈറ്റ് മോഡിന്റെ നിലവാരത്തിലെ സ്ഥിര വ്യാഖ്യാനം ISO-8859-1 (Latin-1) ആണ്; എന്നാൽ ഇന്ന് മിക്ക ജനറേറ്ററുകളും UTF-8 ആണ് എഴുതുന്നത്, അതിലൂടെ ആക്സന്റ് അക്ഷരങ്ങളും മറ്റ് ലിപികളും ഇമോജിയും നഷ്ടപ്പെടാതെ നിലനിൽക്കുന്നു. ബൈറ്റുകൾ പരിശോധിച്ച് റീഡറുകൾ സാധാരണയായി UTF-8 തിരിച്ചറിയുന്നു.
അക്ഷരക്കൂട്ടം അവ്യക്തമാകരുതാത്തിടത്ത്, ECI ഹെഡർ അത് വ്യക്തമായി പ്രഖ്യാപിക്കാം. ഇല്ലാതെ വന്നാൽ, റീഡർ ഇടയ്ക്ക് തെറ്റായി ഊഹിച്ച് വികലമായ അക്ഷരങ്ങൾ കാണിച്ചേക്കാം.