Токени, ключові слова та ідентифікатори C: типи та приклади

⚡ Розумний підсумок

Токени в мові C – це найменші окремі одиниці, які зчитує компілятор, і кожна програма на C складається з шести типів токенів: ключових слів, ідентифікаторів, констант, рядків, операторів та спеціальних символів, взятих з набору символів C.

  • 🔤 Набір символів: Вихідний код C використовує літери, цифри, пробіли та спеціальні символи, які поєднуються для формування кожної лексеми та символу.
  • 🧩 Шість типів токенів: Компілятор розбиває програму на ключові слова, ідентифікатори, константи, рядки, оператори та спеціальні символи.
  • 🔑 Ключові слова: У мові C зарезервовано 32 ключові слова, що записуються в нижньому регістрі, такі як int, for та return, кожне з яких має фіксоване значення, яке ви не можете перевизначити.
  • 🏷️ Ідентифікатори: Користувацькі імена змінних та функцій повинні починатися з літери або символу підкреслення та уникати зарезервованих ключових слів.
  • 🔢 Константи та рядки: Константи містять фіксовані значення, тоді як рядкові літерали групують символи в подвійних лапках, що закінчуються нульовим символом.
  • 🤖 Допомога AI: GitHub Copilot та подібні помічники пропонують валідні ідентифікатори, позначають конфлікти ключових слів та пришвидшують кодування на C.

Токени, ідентифікатори та ключові слова C

Що таке набір символів у C?

Як і будь-яка інша мова програмування, C також має власний набір символів. Програма — це набір інструкцій, які під час виконання генерують результат. Дані, що обробляються програмою, складаються з різних символів та символів. Згенерований результат також є комбінацією символів та символів.

Набір символів у C поділяється на:

  • літери
  • Numbers
  • Спеціальні символи
  • Пробіли (порожні місця)

Компілятор завжди ігнорує використання символів, але він широко використовується для форматування даних. Нижче наведено набір символів у програмуванні на C:

1) Листи

  • Символи верхнього регістру (AZ)
  • Символи нижнього регістру (az)

2) Numbers

  • Всі цифри від 0 до 9

3) Білі пробіли

  • Порожній простір
  • Нова лінія
  • Повернення вагона
  • Горизонтальна вкладка

4) Спеціальні символи

Спеціальні символи в мові C наведено в наведеній таблиці:

Особливий персонаж Опис
, (кома) { (відкриваюча фігурна дужка)
. (точка) } (закриваюча фігурна дужка)
; (крапка з комою) [ (ліва квадратна дужка)
: (двокрапка) ] (права дужка)
? (знак питання) ((відкриваюча ліва дужка)
' (апостроф) ) (закриваюча права дужка)
” (подвійні лапки) & (амперсанд)
! (знак оклику) ^ (вставка)
|(вертикальна смуга) + (доповнення)
/ (коса риска) – (підпунктtracція)
\ (зворотний слеш) * (множення)
~ (тильда) / (поділ)
_ (підкреслення) > (більше або закриваюча кутова дужка)
$ (знак долара) < (менше або розкриваюча кутова дужка)
% (знак відсотка) # (знак решітки)

Що таке токен у C?

Лексема — це найменша одиниця в програмі на C. Це кожне слово та розділовий знак, з якими ви стикаєтеся у своїй програмі на C. Компілятор розбиває програму на найменші можливі одиниці (лексеми) та переходить до різних етапів компіляції. Лексема AC поділяється на шість різних типів, а саме: ключові слова, Operaторів, рядків, констант, спеціальних символів та ідентифікаторів.

Шість типів токенів у C

У наступних розділах розглядається кожен із цих типів токенів, починаючи з двох, що складають кожен оператор C: ключових слів та ідентифікаторів.

Ключові слова в C

У мові C кожне слово може бути або ключовим словом, або ідентифікатором.

Ключові слова мають фіксоване значення, і його значення не можна змінити. Вони виступають у ролі будівельних блоків програми на C. У C є загалом 32 ключові слова. Ключові слова пишуться малими літерами.

У наступній таблиці представлені ключові слова в C:

Ключові слова в C Programming Language
автоматичний подвійний Int структура
перерву ще довго перемикання
випадок перерахувати реєструвати typedef
бак зовнішній повертати союз
сопзЬ коротка плавати непідписаний
продовжувати та цінності підписаний анулювати
дефолт На sizeof летючий
do if статичний в той час як

Ідентифікатори в C

Ідентифікатор — це не що інше, як ім'я, присвоєне елементу в програмі, наприклад, ім'я змінна або функцію. Ідентифікатори в Мова С – це імена, визначені користувачем, що складаються зі стандартного набору символів C. Як випливає з назви, ідентифікатори використовуються для ідентифікації певного елемента в програмі. Кожен ідентифікатор повинен мати унікальне ім'я. Для ідентифікаторів необхідно дотримуватися таких правил:

  • Першим символом завжди має бути літера або підкреслення.
  • Він має бути сформований лише за допомогою літер, цифр або підкреслення.
  • Ключове слово не можна використовувати як ідентифікатор.
  • Він не повинен містити пробілів.
  • Ім'я має бути змістовним.

Константи в C

Константа — це токен, значення якого не змінюється під час виконання програми. Константи мови C дозволяють зберігати фіксовані дані, такі як числа або текст, і захищати їх від випадкової зміни. Вони поділяються на кілька поширених категорій:

  • Цілі константи — цілі числа, такі як 10, -45 або 0.
  • Константи з плаваючою комою — дійсні числа з десятковою комою, такі як 3.14 або -0.5.
  • Символьні константи — один символ в одинарних лапках, наприклад, «A» або «9».
  • Рядкові константи — послідовність символів у подвійних лапках, наприклад, «Guru99 ".

Ви можете визначити константу за допомогою const кваліфікатор або #define директива препроцесора, наприклад const int DAYS = 7;Для глибшого ознайомлення з оголошенням фіксованих значень див. посібник з C. змінні, типи даних та константи.

Рядки на C

Рядок у C — це одновимірний масив символів, що завершується нульовим символом (\0). Оскільки C не має спеціального типу даних для рядків, рядкові літерали зберігаються як масиви символів, а нульовий символ позначає місце, де закінчується текст. Це дозволяє бібліотечним функціям знаходити кінець рядка без окремого лічильника довжини.

Ви можете створити рядок двома поширеними способами:

  • Як масив символів: char name[] = "Guru99";
  • Як вказівник на літерал: char *name = "Guru99";

Обидві форми зберігають шість видимих ​​символів плюс завершальний нульовий символ. Щоб докладніше ознайомитися з масивами символів та обробкою тексту, прочитайте навчальний посібник за темою рядки в C.

Operaтори в C

Оператор — це токен, який наказує компілятору виконати певну математичну, реляційну або логічну операцію над одним або кількома операндами. OperaОператори – це символи дій програми на C, а значення, над якими вони працюють, називаються операндами. Мова C групує їх у кілька сімейств:

  • Арифметичні оператори — виконувати обчислення, такі як +, -, *, / та %.
  • Оператори відношення — порівнювати два значення, такі як ==, !=, > та <.
  • Логічні оператори — поєднувати умови, такі як &&, || та !.
  • Оператори присвоєння — зберігати значення у змінній, такій як = та +=.
  • Побітові оператори — працювати з окремими бітами, такими як &, |, ^ та ~.

Разом із ключовими словами та ідентифікаторами, оператори дозволяють програмі виражати повні інструкції, які компілятор може перевести в машинний код.

Поширені запитання

Так. Мова програмування C чутлива до регістру, тому великі та малі літери розглядаються як різні. 32 ключові слова мають бути написані в малому регістрі, а ідентифікатори, такі як Total та total, посилаються на два окремі елементи в одній програмі.

Стандарт C не встановлює жорстких обмежень, але сумісному компілятору потрібно вважати значущими лише перші 63 символи внутрішнього ідентифікатора та 31 символ зовнішнього ідентифікатора. Keeping Короткі та описові назви уникають несподіванок, пов'язаних з перенесенням.

Ні. Пробіли, табуляція, символи нового рядка та коментарі – це роздільники, які компілятор використовує для розрізнення токенів, а потім відкидає. Вони не враховуються серед шести типів токенів, хоча пробіл може бути значущим усередині рядкового літерала.

Під час першої фази, яка називається лексичним аналізом, компілятор сканує вихідний код символ за символом і групує їх у найменші значущі одиниці. Потім кожен токен класифікується як ключове слово, ідентифікатор, константа, рядок, оператор або спеціальний символ.

Лексема — це фактична послідовність символів у вихідному коді, така як text int або count. Токен — це категорія, яку компілятор призначає цій лексемі, така як ключове слово або ідентифікатор. Кожен токен походить від відповідної лексеми.

Символьна константа — це один символ в одинарних лапках, наприклад, «A», який займає один байт. Рядковий літерал — це послідовність символів у подвійних лапках, наприклад, Guru99, і завжди закінчується прихованим нульовим символом, що потребує одного додаткового байта.

Так. Помічники кодування зі штучного інтелекту пропонують дійсні ідентифікатори, повні оператори на основі ключових слів та позначки імен, які конфліктують із зарезервованими ключовими словами під час введення тексту. Вони також можуть конвертувати коментар простою мовою в правильні оголошення C, хоча вам все одно слід переглянути згенерований код.

Копілот GitHub автодоповнює ідентифікатори C, ключові слова та цілі оператори з ваших коментарів або імен змінних. Він пропонує змістовні імена, попереджає про конфлікти ключових слів та створює шаблонний варіант, але кожна пропозиція все одно потребує ретельного перегляду.

Підсумуйте цей пост за допомогою: