НОВОСТИ   БИБЛИОТЕКА   ЭНЦИКЛОПЕДИЯ   КАРТА САЙТА   ССЫЛКИ   О САЙТЕ  






предыдущая главасодержаниеследующая глава

В поисках языка

Язык машины - язык чисел. На этот язык в принципе должна быть переведена вся информация, накопленная человечеством в области науки и техники, вообще вся сумма знаний, запечатленных в печатной продукции. Кодирование числами началось задолго до появления ЭВМ и информационного взрыва. Списки книг и произведений составлялись и древними греками, и египтянами, и жителями Двуречья. Уже в VII веке до и. э. на глиняных табличках из библиотеки ассирийского царя Ашшурбанипала давалось заглавие, номер таблички или собрания табличек, образующих "глиняную книгу" и т. д. Более ста лет назад, в 1876 году, американский библиотековед Мелвил Дьюи предложил классифицировать книги, относящиеся к различным областям знания, с помощью десятичных чисел.

Каждый основной раздел этой классификации обозначался одной цифрой, от нуля до девяти. При дальнейшем его делении к этой цифре присоединяется вторая, а затем и третья цифра. А чтобы индексы были всегда трехзначные, к однозначным и двузначным числам Дьюи добавлял нули. Например, естественные науки получают индекс 500, математика тогда будет под индексом 510, астрономия - 520, физика - 530, химия - 540, геология - 550, палеонтология - 560 и т. д.

Сведения о той или иной сфере могут быть в периодических изданиях, словарях и других публикациях. Они могут касаться истории вопроса, могут говорить о практическом применении и о многом другом. Дьюи разработал список таких делений, занумеровал его, и теперь тот или иной номер может присоединяться к трехзначному числу, индексу любого раздела классификации. Например, физика имеет индекс 530, а ее раздел механика - индекс 531. Тогда словари по механике кодируются как 53103 (словари обозначены в списке Дьюи числом 03), история механики - 53109 (09 - обозначение "истории вопроса").

А как быть со странами или языками? Дьюи предложил для обозначения их использовать окончания индексов филологии и истории, которые зафиксировали различные языки и страны мира. И тогда геология Европы получает обозначение 55040 (первые три цифры - индекс геологии, две вторые - Европы), геология Азии - 55050, геология Африки - 55060 и т. п.

Десятичной классификацией Дьюи пользуются почти девяносто процентов библиотек США и Великобритании. Однако в большинстве стран мира, в том числе и в нашей стране, используется другая десятичная классификация, именуемая универсальной, сокращенно УДК. Создана она была в начале нашего столетия и с тех пор продолжает совершенствоваться и расширяться. В последних изданиях УДК содержится более ста тысяч рубрик, охватывающих самые различные области человеческого знания. Полный объем ее таблиц составляет около пятисот авторских листов, то есть десяток томов по триста - пятьсот страниц в каждом.

Тысячи учреждений почти в сотне стран мира пользуются системой УДК. По сути дела, это своеобразный международный язык-посредник. Ведь тексты, выходящие на множестве различных языков мира, индексируются с помощью числового кода УДК. Зная этот код, мы можем перевести его символы средствами своего родного языка.

Система УДК представляет собой иерархию. Вершина ее - десять цифр, от нуля до девяти, обозначающих главные разделы: 0 - общий отдел, 1 - философия, 2 - религия, 3 - общественные науки и т. д. Далее по тому же десятичному принципу каждый из разделов дробится на отдельные подразделы, те, в свою очередь, на группы, группы - на подгруппы и так до тех пор, пока сохраняется необходимость членения. Чем больше развита та или иная область знания, тем больше и глубина деления.

Например, в минералогии и кристаллографии она достигла десятой степени, то есть отдельные понятия записываются в виде десяти цифр (структура кальцита обозначается числом 548.736.442.2, где цифра 5 обозначает математику и естественные науки, 4 - химию и т. д.). Там, где надо, глубина может увеличиваться безгранично.

Приведем для образца запись на УДК фрагмента текста на русском языке. Фраза "Строительство из стали с экономической точки зрения" будет записана так: 624.94.003.1. Первая цифра, шестерка, кодирует прикладные знания, медицину, технику; вторая - двойка - технику и инженерное дело. Сочетание цифр 624.94. обозначает строительство, каркасные конструкции. А цифры 003.1 - определитель "экономической точки зрения".

И все-таки какой бы совершенной ни была УДК или любая другая классификация этого типа, она не решает главных проблем, возникших в связи с информационным взрывом. Ибо такие системы, если можно так выразиться, одномерны. А поиск информации в наши дни идет по самому различному набору признаков, в многочисленных "измерениях". Специалисты по информатике иллюстрируют это на убедительном и наглядном примере.

Допустим, мы размещаем книги библиотеки по цвету их переплета. В одну группу помещаем книги в красном, в другую - в желтом, в третью - в голубом переплете. Но вот к нам попадает книга в зеленом переплете. Куда ее поместить? Мы выделяем еще одну группу. Когда у нас будет слишком много книг в светло-голубых переплетах, мы эти книги выделим в отдельную подгруппу или даже группу. Оттенки спектра бесчисленны. И мы можем, если потребуется, дробить и дробить эту группировку, используя тот или иной цвет или его оттенок.

Именно так и поступает УДК или подобная ей система. Только вместо бесконечного спектра здесь используется бесконечный ряд чисел. Но представим, что в нашу библиотеку попадает книга, переплет которой частью красный, а частью голубой. Куда ее отнести? К голубым или красным? Если мы отнесем ее и к голубым, и к красным книгам, получится двусмысленность, да и неточность: ведь книга-то не красная и не голубая, а красно-голубая.

Между тем в наше время то и дело возникают именно такие вот "красно-голубые", смешанные области знания, возникшие на стыке наук. Практические же применения их, если продолжить наше сравнение, вообще "серо-буро-малиновые": медицина переплетается с электроникой, психологией, математикой. Лингвистика, как вы сами убедились, читая эту книгу, стыкуется с инженерией, статистикой и т. д. и т. п. УДК и другие подобные ей системы малопригодны для информационного поиска по любым, заранее не предусмотренным сочетаниям предметов. И совсем непригодны они для поиска по единичным предметам, а также предметам межотраслевого характера, рожденным стыком наук или неожиданным контактом техники и нового открытия в науке...

Это вывод современных специалистов по информатике. Но задолго до рождения этой науки, еще в 1933 году, выдающийся индийский ученый Шиали Рамамрита Ранганатан указал на слабости цифровой классификации по типу УДК, обозначения "предметов и книг порядковыми числами, необходимого для достижения специфических целей". И не только указал на недостатки старой системы, но и разработал свою систему, весьма оригинальную. Принципы ее и по сей день используют ученые, работающие в области ИПЯ - информационно-поисковых языков. В наши дни создано несколько тысяч таких ИПЯ, так что по своему количеству они могут соперничать с естественными языками.

предыдущая главасодержаниеследующая глава

Все новое видео доступно в этой категории.










© GENLING.RU, 2001-2021
При использовании материалов сайта активная ссылка обязательна:
http://genling.ru/ 'Общее языкознание'
Рейтинг@Mail.ru
Поможем с курсовой, контрольной, дипломной
1500+ квалифицированных специалистов готовы вам помочь