Подсистема «Информационное обеспечение АИС»
Одним из существенных структурных компонентов АИС является подсистема информационного обеспечения. Подсистема «Информационное обеспечение» АИС — это совокупность баз данных, файлов, документов и лингвистических средств, обеспечивающая реализацию информационной составляющей АИС.
Структура подсистемы состоит из следующих основных блоков:• базы данных (БД);
• базы знаний (БЗ);
• лингвистические средства.
Базы данных АИС. Особую значимость для подсистемы составляют БД [24, 41, 67]. База данных АИС — это совокупность файлов, документов, показателей, данных, упорядоченных по определенным признакам, имеющим общие принципы описания, хранения и манипулирования данными, а также обеспечивающих их независимость от прикладных программ. В БД АИС может быть представлена не только экономическая, но и правовая, научная, техническая и другая информация.
В основе классификации БД могут быть положены различные основания деления, некоторые из них приведены ниже. В большинстве случаев выбор оснований систематизации БД определяется конкретными условиями работы предприятия и характером функциональных и информационных задач.
По форме представления данных различаются одноконтурные и многоконтурные БД. Основная форма представления БД двухконтурная. Первый контур хранится на внешнем накопителе ЭВМ (жесткий магнитный диск, магнитная лента, магнитный барабан и др.), а второй контур как страховой может быть представлен на флоппи и (или) CD и других носителях. Могут быть и трехконтурные БД, когда третий контур представлен и сохраняется на традиционных бумажных документах. БД АИС четвертого контура может быть представлена в форме микрофильмированной ленты и (или) ее отдельных отрезков.
По характеру содержащейся информации различают фактографические, документальные и смешанные БД. Фактографическая БД отображает конкретные сведения, необходимые пользователю — факты, показатели, свойства продукции, формулы расчета какой-либо величины, отрывок (фрагмент) текста документа, документ полностью и др.
Документальная БД содержит только сведения о документах — библиографическое описание документа, аннотацию, реферат, идентификатор документа, адрес его хранения в БД и т.д. Сам документ хранится, как правило, во внешнем контуре БД — шкафу, хранилище, библиотеке-депозитарии и др. В документальных БД по массиву первого контура проводится поиск адреса хранения полного текста документа, а затем по адресу осуществляется доступ и к самому документу. Подобное размещение документальных БД продиктовано желанием сократить физический объем информации и обеспечить тем самым быстроту доступа к необходимой информации. При условии высокой производительности ЭВМ, отсутствия дефицита внешней памяти документальные БД объединяют во внешней памяти ЭВМ первый и второй контуры.В смешанных БД представлены как фактографические, так и документальные массивы информации.
Базы данных имеют определенные способы построения, так называемые модели баз данных: иерархические, сетевые, реляционные и объектно-ориентированные.
Иерархическая модель БД построена по принципу древовидного графа, в котором информационные элементы представлены по уровням их соподчиненности (иерархии). Например, на первом уровне расположены сведения об объекте («Конкуренты»), на втором уровне — о продукции, которую они поставляют на рынок, на третьем уровне — цена продукции и т.д. Таким образом, в структуре иерархии каждый порожденный узел не может иметь более одного порождающего (выходного) узла. Корень дерева здесь не порожденый, а порождающий узел. Узлы, не имеющие выхода, носят названия листьев. При поиске необходимых данных происходит чтение записей от корня к листьям дерева, т. е. сверху вниз. Достоинством стало то, что подобная структура БД обеспечивает более быстрый доступ и выдачу данных пользователю. Вместе с тем, недостатком представляется жесткость иерархической структуры. Отсутствует информационная гибкость в поиске, так как за один проход невозможно получить данные, например, о ценах одного товара разных поставщиков.
В иерархической модели реализована связь между данными по схеме «один-ко-многим».Сетевая модель БД имеет независимые типы данных, т.е. «Конкуренты», и зависимые типы данных — продукция и цены на продукцию. В сетевых моделях возможны как прямые, так и обратные виды связей между данными (записями). Существует ограничение — каждая связь должна включать в себя основную и зависимую записи. К достоинству сетевой модели можно отнести гибкость организации и доступа к данным относительно иерархической модели. Как недостаток можно указать, что сохраняется относительная жесткость в построении структуры БД. Это влечет необходимость в определенных ситуациях реструктурирования БД, препятствует реализации более гибкой стратегии поиска данных.
Реляционная модель БД имеет независимую организацию взаимосвязи логических и физических записей. Отношения между данными построены в виде двухмерных таблиц и наделены определенными признаками.
Каждый элемент таблицы отображает одно данное. Элементы столбца таблицы имеют одинаковую природу, отображая одно свойство (признак) в строке (записи) таблицы.
При поиске данных строки и столбцы могут анализироваться в любом порядке независимо от их содержания, что существенно улучшает характеристики поиска, как в содержательном, так и в технологическом смысле. Достоинства реляционной модели объясняются тем, что в ее основе лежит строгий аппарат реляционной алгебры. В этой модели реализована простота доступа к данным, гибкость поиска и защиты данных, независимость данных, относительная простота построения языка манипулирования данными. Язык запроса в соответствии с реляционной алгеброй включает следующие основные понятия: проекция, соединение, пересечение и объединение. Язык описания данных описывает характер поиска данных без указания последовательности действий, необходимых для получения ответа на запрос.
В соответствии с нашим примером реляционная БД имеет три таблицы: T1 — таблицу поставщиков, T2 — таблицу продукции и T3 — таблицу цен на продукцию.
Таблица T1 имеет следующую структуру. Каждый конкурент имеет уникальный номер, наименование фирмы, место дислокации (город), значение индекса конкурентоспособности и др. Таблица T2 описывает товары, которые конкуренты поставляют на рынок. Каждый вид продукции имеет уникальный номер, наименование, габариты, вес и др. Таблица T3 содержит данные о цене товаров — номер конкурента, номер продукции, ее цену на рынке. Таблица T3 служит для того, чтобы обеспечить связь между двумя первыми таблицами. Таким образом, первая строка таблицы Т3 связана с определенным конкурентом из таблицы Т1, поставляющим на рынок определенный товар из таблицы Т2. Например, первая строка таблицы Т3 отображает цену — 300 руб. товара определенного вида таблицы Т2 конкурента с определенным идентификатором из таблицы Т1. Таким образом, можно узнать, какие товары каких конкурентов имеют на рынке определенную цену. Можно структурировать запросы и по другим параметрам, например, какие конкуренты выпускают товары определенного вида.Применение реляционных БД позволяет:
• собирать и хранить данные в виде таблиц;
• легко обновлять данные;
• получать информацию по атрибутам или записям;
• отображать полученные данные в виде диаграмм или таблиц;
• производить необходимые расчеты по данным базы и др.
Объектно-ориентированная модель БД — пример реализации БД
более высокого логического уровня. ООБД возникли на концептуальной основе ООП. В отличие от структурного, ООП базируется не на процедурных (программных) категориях (циклы, декларации, условия и др.), а на более широкой категории — объектах. Объектом можно объявить все, что представляет интерес для обработки данных на ЭВМ — завод, подразделение, работника, программу ЭВМ, запись БД, пиктограмму экранного окна и т.д. Объект — программно связанный набор процедур, методов и свойств, реализующих определенную задачу. Процедура — это совокупность операций, которые может выполнять объект. Метод — это способ, прием, которым пользуется объект при выполнении процедур. Свойство — это признак, с помощью которого описывается объект. Например, работник как объект характеризуется свойствами, характеризующими его функциональные способности, технологическими процедурами, которые он выполняет в процессе трудовой деятельности и методами, посредством которых реализуются технологические процедуры.
Организация ООБД имеет несколько стадий:
1) концептуальная модель, когда множество объектов БД прошли описание по соответствующим правилам;
2) логическая модель, когда определены свойства объектов и указаны логические взаимосвязи между объектами;
3) физическая модель, когда определены адреса и проведено размещение объектов в памяти ЭВМ.
В настоящее время для упрощения создания ООБД развиваются системы программирования класса ООП. При этом унифицируются многие процедуры порождения объектов путем создания шаблонов, масок для описания методов и свойств объектов и др. Многие крупные фирмы заняты в настоящее время разработкой систем ООП. Примером может служить фирма Microsoft, предлагающая на рынке такие системы, как Visual Basic, Visual FoxPro, Access, MS SQL Server. Эти системы обеспечивают не только создание объектов, но и организацию ООБД, предоставляют дополнительные средства работы с ними. Они наиболее эффективно решают задачи создания и манипулирования данными реляционных БД. В настоящее время ООБД не имеют полностью завершенной теоретической базы. Однако настоятельное требование практики в решении задач, в частности, развития мультимедиа, расширения средств интеграции полиформатных систем, увеличения функциональных возможностей вычислительных сетей и телекоммуникаций станет существенным стимулом для дальнейшего развития теории ООБД.
В структуре подсистемы «Информационное обеспечение» определенное место занимает понятие единицы информации и ее свойства.
Единицы информации в АИС могут быть как физическими (синтаксическими), так и семантическими категориями. К ряду физических единиц можно отнести: бит, байт, символ. К семантическому уровню единиц информации АИС относятся категории, которые обозначают в основном логическую иерархию смысловых единиц информации — атрибут, реквизит-признак, параметр, показатель, запись, документ по унифицированной или произвольной форме, файл, БД по определенной предметной области и др. Свойства каждой из указанных категорий накладывают свой отпечаток на способы организации размещения и хранения единиц информации о качестве ИС. Каждая единица информации как логический элемент структуры БД, представляет собой определенный объем смысла, структурированного содержания об управляемом экономическом объекте. Семантическая единица информации БД — это определенный объем информации, отображающий категорию измерения содержания БД.
Наиболее распространенная единица информации об управляемом экономическом объекте — документ. Экономический документ — это материальный носитель с закрепленной на нем экономической информацией, имеющей юридическую силу.
По признаку технологичности документы АИС разделяются на входные, промежуточные и выходные:
• входные документы содержат исходные данные о состоянии управляемой экономической системы;
• промежуточные документы могут быть сгенерированы в процессе интерактивного контроля технологии обработки данных об управляемом объекте. Кроме того, они могут содержать системные сведения, необходимые и применяемые для решения нескольких задач АИС, например нормативы, расценки на выполнение определенных производственных операций, контрольные данные о качестве технологии обработки данных и др.;
• выходные документы содержат информацию по широкому спектру вопросов, раскрывающих состояние управляемой фирмы, — объем произведенной продукции, финансовое состояние фирмы, структура персонала и др.
Семантическая структурная единица документа — показатель. Экономический показатель — величина (критерий, уровень, индекс, измеритель), отображающая состояние экономического объекта по его отдельной составляющей. В зависимости от характера содержания отображаемой информации показатели можно разделить на качественные и количественные. По уровню агрегирования показатели разделяются на элементарные, групповые, интегральные, комплексные, обобщенные и др. В зависимости от области применения экономические показатели делятся на аналитические, прогнозные, плановые, расчетные, статистические и др. Показатель состоит из двух основных единиц — реквизита-признака и реквизита-основания. Реквизит-признак — это часть показателя, отображающая качественную сторону состояния объекта, а реквизит-основание — это часть показателя, отображающая количественную сторону состояния объекта. Например, в показателе «Увеличение производства холодильников завода «Айсберг» в 2003 г. по сравнению с 2002 г. составило 10 %» реквизит-основание — 10 %, а вся остальная часть записи — это реквизит-признак. Более подробная характеристика элементов структуры документа и показателя и их взаимосвязи с другими элементами информации приведена в разд. 13.2.
В организации БД следует также учитывать другую семантическую единицу — атрибут, который связан с логикой показателя, в частности реквизита-признака. Атрибут — элементарная семантическая единица информации. Элементарность в данном случае обозначает неделимость атрибута на низшие смысловые компоненты без потери смысла. Так, в вышеуказанном примере атрибутом будет разновидность холодильника, например, «Полюс», «Снежинка» и др. Выделение множества атрибутов играет определенную роль при разработке лингвистических средств информационного обеспечения АИС, в частности, разработке ИПЯ классификационного типа — классификаторов и кодификаторов технико-экономической информации.
В структуру БД АИС входят различные компоненты — агрегаты, массивы, файлы и др. Агрегат — структурированная совокупность информационных объектов, определяемая как единый тип данных. Агрегаты в основном представляются файлами текстового вида. Вместе с тем могут быть агрегаты мультимедийного характера, например для решения задач презентации фирмы, ее продукции и др. Довольно значительный ряд агрегатов может быть отображен в форме диаграмм, гистограмм, графиков, как в черно-белом, так и в цветном виде. Массив информации — это поименованная совокупность однотипных (логически однородных) элементов, упорядоченных по индексам, которые определяют положение элементов в массиве. Элементами массива могут быть документы, файлы, записи и др. Один из весомых параметров массива — его измерение, которое можно обозначить как градацию размерности массива. Такими градациями могут быть одномерные массивы, имеющие одно измерение, например запись файла, двухмерные массивы, например строки и столбцы таблицы, и др. Индексы играют важную роль в организации данных. Они позиционируют элементы и указывают его адрес в массиве. Так, например, индекс может выступать в роли адресной константы, используемой для модификации адреса путем суммирования ее значения с вычисленным в программе адресом.
Файл — опорный структурный элемент БД. Файл — это поименованная область внешней памяти ЭВМ. Файл может содержать различную информацию: текстовый документ, рисунок, музыкальное произведение, программу ЭВМ и др. Каждый файл записывается и хранится во внешней памяти ЭВМ и имеет собственное имя, идентифицирующее его в комплексе файлов, находящихся в БД. Структура имени файла состоит из левой и правой частей, разделяемых точкой. Левая часть, как правило, означает содержание файла и имеет различный формат в зависимости от применяемой в АИС операционной системы. Например, в дисковой операционной системе формат левой части имени файла составляет не более восьми символов, в операционной системе Windows формат этой части составляет не более 256 символов. Правая часть — расширение имени файла — состоит из трех символов и обозначает класс файла. Так, например, файлы, подготовленные в текстовом редакторе Word, имеют расширение doc, файлы, подготовленные в графическом редакторе Paint Brush, имеют расширение bmp, файлы, содержащие программы, — exe, com.
Файлы составляют основную часть БД АИС. В них может быть представлена информация о состоянии экономической системы в различных разрезах:
• по классам экономических объектов;
• по номенклатуре продукции;
• по этапам сборки изделий;
• по реализации товарной продукции;
• по значениям групп показателей качества выпускаемой продукции и др.
С целью рационального решения задач обработки данных проводится соответствующее размещение файлов в БД. Классифицировать размещение файлов в БД можно по нескольким основаниям деления. Например, по функциональным подсистемам (информация по планированию производства, по учету и отчетности, по материально-техническому снабжению), по видам документов (организационно-распорядительные, плановые, фактические и т.д.). Каждый из указанных классификационных признаков, в свою очередь, может быть разделен на формы информации, содержащие более конкретные сведения о качестве элементов управляемого объекта.
Очень часто файлы в БД представлены в табличной форме. Таблица — способ формализованного представления данных в виде двухмерного массива. Таблица состоит из строк и столбцов. Строки таблицы обозначаются записями. Запись — это единица обмена данными между программой и внешней памятью ЭВМ. Тип записи определяет вид файла данных. Это могут быть файлы, имеющие:
• записи фиксированной длины;
• записи переменной или неопределенной длины;
• байтовый или битовый поток данных.
Запись может содержать данные о различных объектах — отдельном человеке, устройстве, процессе и др. Записи состоят из полей, содержащих отдельные данные об объекте. Поле записи — часть записи файла, имеющая функционально самостоятельное значение и обрабатываемая в программе как отдельный элемент данных. Столбцы таблицы определяют свойства, характеристики, признаки, атрибуты объектов, например год рождения человека, его пол, профессию и др. Каждый столбец относится к определенному полю записи.
Необходимые пользователю данные могут находиться в нескольких записях, размещаться в нескольких таблицах. Для обеспечения связывания записей таблиц, доступа к записям и поиска нужной информации в БД применяются так называемые ключи. Ключ — это совокупность знаков, используемая для идентификации записи в файле и быстрого доступа к ней. Ключ представляет уникальный номер записи в БД, ее фрагмента, файла и присваивается каждой записи при ее загрузке в БД. По характеру выполняемых функций в реляционных БД различают основной (первичный) и исходный (внешний или вторичный) ключи. Основной ключ — это ключ, который однозначно идентифицирует запись в таблице. Ключи присваиваются записям так, чтобы в таблице не было двух строк с одинаковым значением ключа. Следующий этап связывания таблиц — определение внешнего ключа. Исходный, или внешний, ключ отображает значение ключевого поля записи, уникально идентифицирующее ее в массиве. Этот ключ создается в таблице, поля которой имеют ссылки на «главную» или «родительскую» таблицу массива. Таким образом, в каждой строке «подчиненной» или «дочерней» таблице значение внешнего ключа соответствует значению первичного ключа. Поле ключа и его значение определяет лицо, создающее массив или файл. Значения ключей расположены в специально предназначенных для этого полях записи.
После связывания первичных и внешних ключей в подчиненной таблице должны быть определены ограничения на значения полей, отображающих внешние ключи. В управлении данными всегда необходимо согласовывать изменения ключевых полей главной таблицы со значениями в подчиненной таблице, иначе может быть нарушена целостность данных. Целостность данных — это система условий и правил, обеспечивающая защиту данных от нежелательных изменений и удалений. Например, если в роли первичного ключа выбран табельный номер работника и с ним установлена связь внешних ключей различных таблиц, то при корректировке табельного номера в главной таблице связь будет нарушена. Записи в подчиненной таблице будут потеряны, так как с ними не будет сопоставлена ни одна строка главной таблицы.
Для связывания записей главной и подчиненной таблиц существует несколько типов связей:
• «один-к-одному» — каждой строке главной таблицы соответствует единственная строка (или ни одной) подчиненной таблицы, и
каждая строка зависимой таблицы должна быть связана с одной строкой главной таблицы. Например, каждый человек имеет единственного отца и единственную мать;
• «один-ко-многим» — каждой строке главной таблице соответствует ни одна, одна или более строк подчиненной таблицы. Вместе с тем, каждая строка зависимой таблицы должна иметь связь с единственной строкой главной таблицы. Примером такого типа связи может служить связь руководителя с подчиненными;
• «многие-ко-многим» — каждой строке главной таблицы соответствует ни одна, одна или совокупность строк подчиненной таблицы. При этом каждая строка подчиненной таблицы может быть связана с одной и более строкой главной таблицы. Пример такой связи — взаимодействие сотрудников в трудовом процессе. Каждое производственное задание может выполняться несколькими сотрудниками, каждый сотрудник может выполнять несколько производственных поручений.
Реализация связей осуществляется в зависимости от характера БД в виде схемы данных. В этой задаче ключи служат для индексной организации данных в форме индексированных файлов. Индексированный файл — файл, снабженный системой индексов, обеспечивающей быстрый доступ к записям файла. В зависимости от применяемых ключей различают:
• прямой файл — файл, доступ к записям которого осуществляется по адресу либо последовательно путем поиска по ключу. В плане прямого доступа следует указать индексный файл, упорядоченный по значениям одного или нескольких полей БД, список указателей на ее записи. В качестве указателей здесь используются логические или физические адреса. Логический адрес записи — внутренний номер (ключ БД), уникально идентифицирующий запись в базе данных или ее фрагменте (области) и присваиваемый записи в процессе ее загрузки в БД. Физическим адресом выступает число, идентифицирующее ячейку или область физической памяти ЭВМ. Смежный с индексным файлом — индексно-последовательный файл, у которого каждая запись снабжена своим ключем так, что обеспечивается прямой доступ к записи по ключу, а также последовательный доступ в соответствии с упорядоченностью записей по ключам. Применяются также связанные файлы, записи которых объединены в цепной список. Для организации этого списка могут быть применены индексно-последовательный и прямой файлы;
• последовательный файл — файл, к записям которого обеспечивается только последовательный доступ в соответствии с упорядоченностью этих записей. В данном случае обращение к записям производится путем их последовательного чтения и идентификации. Существуют инвентированный файл, в котором записи упорядочены по неключевому полю, полностью инвентированный файл, который имеет индексы по всем вторичным ключам, частично инвентированный файл, имеющий индексы по отдельным, но не всем вторичным ключам.
Базы знаний АИС. В решении экономических задач особую важность имеют БЗ.
БЗ организуются в составе АИИС [20, 36]. База знаний — это совокупность знаний, организованная по принципам порождения знаний, явно не присутствующих в исходных данных. Обычно к знаниям относят результаты познания действительности, проверенные практикой. Знания — это приобретенные человечеством в процессе познания факты, истины, принципы, методы и пр. В отличие от обычной БД в БЗ размещаются знания, получаемые на основе данных, содержащихся в обычных документах, книгах, статьях, отчетах и др. Организация знаний в БЗ происходит в соответствии с методологией классификации объектов познания. Каждый объект представляется совокупностью элементов знаний. В соответствии с концептуальными связями элементы объединяются и образуют БЗ. Концептуальные связи БЗ имеют следующие разновидности: общность, партитивность, противопоставление и функциональная взаимозависимость. Общность — это связь элементов знаний по содержанию их характеристик. Партитивность — это соотношение целого и его частей относительно элемента знания. Противопоставление — это отображение связей между элементами, которые имеют противоположные характеристики. Функциональная взаимозависимость — это отображение связей между элементами, имеющими процедурную связь.
БЗ широко используются не только для извлечения знаний пользователями, но и для решения задач искусственного интеллекта. В составе экспертных систем применяются статические и динамические БЗ. Статическая БЗ содержит сведения, отображающие особенности конкретной предметной области и остающиеся неизменными в ходе решения задачи. Динамическая БЗ применяется для организации сведений, важных для решения конкретной задачи и изменяющихся в процессе ее решения. Генерация БЗ выполняется на основе механизма АИИС с помощью набора сведений, правил, аппарата логического вывода и др. (см. 4.8.).
Лингвистические средства АИС. Значительную часть подсистемы «Информационное обеспечение» составляют лингвистические средства. Лингвистические средства АИС — это совокупность ИПЯ, методик индексирования и критерия смыслового соответствия АИС. В составе лингвистических средств содержатся следующие компоненты:
• ИПЯ;
• методики индексирования документов;
• типы, форматы, структуры информационных категорий (данные, показатели, записи, таблицы, файлы, документы с указанием их «шапок» и «боковиков», массивы и др.)
• критерий смыслового соответствия (критерий выдачи) документов и (или) поисковых образов документов по различным классам документальной информации, содержащейся в БД.
В решении задач АИС связующее звено между пользователем и ЭВМ — ИПЯ. Информационно-поисковый язык АИС — это упорядоченное множество понятий, терминов определенной предметной области, предназначенное для отображения содержания документов и запросов с целью обеспечения ввода документов и запросов в ЭВМ и осуществления последующего поиска данных. Словарная единица ИПЯ — ключевое слово, которое может быть как отдельным словом, так и словосочетанием. При условии устранения неоднозначности отдельных слов ключевые слова обозначаются как дескрипторы ИПЯ.
Посредством ИПЯ в технологии обработки данных осуществляется индексирование документов и запросов. Индексирование — это совокупность логических операций по отображению содержания документов и запросов средствами принятого ИПЯ. По уровню применения технических средств индексирование бывает ручное и автоматическое. При ручном индексировании процессы анализа документов и запросов выполняются без применения ЭВМ. При автоматическом индексировании ЭВМ выполняет функции анализа текстов документов и запросов, определения их значимости (весомости) и формирования состава дескрипторов ПОД и ПОЗ. При автоматическом индексировании ЭВМ поручаются функции дериватного, прописного индексирования и автоматической классификации. Так, например, дериватное индексирование, или индексирование извлечением, представляет собой метод автоматического индексирования документов, при котором программа ЭВМ анализирует лексический состав текстов и выбирает из них те слова и их сочетания, которые удовлетворяют заданным критериям. Одним из таких критериев может быть критерий поиска. Программы автоматического индексирования довольно сложны и обычно относятся к продуктам высокоинтеллектульного труда. Автоматическое индексирование имеет относительно высокую стоимость и применяется в АИС, где это экономически и (или) функционально оправдано. В результате индексирования получаются ПОД и ПОЗ. Поисковый образ документа — это совокупность ключевых слов, кодовых обозначений, отображающих содержание документа, адрес хранения и его системный номер (идентификатор). Поисковый образ запроса — это совокупность ключевых слов, отображающих содержание запроса и условия поиска документов.
Следует различать ИПЯ классификационного и дескрипторного типов. Наибольший удельный вес в экономических АИС занимают ИПЯ классификационного типа — классификаторы и кодификаторы. С учетом классификаторов строится принципиальная схема управления экономическим объектом. Классификатор — это систематизированная совокупность наименований и кодов языковых элементов определенной предметной области. Классификаторы строятся по иерархическому принципу. Исходное множество элементов делится на группировки следующего уровня деления и образуют древовидную систему группировок. Для выделения группировок применяется соответствующий признак (основание) деления. Каждому элементу классификатора по принципу однозначного соответствия проставляется код. Код может быть цифровым, буквенным, комбинированным. По применяемому способу кодирования классификаторы имеют следующие основные разновидности:
• десятичные классификации;
• библиотечно-библиографические классификации;
• фасетные классификации.
В десятичных классификациях множество объектов делится на десять частей, каждая из которых, в свою очередь, также делится на десять частей и т.д. Представитель десятичной классификации — УДК. УДК в современной информатике — это международная классификация, охватывающая все отрасли знаний, в том числе и экономику, она строится по десятичному принципу и используется в современных ИС, в том числе и АИС, для индексирования экономических и других документов и последующего их поиска в справочно-информационных фондах, автоматизированных базах данных и др. УДК впервые была введена в качестве обязательного классификатора в 1962 г. для индексирования документов по естественным, точным и техническим наукам.
ББК основана на порядке следования букв в том или ином алфавите. В России действует ББК, разработанная Всероссийской государственной библиотекой. Вся область знаний разбита на количество разделов (подобластей), равное количеству букв русского алфавита, за исключением «неудобных», в частности ь, ъ, й. На втором и последующем уровнях деления каждый уровень также разделяется на такое же количество подразделов и т. д. В системе органов научной информации ББК применяется с 1962 г. для обозначения документов по гуманитарным областям знаний. В научно-технических библиотеках для систематизации и кодирования определенной группы документов применяются обе системы классификации.
Фасетная классификация — это разновидность системы классификации, в которой реализована возможность классификации объектов параллельно по нескольким различным признакам. Возможность параллельной классификации не означает принципиальную обязательность этого условия для всех фасетных классификаций. Так, например, поставщик комплектующих изделий при определенных условиях может быть идентифицирован как кредитор и (или) дебитор.
В соответствии с принципом фасетной классификации в России разработана и применяется Единая система классификации и кодирования. Она включает в себя следующие классификаторы:
• общегосударственные — разрабатываются в централизованном порядке, едины и обязательны для применения по всей стране;
• отраслевые — разрабатываются соответствующими отраслями для решения задач. Отраслевые классификаторы в определенных случаях могут быть задействованы и в АИС других отраслей, например, шифры счетов бухгалтерского учета применяются во многих отраслях деятельности;
• локальные — разрабатываются предприятиями на номенклатуры, относящиеся только к данному предприятию, например коды предоставляемых услуг, коды (табельные номера) сотрудников и др.
В начале 1970-х гг. для лингвистического обеспечения АИС в стране начали разрабатываться общегосударственные классификаторы. В настоящее время насчитывается свыше сорока классификаторов общегосударственного уровня. Систему классификаторов можно разделить на следующие разновидности:
• классификаторы структуры отраслей народного хозяйства, в частности, общегосударственный классификатор отраслей народного хозяйства — ОКОНХ, система обозначений органов государственного управления — СООГУ, система обозначений административно-территориальных объектов — СОАТО, общегосударственный классификатор предприятий и организаций — ОКПО, общегосударственный классификатор форм собственности — ОКФС;
• классификаторы продукции, например общегосударственный классификатор промышленной и сельскохозяйственной продукции — ОКП;
• классификаторы ресурсов, например общегосударственный классификатор профессий рабочих, должностей служащих и тарифных разрядов — ОКПДТР;
• классификаторы информационных единиц, например общегосударственный классификатор технико-экономических показателей — ОКТЭП, общегосударственный классификатор управленческой документации — ОКУД.
Эффективность автоматизированной обработки информации требует предварительного представления ее в удобной и компактной форме, что достигается в процессе ее кодирования. Код — это элемент системы условных обозначений объекта или элементов информационной совокупности в виде знака или группы знаков, выраженных цифрами, буквами, символами и различными сигналами.
Процесс присвоения объектам кодовых обозначений называется кодированием. Основная цель кодирования состоит в однозначном определении объектов, а также в обеспечении необходимой достоверности кодируемой информации. При проектировании кодов к ним предъявляется ряд требований:
• охват всех объектов, подлежащих кодированию, и их однозначное определение;
• возможность увеличения количества объектов кодирования без изменения правил их обозначения;
• удобство восприятия и запоминания кодовых обозначений экономистом, обеспечивающее простоту заполнения, чтения и обработки статистического отчета;
• максимальная информативность кода при минимальном его формате (значности) с целью эффективной обработки информации;
• возможность использования кодов для автоматического получения сводных итогов;
• возможность автоматического контроля кодовых обозначений с целью обнаружения ошибок.
Для осуществления поиска по документальным БД в АИС применяются дескрипторные языки. При решении задач экономист постоянно встречается с вопросами, которые ему ранее решать не приходилось. Поэтому ему часто приходится обращаться к документам, научным источникам, содержащим необходимую для него информацию и данные по передовым методам работы. Кроме того, ему постоянно необходима нормативная, правовая информация, содержащаяся в юридических БД. Для организации документальных БД и реализации поиска в них предназначены дескрипторные языки. Дескрипторный язык АИС — это разновидность ИПЯ, применяемого в АИС для поиска необходимых документов по тематике, связанной с решением экономических задач. Методика их разработки существенно не отличается от методики дескрипторных языков в других предметных областях и базируется на идее координатного индексирования. В основе координатного индексирования лежит представление о том, что содержание любого документа или текста можно отобразить с достаточной степенью полноты и точности набором так называемых ключевых слов или списком. Ключевое слово в среде дескрипторного ИПЯ понимается как наиболее существенное для этой цели понятие, термин, словосочетание, имя собственное, хронологические данные, величина измерения и т.п., которые явно или в скрытом виде содержатся в индексируемом документе. Например, документ, содержащий информацию о методике и программных средствах выполнения расчетов для разработки бизнес-планов на предприятиях пищевой промышленности после его прочтения и анализа содержания может быть индексирован следующим списком ключевых слов: методика, расчеты, средства, программа ЭВМ, бизнес-план, предприятие, пищевая промышленность. Этот список слов — часть ПОД. Подобным образом индексируется и запрос пользователя, предъявляемый в форме ПОЗ.
Разумеется, поиск нужных документов АИС возможен при условии обеспечения единообразия индексирования документов и запросов. Существенный компонент лингвистических средств — методы индексирования. В рамках АИС индексированию подвергаются документы, вводимые в БД, и запросы на поиск данных. Индексированию подвергаются входные документы АИС, содержащие документальную и фактографическую информацию. Аналитико-синтетическая переработка документов, содержащих документальную информацию, строится по традиционной схеме путем выделения в документах формальных и содержательных признаков, ключевых слов дескрипторного языка и фиксирования их в формате ПОД.
Индексирование документов, содержащих фактографическую информацию, выполняется посредством применения языков классификационного типа. Каждая классификационная рубрика (реквизит-признак) снабжается соответствующим шифром (кодом) классификатора.
Следует отметить, что процедуры индексирования документов в АИС могут быть реализованы как традиционным (ручным), так и автоматическим способом. Автоматическое индексирование, например, фактографической информации может выполняться на этапе ввода в ЭВМ, распознавания лексем рубрик классификаторов или последующего определения кода соответствующего реквизита входного документа.
В организации стратегии и эффективности поиска документальной информации большое значение имеет критерий поиска — условие поиска данных, указываемого в запросе или программе. В общем смысле критерий поиска обозначает степень соответствия найденных данных условию поиска. Разновидность критерия поиска — критерий выдачи.
Критерий выдачи, или критерий смыслового (семантического) соответствия (КСС), относится к процедуре поиска документальной информации и в значительной мере способствует улучшению качества поиска в документальных БД АИС. Критерий смыслового соответствия — это правило, определяющее степень смысловой близости ПОД и ПОЗ и формирующее решение о выдаче данного документа в ответ на запрос пользователя. При поиске документов в документальных БД не всегда происходит полное совпадение ключевых слов ПОД и ПОЗ. Иногда выданный по запросу список документов может быть неполным и неточным. Критерий смыслового соответствия служит для управления выдачей релевантных, т.е. совпадающих по смыслу запроса пользователей АИС документов. Методика его построения и механизм применения в основном идентичен его статусу в информационно-поисковых системах других ПрО. В зависимости от характера БД и уровня логической проработки стратегии поиска различают критерии смыслового соответствия, основанные на статистических способах вычисления степени соответствия, логические полиномы, весовые критерии.
При поиске данных в фактографических БД совпадение между ПОД и ПОЗ должно быть полным. В данном случае классификационные группировки и элементы индексируются одинаковыми однозначными кодами, что и обеспечивает 100 %-ное совпадение ПОД и ПОЗ.
3.2.2.