<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>ПРАКТИЧНЕ ДОСЛІДЖЕННЯ ЕФЕКТИВНОСТІ ІНФОРМАЦІЙНОЇ ТЕХНОЛОГІЇ АВТОМАТИЗОВАНОГО ВИЗНАЧЕННЯ СЕМАНТИЧНИХ ТЕРМІНІВ У КОНТЕНТІ НАВЧАЛЬНИХ МАТЕРІАЛІВ</article-title>
      </title-group>
      <pub-date>
        <year>2016</year>
      </pub-date>
      <fpage>237</fpage>
      <lpage>245</lpage>
      <abstract>
        <p>Запропоновано інформаційну технологію, що ґрунтується на дисперсійній оцінці важливості слів, яка дозволяє з достатньо високою ефективністю визначати семантичні терміни в контенті навчальних матеріалів. Розглянуто фактори, що ускладнюють ефективне визначення семантичних термінів у навчальних матеріалах. Встановлена ефективність запропонованої технології сприяє її використанню для вирішення ряду актуальних задач, таких як оцінка відповідності навчальних матеріалів змістовим вимогам, оцінка відповідності наборів тестових завдань навчальним матеріалам, семантична допомога при створенні тестів, автоматизована генерація множин ключових слів та створення анотацій. Ключові слова: інформаційна технологія, семантичні терміни, навчальні матеріали, анотація. Предложена информационная технология, основанная на дисперсионной оценке важности слов, которая позволяет с достаточно высокой эффективностью определять семантические термины в контенте учебных материалов. Рассмотрены факторы, затрудняющие эффективное определение семантических терминов в учебных материалах. Установленная эффективность предложенной технологии способствует ее использованию для решения ряда актуальных задач, таких как оценка соответствия учебных материалов содержательным требованиям, оценка соответствия наборов тестовых заданий учебным материалам, семантическая помощь при создании тестов, автоматизированная генерация множеств ключевых слов и создания аннотаций. Ключевые слова: информационная технология, семантические сроки, учебные материалы, аннотация. The information technology on base of the disperse evaluation, which with enough high efficiency allows automated define the semantic terms in content of educational materials article is given. The factors that hinder effective analysis of educational materials have been considered. High efficiency offered technologies gives possible of its using in row of the problems, such as estimation of the correspondence of educational materials to requirements, estimation of the correspondence of set test tasks to educational materials, semantic help of making tests, automated keyword list and abstract generation.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>потреба в виявленні як ключових слів, так і з ключових словосполучень; удосконалення алгоритмів пошуку
ключових слів і словосполучень з використанням методу дисперсійної оцінки, та інші. Тому є доцільною
розробка нової інформаційної технології, яка із використанням методу дисперсійної оцінки дозволить
ефективно й автоматизовано визначати семантичні терміни в навчальних матеріалах.</p>
      <p>Мета даної роботи – розробка інформаційної технології автоматизованого визначення семантичних
термінів у контенті навчальних матеріалів й дослідження її ефективності за допомогою відповідного
програмного забезпечення.
Основні результати</p>
      <p>Задача автоматизації визначення семантичних термінів у контенті навчальних матеріалів складається з
ряду етапів перетворення інформації. Вхідними даними є контент навчальних матеріалів або його визначена
частина; вихідними даними є ранжована множина семантичних термінів навчальних матеріалів.</p>
      <p>Інформаційна технологія автоматизованого визначення термінів у навчальних матеріалах. На
рис. 1 показано функціональну діаграму (виконану за стандартом ІDEF0 [14]), яка ілюструє послідовність дій
при формуванні множини термінів у контенті навчальних матеріалів.</p>
      <p>Навчальні
матеріали
Приведення
контенту
навчальних
матеріалів до
встановленого
вигляду
Контент
навчальних
матеріалів</p>
      <p>Пошук
ключових слів
Множина
ключових
слів
Пошук ключових
словосполучень
Множина
ключових
словосполучень
Формування
множини
термінів
Множина
термінів
Стандарти та
правила
оформлення
Алгоритм
пошуку
ключових слів
Алгоритм пошуку
ключових
словосполучень
Алгоритм
формування
множини
термінів
Рис. 1. Діаграма етапів пошуку семантичних термінів у контенті навчальних матеріалів
Кожному етапу з наведених відповідає деяка послідовність перетворення даних, що в сукупності
формують інформаційну технологію автоматизованого визначення семантичних термінів, подану на рис. 2.</p>
      <p>Попередня технічна обробка тексту (Блок 1) полягає в усуненні неоднозначного іменування термінів
(наприклад, «СКБД», «Система керування БД», «Система керування базами даних») та обробці розділових
знаків.
де на m-ій і n-ій позиціях в тексті знаходиться слово А, яке зустрілось k+1-ий і k-ий рази. Тоді дисперсійна
оцінка розраховується наступним чином [11]:
де (ΔA) – середнє значення послідовності ΔA1, ΔA2, ΔAk ; (ΔA2 ) – послідовності A12, A22, Ak2 ; К – кількість появи
слова А в тексті.</p>
      <p>σ =
(ΔA2 ) − (ΔA)2
(ΔA)</p>
      <p>,
Навчальні матеріали
1
2
3
4
5
6</p>
      <p>Попередня технічна обробка тексту
(видалення й стандартизація розділових знаків)
Пошук ключових слів у контенті навчального матеріалу
методом дисперсійного оцінювання
Формування вихідної множини слів:
• Сортування слів у множині за значенням дисперсійної оцінки;
• Видалення неважливих слів (з дисперсійною оцінкою нижче
порогової величини)</p>
      <p>Формування вихідної множини словосполучень:
• Пошук неперервних скупчень важливих слів;
• Сортування словосполучень за частотою вживання;
• Видалення не ключових словосполучень (що не містять двох і
більше іменників чи прикметників)</p>
      <p>Формування вихідної множини термінів:
(заміщення словосполученнями слів, які є переважно</p>
      <p>елементами відповідних словосполучень)
Формування результуючої множини термінів:
• Лематизація слів (приведення до нормальної форми);
• Узгодження слів у словосполученнях;
• Компактифікація множини (видалення повторів)</p>
      <p>Множина термінів – ключових слів та словосполучень
Рис. 2. Схема інформаційної технології автоматизованого визначення семантичних термінів
у контенті навчальних матеріалів
Для формування вихідної множини слів (Блок 3) слова у множині, сформованої у результаті
дисперсійного оцінювання, сортуються за зменшенням значення дисперсійної оцінки й обмежуються за
кількісним порогом. Термінами можуть виступати як слова, так і словосполучення й абревіатури. Якщо
абревіатури з технічної точки зору розглядаються як слова, то словосполучення вимагають окремого алгоритму
ідентифікації.</p>
      <p>
        Словосполучення є стійкими сукупностями важливих слів, що згруповані у визначеній послідовності
та у такій комбінації неодноразово присутні в розглядуваному контенті. Для формування вихідної множини
словосполучень (Блок 4) проводиться пошук неперервних скупчень ключових слів протягом тексту й знайдені
зразки фіксуються у масиві словосполучень за алгоритмом, показаним на рис. 3. Отриманий масив
(
        <xref ref-type="bibr" rid="ref1">1</xref>
        )
словосполучень сортується за частотою вживання, після чого з нього видаляються неключові
словосполучення.
      </p>
      <p>Розглянутим чином, на основі множин ключових слів та ключових словосполучень формується
узагальнена множина термінів, до якої входять словосполучення й ті слова, значення дисперсійної оцінки яких
суттєво перевищує значення дисперсійної оцінки зв’язаних із цим словом колокацій (словосполучень).
Об’єднана множина термінів сортується за значеннями їх дисперсійної оцінки.</p>
      <p>Очищення
послідовності
Ні
Ні
Початок
Є ще слова у
тексті?</p>
      <p>Так
Аналіз наступного слова у тексті
Ні</p>
      <p>Так
Слово
ключове?</p>
      <p>Запис у послідовність
В послідовності
більше 1 слова?</p>
      <p>Так
Ні
В множині є таке
словосполучення?
Так
Додавання словосполучення до
множини
Кінець
Збільшення частоти
Рис. 3. Алгоритм пошуку сталих словосполучень у контенті навчальних матеріалів
Реалізація інформаційної технології. З метою перевірки ефективності розробленої інформаційної
технології було проведене порівняння результату автоматизованого визначення ключових семантичних
термінів зі списком, сформованим експертом (автором відповідних матеріалів).
Для автоматизованого формування множини ключових термінів авторами було розроблене тестове
програмне забезпечення, що реалізує обробку контенту навчальних матеріалів викладеним вище чином.
Структура програми складається з 6 модулів, кожен з яких у свою чергу складається з декількох класів (рис. 4).</p>
      <p>MainForm – клас головної форма, що призначений для керування усім процесом знаходження ключових
слів, словосполучень та об’єднання двох переліків у перелік ключових термінів.</p>
      <p>Модуль, що відповідає за реалізацію основної логіки програми, складається з декількох класів (рис. 5),
основні з яких наступні: Document – клас для збереження і обробки тексту документу; також клас реалізує
перетворення ключових слів та ключових словосполучень і їх об’єднання; DispersiveEstimate – клас, що
реалізує процес знаходження ключових слів; DBWorker – клас, що реалізує процес лематизації слів й інші
функції, що пов’язані із базою даних.</p>
      <p>Для зручного використання даних модулями програми, використовуються класи-представлення
AnalysisWord та WordsRelations (рис. 6). Розроблена структура класів дозволяє реалізувати основні функції
системи, такі як формування переліку ключових слів, формування переліку словосполучень та об’єднання їх у
перелік ключових термінів.</p>
      <p>Рис. 4. Діаграма класів застосування з автоматизованого визначення ключових семантичних термінів
Рис. 5. Класи логіки програми
Рис. 6. Класи-представлення
Розроблений програмний продукт на основі введених даних у вигляді тексту документу (рис. 7)
проводить його попередню обробку аналіз відповідно до розробленої інформаційної технології.</p>
      <p>Рис. 7. Завантаження та попередня обробка тексту програмою
За наведеним алгоритмом формуються множина ключових слів та множина ключових словосполучень, а
на їх основі формується узагальнена множина термінів (рис. 8).</p>
      <p>Рис. 8. Формування результуючої множина ключових термінів тексту
BЕ , яку сформовано експертом. Перетин ВП цих множин BА I BЕ визначає ефективність автоматизованого
визначення ключових семантичних термінів у відповідному навчальному матеріалі.</p>
      <p>Практична ефективність технології автоматизованого визначення термінів для кожного з матеріалів k
визначається за формулою:
де N П – кількість термінів у експертній ( BЕ ) та сформованій автоматично ( BА ) множині термінів, що
співпали ( BА I BЕ ); NЕ – кількість термінів у множині термінів BЕ , сформованій експертом (автором).</p>
      <p>Відповідно, середня практична ефективність розробленої інформаційної технології визначається за
наступною формулою:</p>
      <p>Ek = N П ⋅100% ,</p>
      <p>N Е
k
∑ EПk
E = i=1
k
,
де EПk – ефективність технології визначення термінів для k-го матеріалу; k – кількість навчальних матеріалів у
тестовій вибірці.</p>
      <p>У рамках досліджень було оброблено вибірку з 30 лекцій із різних навчальних курсів. Наприклад, у
результаті тестування лекційного матеріалу «Основні поняття й архітектура систем баз даних» навчального
курсу «Організація баз даних та знань» розробленим програмним забезпеченням було отримано множину
ключових термінів та проведено її порівняння з авторською множиною. Деякі результати порівняння наведено
у таблиці. В даному випадку ефективність методу склала 80 %. Середня ж практична ефективність застосування
розробленої інформаційної технології склала 87,3 %.
Таблиця. Фрагмент порівняльної таблиці аналізу множин термінів
Термін
Дисперсійна
оцінка</p>
      <p>
        Визначено
автоматично
Визначено
автором
(
        <xref ref-type="bibr" rid="ref2">2</xref>
        )
(
        <xref ref-type="bibr" rid="ref3">3</xref>
        )
Аналіз отриманих результатів виявив, що відсутність програмно визначених термінів у множині
автора не завжди характеризує недолік запропонованої технології. Деякі семантично важливі терміни автори
суб’єктивно ігнорують, в той час як іншу категорію складають поняття, на яких автори акцентують надмірну
увагу попри їх другорядність у рамках матеріалу, що викладається. Тому, для різносторонньої оцінки
результатів дослідження розглядалися не тільки терміни із множини експерта, що не були знайдені
програмно, а й автоматично знайдені терміни, які не увійшли до множини експерта. Отже, як показано на
№
п/п
Система керування базою даних
10.
      </p>
      <p>Безпека БД
2,498457
2,389215
2,189637
2,095059
2,014957
1,951622</p>
      <p>1,863380
1,811303
1,721403
+
+
+
+
+
+
+
+
+
+
+
+
+
+
+
+
+
+
рис. 9, для вибірки з 30 навчальних лекцій, для яких проводився аналіз, із об’єднаних множин 87,3 %
термінів співпало. Решту 7,5 % склали терміни експерта, що не мали відповідників у згенерованій множині, й
5,2 % – терміни, що входили до автоматично згенерованої множини, проте не були відзначені в множині
термінів експерта.</p>
      <p>Рис. 9. Діаграма середньої ефективності пошуку ключових термінів
Таким чином, практичне тестування розробленої інформаційної технології автоматизованого визначення
семантичних термінів у контенті навчальних матеріалів виявило її середню ефективність 87,3 %, показавши при
цьому мінімальну ефективність 65,1 % та максимальну – 100 %.
Висновки</p>
      <p>Запропонована інформаційна технологія дозволяє з достатньою ефективністю автоматизовано визначати
семантичні терміни в контенті навчальних матеріалів. Проведені за допомогою розробленого авторами
тестового програмного забезпечення дослідження підтвердили здатність запропонованого підходу з
ефективністю 87,3 % автоматизовано визначати ключові слова та словосполучення у контенті навчальних
матеріалів.</p>
      <p>Подальші дослідження спрямовані на пошук виключних випадків та вдосконалення розглянутої
інформаційної технології для покращення результатів при їх обробці.</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          1. New Information Technologies in Education. URL: http://it-tehnolog.
          <article-title>com/statti/novi-informatsiyni-tehnologiyi-navchannya/.</article-title>
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          2.
          <string-name>
            <given-names>Koncepcia</given-names>
            <surname>Yacosti</surname>
          </string-name>
          <article-title>Osvityu</article-title>
          . URL: http://osvita.ua/.
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>3. University of the People. URL: http://www.uopeople.org/.</mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          4.
          <string-name>
            <given-names>Facultet</given-names>
            <surname>Zaochno-Distanciynogo</surname>
          </string-name>
          <string-name>
            <surname>Navchannya</surname>
          </string-name>
          ,
          <article-title>Pislyadiplomnoi Osvity ta Dovuzivskoi Pidgotovki KhNU</article-title>
          . URL: http://dn.tup.km.ua/.
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          5.
          <string-name>
            <surname>Аvanesov</surname>
            <given-names>V.S.</given-names>
          </string-name>
          <string-name>
            <surname>Kompozicia Testovih Zadaniy</surname>
          </string-name>
          . - М.,
          <string-name>
            <surname>Centr</surname>
            <given-names>Testirovanya</given-names>
          </string-name>
          ,
          <year>2002</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          6. Moodle -
          <article-title>Open-source learning platform</article-title>
          . URL: https://moodle.org/.
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          7.
          <string-name>
            <given-names>Do</given-names>
            <surname>Problemi Standartizacii Terminologii Osvitnih Informaciyno-Telekomunikaciynih</surname>
          </string-name>
          <string-name>
            <given-names>Tehnologiy</given-names>
            / К.О.
            <surname>Кіrey</surname>
          </string-name>
          ,
          <string-name>
            <given-names>L.</given-names>
            <surname>О</surname>
          </string-name>
          . Кіrey // Visnik Cherkaskogo Universitetu / Cherkaskiy Nacionalnogo Universitet im.
          <source>Bogdana Khmeinitskogo. - Cherkasy</source>
          ,
          <year>2009</year>
          . Ser.: Pedagogichni Nauki, Vip.
          <volume>146</volume>
          . - P.
          <fpage>27</fpage>
          -
          <lpage>29</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          8.
          <string-name>
            <surname>Snituk</surname>
            <given-names>V.E.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Yurchenko</surname>
            <given-names>K.N. Intelektualnoe</given-names>
          </string-name>
          <string-name>
            <surname>Upravlenie Ocenivaniem Znaiy</surname>
          </string-name>
          . − Cherkassy,
          <year>2013</year>
          . - 262 p.
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          9.
          <fpage>IDEF5</fpage>
          -
          <article-title>Ontology Description Capture Method</article-title>
          . URL: http://www.idef.com/IDEF5.htm.
        </mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>
          10.
          <string-name>
            <surname>Ortuño</surname>
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Carpena</surname>
            <given-names>P.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Bernaola</surname>
            <given-names>P.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Muñoz</surname>
            <given-names>E.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Somoza</surname>
            <given-names>A.M.</given-names>
          </string-name>
          <article-title>Keyword detection in natural languages</article-title>
          and DNA // Europhys. Lett,
          <year>2002</year>
          . -
          <volume>57</volume>
          (
          <issue>5</issue>
          ). - P.
          <fpage>759</fpage>
          -
          <lpage>764</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref11">
        <mixed-citation>
          11.
          <string-name>
            <surname>Ventura</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          &amp;
          <string-name>
            <surname>Silva</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          (
          <year>2007</year>
          ).
          <article-title>New Techniques for Relevant Word Ranking and Extraction</article-title>
          .
          <source>In Proceedings of 13th Portuguese Conference on Artificial Intelligence</source>
          , Springer-Verlag, P.
          <fpage>691</fpage>
          -
          <lpage>702</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref12">
        <mixed-citation>
          12.
          <string-name>
            <surname>Lande</surname>
            <given-names>D.V.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Snarskiy</surname>
            <given-names>A.A.</given-names>
          </string-name>
          <string-name>
            <surname>Kompaktificirovanniy Gorizontalniy</surname>
          </string-name>
          Graf Vidimosti dlya Seti Slov // Trudi Mejdunarodnoy Nauchnoy Konferencii «
          <string-name>
            <surname>Intellektualniy Analiz Informacii IAI-2013. Znania I Rassujdenia</surname>
          </string-name>
          » - KPI, Kiev:
          <year>2013</year>
          . - P.
          <fpage>158</fpage>
          -
          <lpage>164</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref13">
        <mixed-citation>
          13.
          <string-name>
            <given-names>O.</given-names>
            <surname>Barmak</surname>
          </string-name>
          ,
          <string-name>
            <given-names>O.</given-names>
            <surname>Mazurets</surname>
          </string-name>
          , Methods of Automation of Definition of Semantic Terms in Educational Materials // Naukoviy jurnal “Visnik Khmelnitskogo Nacionalnogo Universitetu” ser.:
          <article-title>Tehnichni nauki</article-title>
          .
          <source>Khmelnitsky</source>
          ,
          <year>2015</year>
          , №
          <volume>2</volume>
          (
          <issue>223</issue>
          ). - P.
          <fpage>209</fpage>
          -
          <lpage>213</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref14">
        <mixed-citation>
          14. David Marka,
          <string-name>
            <surname>Kliment</surname>
            <given-names>McGouen</given-names>
          </string-name>
          ,
          <source>Metodologia Structurnogo Analiza i Proectirovania</source>
          .
          <article-title>Per. s angl</article-title>
          . М.:
          <year>1993</year>
          , 240 p.
        </mixed-citation>
      </ref>
      <ref id="ref15">
        <mixed-citation>
          http://orcid.org/0000-0002-8043-
          <issue>0785</issue>
          , 2Бармак Олександр Володимирович,
          <article-title>доктор технічних наук, професор, професор кафедри Комп'ютерних наук та інформаційних технологій</article-title>
          .
        </mixed-citation>
      </ref>
      <ref id="ref16">
        <mixed-citation>
          http://orcid.org/0000-0003-0739-
          <issue>9678</issue>
          , 2Мазурець Олександр Вікторович,
          <article-title>старший викладач кафедри Комп'ютерних наук та інформаційних технологій</article-title>
          .
        </mixed-citation>
      </ref>
      <ref id="ref17">
        <mixed-citation>
          <article-title>E-mail: krak@unicyb</article-title>
          .kiev.ua, yuri.
          <source>krak@gmail.com, 2Хмельницький національний університет МОН України</source>
          ,
          <volume>29016</volume>
          , Хмельницький, вул.
          <source>Інститутська</source>
          ,
          <volume>11</volume>
          .
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>