<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Поиск переводов статей с использованием статистических данных</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>A.S Kozitsyn</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>S.A. Afonin</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>A.A. Zenzinov</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>Institute of mechanics Lomonosov Moscow state university</institution>
          ,
          <addr-line>Moscow</addr-line>
        </aff>
      </contrib-group>
      <fpage>306</fpage>
      <lpage>312</lpage>
      <abstract>
        <p>Аннотация. В настоящее время происходит активное внедрение наукометрических систем для автоматизации процесса анализа эффективности деятельности научных организаций с целью применения различных методов стимулирования научной деятельности. Одним из наиболее важных индикаторов является количество публикаций и их цитируемость. Для оценки этого показателя необходимы средства автоматизированного построении связей между оригинальными статьями и их переводами. В настоящей работе анализируются существующие методы оценки близости оригинального текста и его возможного перевода, показывается их недостаточная эффективность для построения связей между статьями и описывается разработанный авторами метод автоматического поиска переводов статей в больших коллекциях библиографических данных. Особенностью разработанного алгоритма является использование статистических данных о публикации статей в различных журналах и информации о соавторах анализируемых статей. Представленный в настоящей работе алгоритм позволяет осуществлять поиск переводов статей без предварительной настройки на заданные пары языков оригинала и перевода статьи, а также не требует использования больших коллекций обучающих выборок. Апробация программной реализации алгоритма проводилась в наукометрической системе МГУ им. Ломоносова. Результаты тестирования показали ее достаточную эффективность и возможность использования разработанного алгоритма для автоматического построения рекомендаций пользователям для отметки в системе переводных версий статей.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>sources, correct linking of original papers with their translations into different
languages is extremely important. In the paper we show that the known text similarity
measures are inefficient in the context of article linkage problem. We propose a
method for semi-automatic article linkage using statistical data on authors publication
activities only. This approach may be used for linking articles without training for the
language of translation. The method was evaluated on real-world collection of
publications metadata of ISTINA information system.</p>
      <p>Задача автоматического перевода названий статей является очень
трудоемкой, поскольку в названиях используются многозначные слова, и
необходимо при переводе учитывать специфику предметной области статьи. В
таблице 1 приводится пример автоматического перевода названия статьи двумя
популярными переводчиками Гугл [2] и Промт [3].</p>
      <p>Английское Перевод названия Перевод названия Русское название
название статьи Промт Гугл статьи
Self-Purification of Самоочищение Самоочищение Степень
Agrosoddy- песчаных Агрозодди- самоочищения
Podzolic Sandy песчаных Подзолик Сэнди
агродерновоLoamy Soils суглинковых глинистые почвы, подзолистых
Fertilized with почв, оплодотворенные супесчаных почв,
Sewage Sludge оплодотворенных с отстоем удобренных
осадками сточных вод осадком сточных
сточных вод вод
Poynting’s effect Эффект Эффект
of cylindrically Пойнтинга Пойнтинга для
anisotropic цилиндрически
цилиндрическиnano/microtubes анизотропного анизотропных
нано/микротруб нано/микротрубок
Влияние
Пойнтинга на
цилиндрические
анизотропные
нано /
микротрубки
Methods for Методы для Методы оценки
estimating the оценки энергии энергии
energy of обширных обширных
extensive air атмосферных атмосферных
showers ливней ливней
Rayleigh and Love Рэлей и Поверхностные
surface waves in Любовные волны волны Рэлея и
isotropic media поверхности в Лайва в
with negative изотропических изотропных
Poisson's ratio СМИ с средах с
отношением отрицательным
отрицательного коэффициентом
Пуассона Пуассона
Cubic auxetics Кубический Кубические
auxetics аксетики
Методы
получения оценок
энергии широких
атмосферных
ливней
Поверхностные
волны Релея и
Лява при
отрицательном
коэффициенте
Пуассона
изотропных сред
Кубические
ауксетики
Calculating lateral Вычисление Вычисление Расчет функций
distribution боковых функций боковых функций пространственного
functions of the распределения распределения распределения
Cherenkov light Излучения черенковского черенковского
from extensive Черенкова от света из света ШАЛ в
atmospheric обширных обширных рамках
showers in terms атмосферных атмосферных многоуровневой
of a multilevel душей с точки ливней в схемы
scheme зрения терминах
многоуровневой многоуровневой
схемы схемы
Soil wedge Структуры клина Почвенные Клиновидные
structures in the почвы в южном клиновые структуры на
southern coast of побережье залива сооружения на южном берегу
the finland gulf финляндии южном финского залива
побережье
Финского залива
Как видно из приведенной таблицы, в большинстве случаев имеется
большое смысловое сходство автоматического перевода и перевода, сделанного
автором, но набор слов существенно различается. Это объясняется, в первую
очередь, неоднозначностью терминов в любом языке. В одних случаях в языке
перевода отсутствуют полностью эквивалентные термины языка оригинала, в
других – автоматическая система выбирает не совсем верные термины.</p>
      <p>В настоящее время, в связи усиле нием борьбы с плагиатом, активно
развивается направление поиска эквивалентных текстов на разных языках,
обсуждаемых, в том числе на конференции «Обнаружение заимствований» [4].
Например, в системе «Антиплагиат» создан модуль «Переводные
заимствования», который способен определять степень эквивалентности
текстов, написанных на разных языках. Используемый в системе метод анализа
основывается на понятии n-грамм. Элементами n-грамм являются классы
эквивалентных слов, что позволяет учитывать наличие эквивалентных
терминов в разных языках [5]. Такой подход эффективен для поиска переводов
полных текстов, но имеет ряд существенных недостатков, которые затрудняют
его использование для поиска переводных статей по названиям. Во-первых,
построение классов эквивалентных слов требует настройки под каждую пару
языков. В системе «Антиплагиат» используется только русско-английский
перевод, а в случае перевода статей необходимо учитывать все возможные
языки. Во-вторых, использование n-грамм возможно только для достаточно
длинных частей текста, и плохо применимо к названиям статей.
Альтернативным подходом к автоматизации процесса поиска переводных
версий статей является использование статистических данных о распределении
статей по журналам. Такой подход позволяет находить возможные переводы,
основываясь только на структуре связей в графе соавторства статей, не требуя
использования статистической информации о языке оригинала и перевода
статьи.</p>
      <p>Основой разработанного авторами доклада алгоритма является
предположение, что оригинальная статья и ее перевод должны быть
опубликованы одним и тем же авторским коллективом с разницей не более года
в журналах на разных языках.</p>
      <p>После построения пар статей, которые могут являться переводами,
производится построения двудольного графа журналов, которые печатают
переводные статьи. Метрика для оценки степени связи журналов в графе
строится на основе мощности множеств статей в каждом из журналов и
мощности множества пар статей в этих журналах, которые могут являться
переводами. Результатом работы этого этапа алгоритма является множество пар
журналов, в одном из которых часто печатаются переводные статьи из второго
журнала. В процессе работы системы граф связей журналов уточняется на
основе вносимых пользователями данных о своих статьях. Для этого
используется как явное указание пользователями связей между оригинальной и
переводной статьей, так и информация о DOI статьи, задаваемых авторами.
Многие авторы указывают библиографические данные оригинала статьи в
русскоязычном журнале, внося DOI переводной версии для учета ссылок из
Web Of Science. Таким образом, собрав из внешних источников информацию о
статье по DOI можно точно определить название переводного журнала для
указанного в статье русскоязычного журнала.</p>
      <p>На основе построенного множества журналов производится поиск
возможного перевода статьи. Поиск осуществляется среди статей, которые
могут являться переводами (имеют совпадающее множество авторов, и дата
публикации отличается не более чем на год) и опубликованы в журналах,
связанных ребром в построенном ранее графе журналов.</p>
      <p>Следует отметить, что алгоритм может использоваться как для обработки
полной коллекции статей, так и для обработки статей, вносимых в
наукометрическую информационную систему авторами непосредственно в
момент их добавления. В последнем случае, одним из требований является
достаточная производительность реализации алгоритма, позволяющая давать
рекомендации пользователю непосредственно при редактировании информации
о статье в интерфейсе системы. Использование хэшфункции для множества
авторов статьи позволяет производить поиск возможных вариантов перевода и
давать рекомендации менее чем за 0.1 сек.
Рис 1. Интерфейс подтверждения найденных вариантов перевода.
Для апробации алгоритма использовались данные о публикациях
сотрудников МГУ им. М.В. Ломоносова. Авторами статьи разработан модуль,
добавленный в функционал нукометрической системы организации [6].
Разработанный для этих целей интерфейс (рис. 1) позволяет экспертам
проводить оценку результатов работы модуля и отмечать в системе правильные
и ошибочные варианты предлагаемых переводов. На настоящий момент из 675
оцененных экспертами вариантов 625 вариантов признаны правильными и 50
ошибочными. Таким образом, точность алгоритма составляет 92%. Ошибки
определения обусловлены тем, что один и тот же коллектив авторов может
публиковать в течение года несколько работ по схожей тематике. В некоторых
случаях названия статей бывают настолько схожими, что даже по названиям
статьи трудно выбрать правильный вариант (рис. 1).</p>
      <p>Литература
1. Садовничий В. А., Васенин В. А., Афонин С. А.и др. Информационная
система "ИСТИНА" как big data - инструментарий в области управления на
основе анализа наукометрических данных. Материалы Всероссийской
конференции с международным участием "Знания-Онтологии-Теории"
(ЗОНТ-2015), 6-8 октября. Т. 1, Институт математики им. С.Л.Соболева СО
РАН Новосибирск, 2015. С. 115-123.
2. Переводчик «Гугл». — URL: http://translate.google.ru
3. Автоматический переводчик «Промпт». — URL: http://www.translate.ru.
4. Научная Конференция «Обнаружение заимствований – 2017». —</p>
      <p>URL: http://www.oz2017.ru .
5. Плагиат в научных статьях: трудности обнаружения перевода. —
URL:
http://ainews.ru/2018/01/plagiat_v_nauchnyh_statyah_trudnosti_obnaruzheniya_perevod
a.html.
6. Васенин В. А., Афонин С. А., Голомазов Д. Д., Козицын А. С.
Интеллектуальная Система Тематического Исследования
НАучно</p>
      <p>References
1. Sadovnichii V. A., Vasenin V. A., Afonin S. A.i dr. Informatsionnaia sistema
"ISTINA" kak big data - instrumentarii v oblasti upravleniia na osnove analiza
naukometricheskikh dannykh. Materialy Vserossiiskoi konferentsii s
mezhdunarodnym uchastiem "Znaniia-Ontologii-Teorii" (ZONT-2015), 6-8
oktiabria. T. 1, Institut matematiki im. S.L.Soboleva SO RAN Novosibirsk, 2015.</p>
      <p>S. 115-123.
2. Perevodchik «Gugl». — URL: http://translate.google.ru
3. Avtomaticheskii perevodchik «Prompt». — URL: http://www.translate.ru.
4. Nauchnaia Konferentsiia «Obnaruzhenie zaimstvovanii – 2017». —</p>
      <p>URL: http://www.oz2017.ru .
5. Plagiat v nauchnykh statiakh: trudnosti obnaruzheniia perevoda. —
URL:
http://ainews.ru/2018/01/plagiat_v_nauchnyh_statyah_trudnosti_obnaruzheniya_perevod
a.html.
6. Vasenin V. A., Afonin S. A., Golomazov D. D., Kozitsyn A. S. Intellektualnaia
Sistema Tematicheskogo Issledovaniia NAuchno-tekhnicheskoi informatsii
(ISTINA). Informatsionnoe obshchestvo. № 1-2. S. 21-36. 2013.</p>
    </sec>
  </body>
  <back>
    <ref-list />
  </back>
</article>