Разметка финско-русского корпуса фразеологизмов на примере идиом со значением «умереть»

Автор: Белкина Н.В., Шарешик Д.Ю.

Журнал: Финно-угорский мир @csfu-mrsu

Рубрика: Когнитивная и корпусная лингвистика

Статья в выпуске: 2 т.18, 2026 года.

Бесплатный доступ

Введение. Сравнительный языковой анализ картины мира определенных этносов помогает понять различия национальных культур и то, как они дополняют друг друга. Размеченный по определенным критериям финско-русский корпус фразеологических единиц дает возможность выявить общие и национальные черты восприятия окружающего мира. Создание и лингвистическая разметка специализированного двуязычного корпуса фразеологизмов является проблемой, решив которую, возможно получить эффективный инструмент для сопоставительного анализа и машинного перевода. Цель исследования ‒ определение критериев разметки корпуса финско-русских фразеологизмов и апробация ее на тематической группе со значением «умереть». Материалы и методы. Материалом послужили финские и русские фразеологические единицы тематической группы «умереть», отобранные методом сплошной выборки из финских и русских словарей фразеологизмов, сленга и разговорной речи. Необходимость данного исследования обусловлена отсутствием цифровых параллельных фразеологических корпусов финского и русского языков и, соответственно, критериев разметки подобного корпуса. Пилотный корпус, насчитывающий в настоящее время 123 финских и 136 русских фразеологических единиц, предназначен для сопоставительного лингвокультурологического анализа и прикладных задач машинного перевода. В основе методологии лежит сопоставительный подход, учитывающий тематико-семантические, стилистические и этимологические параметры фразеологизмов. Результаты исследования и их обсуждение. Предложена детализированная схема разметки, включающая семантическую классификацию, стилистические пометы и указание на происхождение. В процессе разметки фразеологических единиц со значением «умереть» применяется комплекс критериев: семантико-тематический (с опорой на универсальную семантическую метафору); семантический (с учетом коннотативных компонентов значения); стилистический; критерий языковой пары; этимологический. Дополнительно при разметке учитываются наличие дериватов и синонимов, а также особенности грамматического оформления фразеологических единиц, что необходимо для последующей генерации корректных контекстов. Заключение. Разработанный корпус представляет ценность для выявления универсальных и культурно-обусловленных черт в восприятии концепта смерти в финской и русской лингвокультурах, а также может послужить основой для дальнейших исследований в области фразеологии и межъязыковой коммуникации. Создание и разметка корпуса по предлагаемым критериям не требуют специальных знаний в области программирования и доступны при использовании открытого программного обеспечения. Подобный корпус является шагом к созданию компьютерной модели языковой картины мира, которую можно использовать для работы с большим количеством данных и обучения искусственного интеллекта.

Фразеология, лингвокультурология, параллельный корпус, семантическая разметка, финский язык, русский язык, концепт «смерть»

Короткий адрес: https://sciup.org/147254188

IDR: 147254188   |   УДК: 81’373:621.013:811.511.111:811.161.1   |   DOI: 10.15507/2076-2577.26182.170-182

Making the Finnish-Russian Corpus of Phraseological Units: A Case Study of Idioms Meaning “to Die”

Introduction. A comparative linguistic analysis of the worldview of particular ethnic groups makes it possible to understand the differences between national cultures and the ways in which they complement one another. A Finnish-Russian corpus of phraseological units annotated according to specific criteria provides an opportunity to identify both universal and culture-specific features in the perception of the surrounding world. The creation and linguistic annotation of a specialized bilingual corpus of phraseological expressions constitutes a challenge; however, once resolved, it may yield an effective tool for comparative analysis and machine translation. The aim of the study is to determine the criteria for annotating a corpus of Finnish-Russian phraseological units and to test this annotation framework on a thematic group with the meaning “to die”. Materials and Methods. The material for the study comprised Finnish and Russian phraseological units belonging to the thematic group “to die”, selected through continuous sampling from Finnish and Russian dictionaries of phraseology, slang, and colloquial speech. The relevance of this research stems from the absence of digital parallel phraseological corpora for the Finnish and Russian languages and, consequently, from the lack of annotation criteria for such a corpus. The pilot corpus, which currently includes 123 Finnish and 136 Russian phraseological units, is intended for comparative linguocultural analysis and for applied machine translation tasks. The methodology is based on a comparative approach that takes into account the thematic-semantic, stylistic, and etymological parameters of phraseological units. Results and Discussion. A detailed tagging scheme is proposed, including semantic classification, stylistic labels, and indications of origin. In the process of tagging phraseological units meaning “to die,” a set of criteria is employed: a semantic-thematic criterion based on universal semantic metaphor; a semantic criterion taking into account connotative components of meaning; a stylistic criterion; a language pair criterion; and an etymological criterion. In addition to semantic, etymological, and stylistic parameters, the tagging process also considers the presence of derivatives and synonyms, as well as the grammatical features of phraseological units, which is necessary for the subsequent generation of contextually appropriate examples. Conclusion. The developed corpus is valuable for identifying both universal and culture-specific features in the perception of the concept of death within Finnish and Russian linguistic cultures, and it also provides a foundation for further research in the fields of phraseology and cross-linguistic communication. The creation and tagging of the corpus according to the proposed criteria do not require specialized programming knowledge and can be carried out using open-source software. Such a corpus constitutes a step toward the development of a computational model of the linguistic worldview, which can be employed for processing large-scale data and training artificial intelligence systems.

Текст научной статьи Разметка финско-русского корпуса фразеологизмов на примере идиом со значением «умереть»

Российский государственный педагогический университет им. А. И. Герцена, г. Санкт-Петербург, Российская Федерация,

St. Petersburg, Russian Federation,

Фразеологизмы представляют собой особый пласт системы языка, отражающий его культурные и исторические особенности. Исследование вопроса о национальнокультурной специфике фразеологизмов является традиционным в лингвистике. Этой темой занимались такие ученые, как А. Вежбицкая, В. Н. Телия, В. А. Маслова,

® ФИННО-УГОРСКИЙ МИР. Том 18, № 2. 2026 ^^^^^^e Д. О. Добровольский и др. Так, В. Н. Телия отмечает, что «для идиом характерна образная мотивированность, которая напрямую связана с мировидением народа-носителя языка, идиомы в принципе обладают культурно-национальной коннотацией»1. Фразеологизм представляет собой уникальную лексическую единицу языка, значение которой не выводится из ее составляющих и позволяет метафорично выразить отношение к происходящему. Кроме того, «фразеология есть фрагмент языковой картины мира, а ее единицы всегда обращены на субъект, то есть они возникают не столько для того, чтобы описывать мир, сколько для того, чтобы его интерпретировать, оценивать и выражать к нему субъективное отношение»2. Язык, отражая видение мира, является своего рода ключом к познанию менталитета конкретного народа [1]. Соответственно, сравнительный языковой анализ картины мира того или иного этноса помогает понять различия национальных культур и то, как они дополняют друг друга [2]. Исследователи подчеркивают: культурные коды, содержащиеся во фразеологизмах, могут быть трудны для понимания носителем другого языка, что предопределяет необходимость их детального изучения.

Исследователь Д. О. Добровольский утверждает, что абсолютные межъязыковые эквиваленты фразеологизмов (далее – ФЕ) и метафорических единиц встречаются относительно редко, это обусловлено преимущественно различиями в технике номинации, а не их культурной уникальностью. Также предлагается два подхода к определению национально-культурной специфики фразеологизмов: сопоставительный и интроспективный. В сравнительных исследованиях выделяют полные эквиваленты (единицы, возводимые к одному источнику, тождественные по значению), эквивалентные (максимально совпадающие по значению) и безэквивалентные (не имеют фразеологического аналога в другом языке) [3].

В то же время Н. Ф. Крюкова делает акцент на фразеологической эквивалентности в когнитивно-герменевтическом аспекте: в его основе лежит «не сопоставление лексических единиц, а анализ метафор, их формирующих» [4]. Н. Н. Почуева отмечает, что ФЕ с разной образной составляющей отражают как универсальность законов мышления, так и национальную специфику видения мира разными народами [5].

В данном исследовании мы придерживаемся сопоставительного подхода и обращаемся к семантике, поскольку лексическое и грамматическое наполнение у ФЕ разных языков различно по определению. Специфика образного осмысления действительности в разных языках становится очевидной при сопоставлении фразеологизмов, относящихся к одной тематической группе, также возможно «установить как универсальные, так и культурно-специфичные особенности представления окружающей действительности» при «описании идентичных ситуаций в разных языках» [6, с. 140]. В настоящее время имеется небольшое количество финских фразеологических словарей и не существует двуязычного цифрового финско-русского фразеологического ресурса, что и создает необходимость его создания.

Цель исследования ‒ разработка критериев разметки корпуса финско-русских фразеологизмов и ее апробация на тематической группе фразеологизмов со значением «умереть».

Обращение к данной тематической группе связано с тем, что явление смерти – неизменно интересующий человека факт, который во все времена привлекал внимание исследователей из разных сфер науки. Хотя концепт «смерть» универсален, у каждого народа собственный взгляд на данное явление, своеобразие которого раскрывается в ходе лингвокультурологического анализа фразеологических единиц [2].

Обзор литературы

Проблема исследования стоит на стыке корпусной лингвистики, фразеологии, метафорики и семасиологии. Именно корпусная лингвистика характеризуется наличием специальной разметки по метаданным и делает прикладные лингвистические исследования проще и эффективнее. Рассмотрим основные понятия исследования подробнее. Т. МакЭнери и В. Брезина сформулировали фундаментальные принципы корпусной лингвистики и аннотирования корпусов. Они утверждают, что «корпусная лингвистика в форме аннотирования корпусов ‒ это область, где становятся ясными онтологические предпосылки лингвистики» [7].

Британский лингвист Дж. Лич подчеркивал, что разметка – это «вспомогательный инструмент, а не истина в последней инстанции»3. Он же сформулировал основополагающие принципы разметки корпусов: возможность легкого отделения разметки от текста; полезность разным исследователям; четкое описание правил разметки.

В то время как Д. Синклер акцентировал внимание на репрезентативности и гомогенности разметки на всех уровнях [8], Т. МакЭнери выделял такие преимущества качественной разметки, как удобство эксплуатации и многофункциональность, т. е. возможность ее использования для задач, не предусмотренных при создании [9].

Несмотря на значительный объем существующих научных трудов в области финской и русской фразеологии, сравнительный семантический анализ ФЕ все еще остается неразработанным аспектом. Инструментом для подобного семантического исследования может послужить параллельный корпус, позволяющий «перевод на другой язык рассматривать как свидетельство значения анализируемой единицы языка оригинала» [10, с. 22‒23]. Однако поиск ФЕ в текстовом параллельном корпусе сопряжен с большой долей ручного труда, поскольку компьютер может искать отдельные слова, но не всегда распознает устойчивые сочетания как единое целое, и различия в языковых картинах мира действительно обусловливают несовпадения в образности фразеологизмов и приводят к межъязыковым несоответствиям [11].

Преодоление подобных трудностей мы видим в создании специальной разметки, предполагающей использование универсальных метафор, опирающихся на схожесть когнитивных механизмов даже для неродственных языков, а именно русского и финского.

Смерть в толковых словарях русского и финского языков рассматривается как физиологический процесс прекращения жизнедеятельности живого существа или конец жизни4. В работах по русской и английской фразеологии представлены различные классификации метафор, выражающих понятие «умереть». Здесь и далее мы дополним классификации, составленные для русских и английских ФЕ, финскими примерами из словарей5. Так, Е. Середа делит фразеологизмы на три группы: 1. факт смерти без уточнения обстоятельств: рус. ‒ окончить дни свои , фин. ‒ siirtyä ajasta ikuisuuteen ‘перейти из времени в вечность’; 2. насильственная смерть: рус. ‒ пасть в бою , фин. ‒ saada surmansa ‘погибнуть’; 3. ненасильственная смерть: рус. ‒ умереть на своем рабочем месте , фин. ‒ kuolla saappaat jalassa ’умереть в сапогах’6.

Л. М. Пантелеева и С. В. Хоробрых рассматривают смерть как путь в загробное пространство, имеющий три основных этапа: уход из дома, путь к месту захоронения, отправление на «тот свет» [12].

С другой стороны, Р. М. Бикмухаметова выделяет в ФЕ изучаемой нами тематической группы следующие метафорические образы: 1. сон (рус. ‒ заснуть вечным сном , фин. ‒ nukkua pois ‘уснуть’); 2. конец существования (рус. ‒ окончить дни свои , фин. ‒ viedä viimeinen sivu ‘перелистнуть последнюю страницу’); 3. живое существо (рус. ‒ старуха с косой , фин. ‒ Tuonenakka – хозяйка царства мертвых), душа человека (рус. ‒ испустить дух , фин. ‒ lakata hengittämästä ‘прекратить дышать’); 4. дорога (рус. ‒ отправляться к праотцам , фин. ‒ lähteä manan majoille ‘отправиться в хижины царства мертвых’); 5. место захоронения (рус. ‒ ложиться в гроб , фин. ‒ mennä matojen valtakuntaan ‘пойти в царство червей’); 6. прекращение нормального функционирования жизненно важных частей тела (рус. ‒ протянуть ноги , фин. ‒ lähteä jalat edellä ‘уйти вперед ногами’) [2, с. 349].

Исследователь О. С. Орлова предлагает следующие метафоры: 1. переход из одного пространства в другое, путь, путешествие (рус. ‒ отойти в мир иной , фин. ‒ lähteä viimeiselle matkalle ); 2. воссоединение с близкими и создателем (рус. ‒ уйти на свидание с апостолом Петром , фин. ‒ käydä taivaan porteilla ‘подойти к небесным вратам’); 3. телесные знаки (рус. ‒ заснуть непробудным сном , фин. ‒ nukkua ikuiseen uneen ‘уснуть вечным сном’). Некоторые метафоры имеют дисфемистичную окраску (рус. ‒ двинуть кони , фин. ‒ heittää lusikka nurkkaan ‘бросить ложку в угол’) [13, с. 68].

На основе данных классификаций мы предлагаем следующие основные критерии разметки ФЕ: 1. семантика (для рассматриваемой тематической группы это метафоры: приход к богу, вечный покой, физиологический конец, окончание пути, переход в локус, дисфемизмы); 2. принадлежность к определенному стилю; 3. этимология.

Материалы и методы

Методика исследования предполагает последовательное выполнение следующих задач:

  • 1)    отбор массива ФЕ финского и русского языка определенной тематической группы;

  • 2)    определение принадлежности ФЕ к определенной семантической метафоре;

  • 3)    определение их коннотации с помощью контекстов из национальных корпусов языков (Национальный корпус русского языка (НКРЯ), Finnish Web Corpus (fiTenTen));

  • 4)    определение стилистической принадлежности и происхождения ФЕ;

  • 5)    сопоставление ФЕ финского и русского языков для определения языковой пары;

  • 6)    создание корпуса с помощью имеющегося открытого программного инструментария;

  • 7)    аннотирование корпуса в соответствии с определенными критериями разметки;

  • 8)    создание комментариев к элементам корпуса;

  • 9)    апробация корпуса экспертами и внесение возможных правок.

Для создания выборки использовались специализированные словари фразеологизмов, сленга и разговорной речи, тематические форумы и социальные сети7. С целью обеспечения однородности корпуса при отборе ФЕ мы придерживались тематического критерия (основное значение «умереть», включая эвфемизмы и дисфеминизмы) и критерия языковой пары: единица должна иметь установленный переводческий эквивалент в другом языке или быть сопоставимой по смыслу, стилю и коннотации.

Выборка составила 136 русских и 123 финских фразеологизма (таблица).

Т а б л и ц а 1. Структура выборки финских и русских фразеологизмов

T a b l e 1. Structure of the sample of Finnish and Russian phraseological units

©  й

“ § “ £

Ч    Он

t2    О

га

g

m

Стиль / Style

Происхождение / Origin

Семантика / Semantics

й

й и

й

Ph

OJ и

2

Ph

)й 2

4

й

)й 2 й

О

M

Й

E?

О

ю

и ч

8

Рн и

5S

>s

2

<и и

Зй

й

м

^

& о

4

м

ч

Рн

<и й

2

м

^ о

ч

^  2

© S „

О 0J        -Ч

р* р-

136

43

38

71

112

24

17

5

7

57

51

58

©

и.З ° 2

S °'д

© р-

123

14

36

66

95

28

29

3

8

37

46

49

Источник: таблица составлена авторами. Source: Table is compiled by the authors.

Видно, что на уровне стилистики в обоих языках преобладает разговорный стиль (хотя в русском языке книжные идиомы встречаются гораздо чаще). Большинство фразеологизмов со значением «умереть» являются незаимствованными. На семантическом уровне в русском языке преобладают дисфемизмы, единицы со значением «физиологический конец» и «переход в локус». В финском языке дисфемизмы также преобладают, однако «переход в локус» встречается чаще, чем «физиологический конец». Стоит отметить и большее по сравнению с русским языком количество идиом со значением «окончание пути».

Результаты исследования и их обсуждение

Создание специализированных лингвистических корпусов ‒ важный инструмент в современной филологии, переводоведении, лексикографии и компьютерной лингвистике. Принципы составления двуязычных корпусов и описание словарной статьи как формализованного текста даны Д. О. Добровольским, который подчеркивает, что словарная статья «должна неукоснительно следовать особым правилам, предполагающим деление сообщаемой информации на отдельные блоки, каждый из которых содержит сведения определенного типа». Это позволяет «выявить значимые связи как между отдельными его частями, так и внутри конкретных словарных статей». Помимо этого, исследователь предлагает «обращение к различным пластам семантики этой единицы [ФЕ] с учетом ее многозначности, ее прагматическим и стилистическим характеристикам, ограничениям на возможности ее употребления в дискурсе, указание на… потенциал ее варьирования» [14, с. 126‒127].

Двуязычный корпус фразеологизмов, сфокусированный на конкретной тематической группе (например, на категории «смерть»), представляет особую ценность для контрастивного анализа, изучения культурных коннотаций и разработки систем автоматического перевода устойчивых выражений. Процесс создания и разметки такого корпуса включает несколько взаимосвязанных этапов.

Первоначальным и фундаментальным этапом является сбор данных. Источники формирования корпуса должны быть репрезентативными и авторитетными, чтобы обеспечить надежность и достоверность включаемых единиц.

Однородность корпуса может быть обеспечена благодаря четко сформулированным параметрам:

  • 1)    тематический параметр: включаются только фразеологизмы (идиомы, устойчивые сравнения, фразеосхемы), основным значением которых является обозначение смерти, умирания или состояния после смерти, включая эвфемизмы и дисфемизмы. В данной группе многообразие эвфемизмов и дисфемизмов отражает сложное отношение общества к теме смерти, где переплетаются страх, уважение и протест;

  • 2)    параметр устойчивости: отбираются лексически устойчивые сочетания, обладающие признаками воспроизводимости, а не свободно создаваемые в речи;

  • 3)    параметр идиоматичности: единицы с переносным значением, не выводимым полностью из суммы значений компонентов (например, фин. heittää lusikka nurkkaan ‒ букв. ‘бросить ложку в угол’ или рус. дать дуба );

  • 4)    параметр частотности и употребительности: включаются фразеологизмы, зафиксированные в словарях или подтвержденные корпусными данными как активно используемые (хотя редкие и архаичные единицы также могут представлять интерес для исторического или диалектологического анализа);

  • 5)    параметр языковой пары: для включения в двуязычный корпус фразеологизм должен иметь либо установленный переводческий эквивалент в другом языке (например, фин. antaa viimeinen hengenveto , рус. испустить последний вздох ), либо быть сопоставимым по смыслу, стилю и коннотации (например, фин. Viedä viimeinen siivu ‘унести последний кусок’, рус. перевернуть последнюю страницу ).

Далее следует определение структуры корпуса. Эффективное хранение и поиск информации требуют продуманного формата, наиболее гибким решением является использование реляционной базы данных (например, SQLite, MySQL, PostgreSQL) или структурированных файлов (в формате XML, JSON). Табличные форматы (Excel, CSV) удобны для первоначального сбора и просмотра, но менее эффективны для сложных запросов и связей. Обращение к формату базы данных связано с тем, что это позволяет легко добавлять новые поля разметки, осуществлять сложный поиск по множеству параметров и управлять большими объемами данных.

Каждая словарная статья корпуса содержит следующие обязательные поля:

  • ‒    уникальный идентификатор. Цифровой или буквенно-цифровой код для однозначной ссылки на запись (например, KLM_FI_001, KLM_RU_045);

  • ‒    фразеологизм. Точная запись фразеологизма на финском или русском языке ( heittää veivinsä или отбросить коньки , причем для одного фразеологизма может быть несколько эквивалентов с разными стилистическими оттенками);

  • ‒    буквальный перевод. Дословный перевод компонентов на другой язык, необходимый для понимания внутренней формы ( heittää veivinsä ‘бросить свои мослы’);

  • ‒    семантическая помета. Классификация на основе предоставленной разметки: приход к богу, вечный покой, физиологический конец (ненасильственная смерть), физиологический конец (насильственная смерть), окончание жизненного пути, переход в другой локус, дисфемистичная окраска;

  • ‒    стилистическая помета. Маркировка стилистического регистра (нейтральный, книжный/высокий, разговорный/сниженный, грубый/вульгарный, жаргонный/сленговый);

  • ‒    помета происхождения. Указание на источник фразеологизма (исконное/заим-ствованное);

  • ‒    контекст (опционально). Примеры реального употребления фразеологизма с указанием источника (художественный текст, СМИ, устная речь);

  • ‒    комментарий. Поле для дополнительных лингвистических или культурологических заметок (калька / полный эквивалент, диалектная единица, жаргон/сленг, литературная, библеизм/мифологизм, синонимические ряды, региональные варианты).

Хотя фразеологизм является устойчивым целым, разметка может учитывать:

  • ‒    вариативность формы ‒ наличие синонимичных компонентов (рус. отбросить коньки / копыта / лапти , фин. heittää veivinsä / hokkarinsa / femmat ). Варианты должны быть зафиксированы в одной записи с пометой «вариант» или как отдельные, но связанные записи;

  • ‒    морфологию – особенности грамматического оформления (управление, фиксированный падеж / форма глагола). Это важно для генерации правильных контекстов в будущем;

  • ‒    синтаксическую функцию: может ли фразеологизм выступать в роли сказуемого, вводной конструкции и др. (чаще всего фразеологизмы со значением «умереть» – предикативные);

  • ‒    тип дискурса (бытовой разговор, художественная литература, пресса, интернет-форум), в котором преимущественно употребляется фразеологизм. Это уточняет стилистическую помету;

  • ‒    коннотации (ирония, грубость, почтительность, фамильярность), а также возможная профессиональная принадлежность, что напрямую связано со стилистической и семантической разметкой (дисфемизм/эвфемизм);

  • ‒    сочетаемость с лексемами или грамматическими конструкциями (например, «внезапно дал дуба», «мирно отдал Богу душу»). Эта информация будет фиксироваться в поле «Контекст» или «Комментарий».

На следующем этапе происходила разметка корпуса – процесс добавления лингвистической информации (аннотаций, метаданных) к собранным фразеологизмам, превращающий простую коллекцию в структурированный исследовательский инструмент.

Методы разметки требуют выбора адекватных инструментов и проработки процедуры. Нами использованы следующие инструменты и программы:

  • ‒    системы управления базами данных (СУБД) для хранения и первичной разметки (заполнения полей, первоначальной структуризации корпуса) (например, Excel);

  • ‒    специализированное программное обеспечение для аннотирования: программы, предоставляющие удобный интерфейс для лингвиста-аннотатора (например, UAM CorpusTool, AntPConc для создания собственно параллельного корпуса). Подобные инструменты позволяют эффективно назначать теги, связывать контексты, вести историю изменений;

  • ‒    скрипты для автоматизации. Простые скрипты на Python (с использованием библиотек Pandas для данных, регулярных выражений для поиска паттернов) помогают в предварительной обработке данных, поиске дубликатов, генерации уникальных ID, массовом присвоении некоторых очевидных помет (например, всем фразеологизмам, содержащим слово taivas ‘небо’ или jumala ‘бог’, автоматически добавить помету «приход к богу» или «переход в другой локус»). В соответствии с данными целями был разработан скрипт на Python, позволяющий добавлять новые фразеологизмы в параллельный корпус;

  • ‒    онлайн-платформы для совместной работы: системы типа Google Sheets, Google Documents или специализированные корпусные менеджеры, поддерживающие одновременную работу и контроль версий.

При осуществлении разметки возник ряд сложностей. Так, на этапе подготовки данных потребовалась очистка, включающая удаление дубликатов, приведение к единому регистру, нормализацию орфографии, особенно для разговорных форм.

На этапе лексикографической разметки, т. е. заполнения обязательных полей (каноническая форма, буквальный перевод, значение), мы столкнулись с неоднозначностью интерпретации внутренней формы фразеологизма и точной передачи его значения на другом языке, особенно для уникальных культурно-специфичных образов. Например, в русском языке: перейти в Могилевскую губернию ; лечь (уснуть / выпить / поговорить) с Ильичом ; войти в Политбюро . В финском языке: jättää kamppeensa kirpparille ‘оставить пожитки для секонд-хенда’; kasvattaa varpaiden välistä päivänkakkaroita ‘выращивать ромашки между пальцев ног’; ottaa kyltti alas ‘снять табличку’.

На этапе семантической разметки, а именно присвоения фразеологизмам семантических помет на основе разработанной классификации, сложность состояла в разграничении критериев. Например, купить билет в один конец – это «окончание пути» или «переход в локус»? В таких случаях обращались к контексту или экспертному решению.

Субъективность разметки прослеживается и на этапе определения стилистического регистра. Разграничение «разговорного» и «сниженного» или «жаргонного» и «вульгарного» требует опоры на словарные пометы, корпусную частотность и экспертные знания. Фразеологизмы из интернет-сленга ( urbaanisanakirja.com ) особенно сложны для однозначной стилистической классификации.

Указание источника фразеологизма требует не всегда доступных этимологических исследований. Разграничение «калек» и «полных эквивалентов», а также диалектные формы требуют подтверждения источниками или носителями.

На этапе верификации и контроля качества для решения проблемных случаев и неоднозначных толкований потребовалась перекрестная проверка разметки разными аннотаторами, выявление и исправление ошибок и несоответствий, благодаря чему был снят ряд сложностей.

При экспорте и публикации корпуса в формате, удобном для конечного пользователя, используется просмотр корпуса через AntPConc, в перспективе предполагается создание веб-интерфейса для поиска.

Приведем несколько примеров размеченных данных из корпуса.

  • 1 . Фразеологизм (RU): отойти в лоно Авраама / Авраамово :

  • ‒    букв. перевод (FI): mennä Aabrahamin helmaan;

  • ‒    значение (RU): умереть, отойти в загробный мир (по библейскому представлению);

  • ‒    значение (FI): kuolla, päästä tuonelaan;

  • ‒    семантическая помета: приход к богу / переход в другой локус;

  • ‒    стилистическая помета: книжный, высокий (архаичный, библейский);

  • ‒    помета происхождения: библеизм;

  • ‒    контекст (RU): «Умер нищий и отнесен был Ангелами на лоно Авраамово» (источник: Евангелие от Луки, 16:22);

  • ‒    контекст (FI): «Kerjäläinen kuoli, ja enkelit kantoivat hänet Aabrahamin helmaan» (перевод);

  • ‒    комментарий: Архаичный и религиозный оттенок. В современной речи используется редко, преимущественно в стилизованных или ироничных контекстах. Единица mennä ‘идти’ в составе фразеологизма часто заменяется другими глаголами siirtyä ‘переходить’, päästä ‘попадать’.

  • 2 . Фразеологизм (FI): siirtyä suuren keskusviraston palvelukseen :

  • ‒    букв. перевод (RU): перейти на службу в большое центральное ведомство;

  • ‒    значение (FI): kuolla;

  • ‒    значение (RU): умереть;

  • ‒    семантическая помета: дисфемистичная окраска (ироничная) / переход в другой локус (бюрократический «загробный мир»);

  • ‒    стилистическая помета: разговорный, ироничный, сленговый;

  • ‒    помета происхождения: жаргон/сленг (образное переосмысление госслужбы);

  • ‒    контекст (FI): «Eilen sai kuulla, että sedästä on tullut virkamies ‒ siirtyi suuren keskusviraston palvelukseen»;

  • ‒    контекст (RU): «Вчера узнал, что дядя стал чиновником ‒ перешел на службу в большое центральное ведомство» (прямой перевод, передающий иронию);

  • ‒    комментарий: Типичный пример современного ироничного финского сленга. Шутливое выражение, отсылающее к неизбежной даже в загробной жизни бюрократии.

Примеры размеченных данных на русском и финском языках представлены на рисунках 1, 2.

Таким образом, создание разметки корпуса по предлагаемым нами критериям не требует специальных знаний в области программирования и доступно при использовании открытого программного обеспечения, однако верификация данных требует перекрестной экспертной оценки для пересмотра спорных случаев, в частности при соотнесении ФЕ с универсальной семантической метафорой или при выявлении источника происхождения ФЕ.

Заключение

Создание и разметка двуязычного корпуса фразеологизмов на тему смерти – комплексная задача, требующая тщательного планирования, использования разнообразных лингвистических источников, разработки детальной системы классификации и аннотирования, а также применения адекватных технологических решений. Найденные фразеологизмы демонстрируют богатство финской и русской фразеологии в рассматриваемой сфере, отражая культурные особенности восприятия смерти через эвфемизмы, дисфемизмы, метафоры пути, перехода, вечного покоя и ироничные образы.

Подобный корпус является эффективным инструментом для сопоставительного анализа финской и русской фразеологии. На выборке ФЕ со значением «умереть» предлагаются критерии разметки, позволяющие изучать культурные коннотации,

Отдать богу душу

Буквальный перевод: Antaa sielunsa jumalalle

Семантика: приход к богу

Стилистика: книжный, высокий

Комментарий: Религиозный эвфемизм. Христианское заимствование.

Происхождение: Заимствованное; религиозное

Р и с. 1. Пример размеченных данных на русском языке

F i g. 1. Example of labeled data in Russian

Elaman liekki sammui

Буквальный перевод: Пламя жизни погасло

Семантика: окончание пути

Стилистика: книжный, нейтральный

Комментарий: Поэтичная, эвфемистичная метафора.

Происхождение: Исконное; метафора

Р и с. 2. Пример размеченных данных на финском языке

F i g. 2. Example of labeled data in Finnish

Источник:

Source:

® ФИННО-УГОРСКИЙ МИР. Том 18, № 2. 2026 ^^^^^^e стилистические особенности и проблемы переводческой эквивалентности. Кроме основных указанных критериев семантики, этимологии и стилистики, разметка может учитывать: наличие дериватов, синонимов (рус. ‒ отбросить коньки / копыта / лапти , фин. ‒ heittää veivinsä / hokkarinsa / femmat ), особенности грамматического оформления (управление, фиксированный падеж / форма глагола) для генерации правильных контекстов в будущем [15]. Эта информация фиксируется в поле «Комментарий».

Размеченный корпус становится мощным инструментом для сравнительного анализа, выявления переводческих эквивалентов, изучения культурных коннотаций и стилистических регистров, а также основой для практических приложений в лексикографии и машинном переводе. Учет таких аспектов, как источник происхождения (калька, диалект, сленг) и детальная семантико-стилистическая разметка, значительно повышает научную и практическую ценность проекта создаваемого корпуса. Тем не менее процесс разметки неизбежно сопряжен с трудностями интерпретации и требует высокой квалификации аннотаторов и четких критериев для обеспечения консистентности данных.

Авторами создан и описан экспериментальный финско-русский корпус фразеологизмов тематической группы «умереть». Отличием предлагаемых нами критериев разметки корпуса от уже существующих является учет общих для обоих языков семантических метафор. Для тематической группы «умереть» это: окончание пути, приход к богу, вечный покой, физиологический конец, переход в локус, дисфемизмы.

Основным принципом аннотирования двуязычного корпуса является принцип универсальности для всех тематических групп ФЕ, а также принцип деления на информационные блоки. Исходя из этого, определены основные критерии разметки такого корпуса: семантико-тематический критерий, учитывающий универсальную семантическую метафору; семантический критерий, учитывающий коннотации; стилистический критерий; критерий языковой пары (наличие установленного переводческого эквивалента в другом языке либо возможность отождествления по смыслу, стилю и коннотации); этимологический критерий.

Подобный корпус является одним из шагов к созданию компьютерной модели языковой картины мира, которую можно использовать для работы с большими данными и обучения искусственного интеллекта. В перспективе планируется расширение корпуса для тематической группы ФЕ со значением «неудача» и разработка на его основе веб-интерфейса для исследователей.