<?xml version="1.0" encoding="UTF-8"?>
    <!DOCTYPE article PUBLIC "-//NLM/DTD JATS (Z39.96) Journal Publishing DTD v1.2 20120330//EN" "http://jats.nlm.nih.gov/publishing/1.2/JATS-journalpublishing1.dtd">
    <!--<?xml-stylesheet type="text/xsl" href="article.xsl">-->
<article xmlns:mml="http://www.w3.org/1998/Math/MathML" xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" article-type="research-article" dtd-version="1.2" xml:lang="en">
	<front>
		<journal-meta>
			<journal-id journal-id-type="issn">2313-0288</journal-id>
			<journal-id journal-id-type="eissn">2411-2968</journal-id>
			<journal-title-group>
				<journal-title>Russian Linguistic Bulletin</journal-title>
			</journal-title-group>
			<issn pub-type="epub">2313-0288</issn>
			<publisher>
				<publisher-name>ООО Цифра</publisher-name>
			</publisher>
		</journal-meta>
		<article-meta>
			<article-id pub-id-type="doi">10.60797/RULB.2024.55.11</article-id>
			<article-categories>
				<subj-group>
					<subject>Brief communication</subject>
				</subj-group>
			</article-categories>
			<title-group>
				<article-title>КОРПУСНЫЕ РЕСУРСЫ БУРЯТСКОГО ЯЗЫКА: СОСТОЯНИЕ, ПРОБЛЕМЫ, ПЕРСПЕКТИВЫ</article-title>
			</title-group>
			<contrib-group>
				<contrib contrib-type="author" corresp="yes">
					<contrib-id contrib-id-type="orcid">https://orcid.org/0000-0003-3326-9869</contrib-id>
					<contrib-id contrib-id-type="rinc">https://elibrary.ru/author_profile.asp?id=119335</contrib-id>
					<contrib-id contrib-id-type="rid">https://publons.com/researcher/AAC-1136-2021</contrib-id>
					<name>
						<surname>Бадмаева</surname>
						<given-names>Любовь Дашинимаевна</given-names>
					</name>
					<email>ldbadm@gmail.com</email>
					<xref ref-type="aff" rid="aff-1">1</xref>
				</contrib>
			</contrib-group>
			<aff id="aff-1">
				<label>1</label>
				<institution>Институт монголоведения, буддологии и тибетологии СО РАН</institution>
			</aff>
			<pub-date publication-format="electronic" date-type="pub" iso-8601-date="2024-07-09">
				<day>09</day>
				<month>07</month>
				<year>2024</year>
			</pub-date>
			<pub-date pub-type="collection">
				<year>2024</year>
			</pub-date>
			<volume>6</volume>
			<issue>55</issue>
			<fpage>1</fpage>
			<lpage>6</lpage>
			<history>
				<date date-type="received" iso-8601-date="2024-06-02">
					<day>02</day>
					<month>06</month>
					<year>2024</year>
				</date>
				<date date-type="accepted" iso-8601-date="2024-07-02">
					<day>02</day>
					<month>07</month>
					<year>2024</year>
				</date>
			</history>
			<permissions>
				<copyright-statement>Copyright: &amp;#x00A9; 2022 The Author(s)</copyright-statement>
				<copyright-year>2022</copyright-year>
				<license license-type="open-access" xlink:href="http://creativecommons.org/licenses/by/4.0/">
					<license-p>
						This is an open-access article distributed under the terms of the Creative Commons Attribution 4.0 International License (CC-BY 4.0), which permits unrestricted use, distribution, and reproduction in any medium, provided the original author and source are credited. See 
						<uri xlink:href="http://creativecommons.org/licenses/by/4.0/">http://creativecommons.org/licenses/by/4.0/</uri>
					</license-p>
					.
				</license>
			</permissions>
			<self-uri xlink:href="https://rulb.org/archive/7-55-2024-july/10.60797/RULB.2024.55.11"/>
			<abstract>
				<p>Данная работа посвящена рассмотрению предыстории, истории организации и составления корпусных ресурсов на материале бурятского языка. Представлена характеристика задела для развития корпусного направления в бурятском языкознании, как конкордансы, частотные словари, картотеки, составлявшиеся в докомпьютерную эпоху. Дается описание состояния основного «Бурятского корпуса», Параллельного бурятско-русского корпуса и Диахронического корпуса бурятского языка, характеризуются их структура и основные проблемы при их разработках. Автором делаются выводы о высокой востребованности разрабатываемых корпусов и значении расширения в них разных видов разметок для проведения продуктивных лингвистических и прикладных исследований. Представлены перспективы рассматриваемых корпусов и основные задачи их дальнейшего развития.</p>
			</abstract>
			<kwd-group>
				<kwd>бурятский язык</kwd>
				<kwd> корпус</kwd>
				<kwd> разметка</kwd>
				<kwd> грамматический словарь</kwd>
			</kwd-group>
		</article-meta>
	</front>
	<body>
		<sec>
			<title>HTML-content</title>
			<p>1. Введение</p>
			<p>В настоящее время корпусная лингвистика без сомнения является одним из актуальных направлений современного языкознания. Она прочно заняла, благодаря своим теоретическим и различного рода прикладным, инжиниринговым результатам, лидирующие позиции, как неуклонно развивающийся раздел филологической науки в целом на междисциплинарных стыках. Вышесказанное можно подтвердить и вниманием, оказывающимся со стороны государственных структур, как например: </p>
			<p>1. в начале апреля 2024 г. на заседании Президиума Российской академии наук обсуждались задачи корпусных исследований языков и заслушивались ряд докладов по Национальному корпусу русского языка, а также по другим языкам народов России [1]; 2. в середине мая 2024 г. Домом народов России при поддержке Федерального агентства по делам национальностей России проведена I-я стратегическая сессия «Информационные технологии и языки народов России» [2], на которой рассматривались вопросы государственной национальной политики в сфере поддержки языков народов России в киберпространстве.</p>
			<p>2. Методы и принципы исследования</p>
			<p>Идеи, методы, методика корпусной лингвистики начали проникать в бурятское языкознание и развиваться, использоваться в нем примерно в то же время, как это происходило и в развитии других частных лингвистических направлений по малым и средним языкам народов России. В бурятском языкознании инструментарии корпусной лингвистики, используемые сегодня, как само собой разумеющееся, например, такие, как конкордансы, частотные словари (ЧС) привлекли внимание уже в 80-е годы прошлого века </p>
			<p>[3][4][4, С. 7]</p>
			<p>С появлением и активным проникновением технологий корпусной лингвистики, как известно, являющейся частью компьютерной, в российскую лингвистическую среду и вслед за появлением в открытом доступе Национального корпуса русского языка (НКРЯ) c 2002 г. языковеды по другим языкам народов России стали также постепенно друг за другом ставить и решать задачи разработок своих языковых корпусов, явившихся информационными системами соответственно абсолютно нового поколения.   </p>
			<p>В разработке «Бурятского корпуса», можно сказать, результаты вероятностно-статистических методов и подходов и сами данные методы с приходом корпусных технологий приобрели свое закономерное и эффективное воплощение.</p>
			<p>3. Основные результаты</p>
			<p>Следует сказать, что разработка «Бурятского корпуса» претерпела несколько версий, которые были представлены в онлайн. С 2011 г. была открыта первая опытная версия с названием «Корпус бурятского языка» объемом около 800 тыс. словоупотреблений по адресу ЦВРК ИМБТ СО РАН </p>
			<p>[5]</p>
			<p>Опыт работ по составлению названной выше версии корпуса вместе с языковыми и программными материалами послужил нашему участию на конкурсной основе в Программе Президиума РАН запущенной в 2011 г. по фундаментальным научным исследованиям под названием «Корпусная лингвистика».</p>
			<p>Далее, при поддержке данной Программы в 2012 г. был впервые открыт полноправный корпусный сайт по бурятскому языку </p>
			<p>[6]</p>
			<p>В дальнейшем, данная версия нашего корпуса претерпела обновление и пополнение в 2016 и в 2021 гг., оба раза - при финансовой поддержке по Контрактам Минобразования и науки Республики Бурятия. В «Бурятском корпусе» интегрированы соответственно базы данных текстов, грамматического словаря, а также, основная часть бурятско-русского словаря. По текстовой базе данных есть возможность осуществлять поиск лексем, как по всем входящим текстовым документам, так и при необходимости – отдельным текстам. Грамматический словарь (далее – ГС) первоначально составлялся нами вручную в Exсel на базе сформированного электронного словника бурятско-русского словаря </p>
			<p>[7][8]</p>
			<p>В результате обновления и пополнения бурятского корпуса, выполненных к декабрю 2021 г., была открыта версия на другой корпусной платформе, усовершенствованной по отношению к предыдущей под названием Цакорпус </p>
			<p>[9][9, С. 23]</p>
			<p>Еще одним современным программным инструментарием для изучения бурятского языка является «Параллельный бурятско-русский корпус» </p>
			<p>[10]</p>
			<p>Следующий корпусный ресурс, называющийся «Диахронический корпус бурятского языка» (далее – ДКБЯ) </p>
			<p>[11]</p>
			<p>Описанные выше корпусы, как параллельный, диахронический можно считать по терминологии Е.В. Рахилиной </p>
			<p>[12, С. 14]</p>
			<p>«Бурятский корпус» является письменным одноязычным и основным ресурсом из ряда вышеописанных. Наряду с его развитием, разрабатывается и корпус звукового формата, представляющий возможность получать информацию о звучании, просодии диалектов бурятского языка, отличающегося их разнообразием. Данный звуковой корпус будет являться специальным (см. выше). В отделе языкознания ИМБТ СО РАН плодотворно ведется работа над названным видом корпуса бурятского языка </p>
			<p>[13][14]</p>
			<p>Методы и приемы лингвистического анализа корпусной и традиционной лингвистики, дополняя друг друга, определенным образом также совпадая, позволят получать совершенно новые результаты, выявить в бурятском языке вербальные явления, которые при традиционном анализе получить было невозможно. Методология корпусной лингвистики включает в себя автоматическую обработку текста, иначе - АОТ, как комплекс взаимосвязанных методов, приемов, процедур, начиная с предварительных автоматизированных поисков и извлечений искомых языковых данных из самих корпусов, как правило, с большими массивами текстовых, эмпирических данных, для их дальнейшего анализа. Использованием корпусных данных активизируются по-новому количественный / статистический, контекстного анализа, с применением, например, конкордансов, методы, предоставляя возможность для более глубокого описания, исследуемого языкового аспекта. В «Бурятском корпусе» имеется множество приемов отбора языковых данных, описание которых доступно в его настройках. Например, поиск лексических единиц можно осуществлять по словоформе, по лемме, а также – либо по всему ресурсу, либо - по текстовым источникам конкретного автора.</p>
			<p>    </p>
			<p>Каждый корпус имеет большие перспективы для своего дальнейшего, поступательного развития. Параллельный корпус бурятского языка может дополнятся другими языковыми переводами, как с бурятского, так и, например, с монгольского, английского и других языков. Кроме этого, надо отметить, параллельный корпус должен дополняться не только художественными переводами, но и направлением филологических / подстрочных переводов. Их можно назвать симметричными переводами. Все корпусные ресурсы востребованы не только в исследовательской деятельности, равным образом они могут использоваться в системе образования, в преподавании, обучении и изучении соответствующего языка. Не является исключением в связи с вышесказанным и параллельный корпус бурятского языка. Помимо сказанного, текстовые базы данных в настоящее время крайне востребованы для проекта разработки автоматического бурятско-русского переводчика, о первичной онлайн версии которого, сообщается 27.06.2024 [15]. Для указанного проекта требуется первоначально параллельный корпус объемом не менее 50-100 тысяч выровненных предложений (бурятско-русских, русско-бурятских). Относительно вышесказанного филологического / построчного переводов надо пояснить их разницу в сравнении с художественными переводами, в которых наблюдается асимметрия, то есть не соблюдаются границы оригинального предложения, как пропуск литературным переводчиком части или целого предложения, нескольких предложений, даже крупных отрывком, добавление от переводчика личного текста, перестановки последовательности авторского текста в переводе. Параллельные художественные тексты с подобными расхождениями представляют определенную сложность для их использования при разработках автоматического переводчика.</p>
			<p>4. Обсуждение</p>
			<p>Разработка «Бурятского корпуса» выполняется с 2006 г. в формате долгосрочного инициативного научного проекта при поддержке различных научных фондов и госструктуры. Финансовая поддержка была оказана Минобразования и науки Республики Бурятия, РГНФ, РФФИ, ФФЛИ, Программой фундаментальных исследований Президиума РАН «Корпусная лингвистика». Выполнение работ по дальнейшему развитию бурятского корпуса предполагается быть включенным в плановый проект отдела языкознания ИМБТ СО РАН соответственно с финансированием по Госзаданию с 2026 г.</p>
			<p>Одной из главных составляющих любого языкового корпуса являются тексты, специальным образом подготовленные. Наряду с тем, что исполнителями проводились работы по сканированию, редактированию, заключались договоры с официальными бурятскими издательствами по получению электронных версий текстов, также приобретались из открытого доступа, например, из СМИ и электронных библиотек. В конце ХХ в. – начале ХХI в.  книгопечатание и литературный процесс на бурятском языке переживали сложные времена, поэтому был сделан упор на художественную бурятскую литературу середины и II-й половины ХХ в. Тексты середины ХХ в. отражают соответственно в языковом аспекте свой вариант, в содержательном плане в основном, действительность того времени. Бурятский язык в произведениях, например, Х. Намсараева отличается от языка произведений современных авторов. Проблема репрезентативности текстовой составляющей бурятского корпуса стала решаться с постепенным налаживанием процесса книгопечатания на бурятском языке с 2010-х годов. Вместе с подготовкой текстовой составляющей параллельно решались вопросы программного обеспечения для ее интеграции в корпусный ресурс с соответствующими инструментариями, как интерфейс, осуществление настроек поиска, частотный и грамматический словари, последний с выполненной морфологической и мета- разметкой.</p>
			<p>5. Заключение</p>
			<p>Востребованность бурятских корпусных ресурсов неуклонно растет, что наблюдается по увеличению числа научных работ (статей, монографических исследований, диссертаций) по разным аспектам бурятского языка с использованием данных бурятского корпуса </p>
			<p>[16, С. 13-15]</p>
			<p>В основных задачах развития бурятских корпусов всегда остаются планы углубления разработок, которые можно подразделить на два типа: 1. задачи общего характера, имеющие целью пополнение текстовых баз данных всех ресурсов в соответствии с принципами их репрезентативности и сбалансированности; 2. частные задачи по основному и специальным корпусам бурятского языка по отдельности. Частные задачи основного корпуса нацелены на разработку семантической разметки. По параллельному корпусу бурятского языка к задачам второго типа относятся продолжение полуавтоматического выравнивания бурятско-русских и обратных художественных текстов с последующим пополнением текстовой базы данных и морфологическая разметка текстов. Чем глубже и, чем больше разных видов разметок в корпусе, тем больше исследовательских, равно, как и образовательных, учебных, методических и тому подобных задач можно решать на его данных [17]. Лингвистическая разметка и/или аннотация, являясь и процессом, и его результатом, дает разнообразную информацию о текстовых материалах корпуса. Основными видами разметки «Бурятского корпуса» являются метаразметка и собственно лингвистическая разметка (в Основных результатах выше указано о разметке внешних данных текстов и морфологических признаках словоформ). Названые виды разметки, часто могут иметь в свою очередь свои подвиды (например, в «Бурятском корпусе» выдается частеречная принадлежность словоформ). Все виды работ по разрабатываемым корпусам, их программные составляющие выполняются в тесном сотрудничестве с соответствующими специалистами, как компьютерные, корпусные лингвисты и естественно, самими языковедами, специализирующимися в области бурятского, в целом, монгольского языкознания.</p>
		</sec>
		<sec sec-type="supplementary-material">
			<title>Additional File</title>
			<p>The additional file for this article can be found as follows:</p>
			<supplementary-material xmlns:xlink="http://www.w3.org/1999/xlink" id="S1" xlink:href="https://doi.org/10.5334/cpsy.78.s1">
				<!--[<inline-supplementary-material xlink:title="local_file" xlink:href="https://rulb.org/media/articles/13490.docx">13490.docx</inline-supplementary-material>]-->
				<!--[<inline-supplementary-material xlink:title="local_file" xlink:href="https://rulb.org/media/articles/13490.pdf">13490.pdf</inline-supplementary-material>]-->
				<label>Online Supplementary Material</label>
				<caption>
					<p>
						Further description of analytic pipeline and patient demographic information. DOI:
						<italic>
							<uri>https://doi.org/10.60797/RULB.2024.55.11</uri>
						</italic>
					</p>
				</caption>
			</supplementary-material>
		</sec>
	</body>
	<back>
		<ack>
			<title>Acknowledgements</title>
			<p>Институт монголоведения, буддологии и тибетологии СО РАН, Улан-Удэ, Российская Федерация</p>
		</ack>
		<sec>
			<title>Competing Interests</title>
			<p/>
		</sec>
		<ref-list>
			<ref id="B1">
				<label>1</label>
				<mixed-citation publication-type="confproc">Национальный корпус русского языка стал одним из самых востребованных инструментов русистов во всем мире.— URL: https://www.ras.ru/news/shownews.aspx?id=15adbfc1-d29c-483c-b983-fbe63ca3e110 (дата обращения: 15.04.2024).
</mixed-citation>
			</ref>
			<ref id="B2">
				<label>2</label>
				<mixed-citation publication-type="confproc">I-я стратегическая сессия «Информационные технологии и языки народов России» // I-я стратегическая сессия «Информационные технологии и языки народов России». — 2024 — URL: https://fadn.gov.ru/press-centr/news/i-strategicheskaya-sessiya-%C2%ABinformaczionnyie-texnologii-i-yazyiki-narodov-rossii%C2%BB (дата обращения: 15.05.2024)</mixed-citation>
			</ref>
			<ref id="B3">
				<label>3</label>
				<mixed-citation publication-type="confproc">Дырхеева Г.А. Конкордансы, словоуказатели (индексы) и частотные словари к литературным произведениям / Г.А. Дырхеева. — Улан-Удэ, 1981. — 27 с. — Деп. в ИНИОН АН СССР. — 28.05.82, № 10294.</mixed-citation>
			</ref>
			<ref id="B4">
				<label>4</label>
				<mixed-citation publication-type="confproc">Дырхеева Г.А. Использование частотного словаря для оптимизации преподавания бурятского языка. / Г.А. Дырхеева — Улан-Удэ: Изд-во БНЦ СО РАН, 1992. — 238 с.
</mixed-citation>
			</ref>
			<ref id="B5">
				<label>5</label>
				<mixed-citation publication-type="confproc">Корпус бурятского языка. — 2011 — URL: http://corpora.imbtarchive.ru/index.php (дата обращения: 25.04.2024)
</mixed-citation>
			</ref>
			<ref id="B6">
				<label>6</label>
				<mixed-citation publication-type="confproc">Бурятский корпус. — 2012 — URL: http://web-corpora.net/BuryatCorpus/search/?interface_language=ru (дата обращения: 25.04.2024)
</mixed-citation>
			</ref>
			<ref id="B7">
				<label>7</label>
				<mixed-citation publication-type="confproc">Шагдаров Л.Д. Бурятско-русский словарь / Л.Д. Шагдаров, К.М. Черемисов — Улан-Удэ: ОАО «Республиканская типография», 2006. — 636 с.</mixed-citation>
			</ref>
			<ref id="B8">
				<label>8</label>
				<mixed-citation publication-type="confproc">Шагдаров Л.Д. Бурятско-русский словарь / Л.Д. Шагдаров, К.М. Черемисов — Улан-Удэ: OAO «Республиканская типография», 2008. — 708 с.
</mixed-citation>
			</ref>
			<ref id="B9">
				<label>9</label>
				<mixed-citation publication-type="confproc">Архангельский Т.А.. Корпусная платформа Tsakorpus и языки России / Т.А. Архангельский // Электронная письменность народов Российской федерации – 2021 &amp;amp; IWCLUL 2021. Материалы Междунар. научно-практич. конф.; — Сыктывкар: Изд-во «Коми республиканская академия государственной службы и управления», 2021. — с. 23-24.
</mixed-citation>
			</ref>
			<ref id="B10">
				<label>10</label>
				<mixed-citation publication-type="confproc">Параллельный бурятско-русский корпус. — 2016 — URL: https://ruscorpora.ru/new/search-para.html?lang=bua (дата обращения: 25.04.2024)
</mixed-citation>
			</ref>
			<ref id="B11">
				<label>11</label>
				<mixed-citation publication-type="confproc">Диахронический корпус бурятского языка // Диахронический корпус бурятского языка. — 2020 — URL: http://annals.imbtarchive.ru/ (дата обращения: 25.04.2024)</mixed-citation>
			</ref>
			<ref id="B12">
				<label>12</label>
				<mixed-citation publication-type="confproc">Рахилина Е.В.. Корпус как творческий процесс / Е.В. Рахилина // Национальный корпус русского языка: 2006-2008. — Новые результаты и перспективы.; — Санкт-Петербург: СПб : Несто-История, 2009. — с. 7-25.</mixed-citation>
			</ref>
			<ref id="B13">
				<label>13</label>
				<mixed-citation publication-type="confproc">Абаева Л.Д.. Вопросы разработки звукового корпуса бурятских диалектов / Л.Д. Абаева // Предложение как единица речи. Материалы Всероссийского научного симпозиума с международным участием, посвященного 95-летию со дня рождения М.И. Черемисиной. — Новосибирск: Изд-во ФГБУН Институт филологии, 2019. — с. 165-167.
</mixed-citation>
			</ref>
			<ref id="B14">
				<label>14</label>
				<mixed-citation publication-type="confproc">Абаева Ю.Д. Геоинформационный веб-ресурс «Диалектный корпус бурятского языка / Ю.Д. Абаева, О.С. Ринчинов // Филологические науки. Вопросы теории и практики. — 2023. — 1. — с. 328-334.</mixed-citation>
			</ref>
			<ref id="B15">
				<label>15</label>
				<mixed-citation publication-type="confproc">Google Translate (Google Переводчик) получил самое большое обновление – добавилось 110 языков, включая языки регионов России. — 2024. — URL: https://www.ixbt.com/news/2024/06/27/google-translate-google-110.html (дата обращения: 01.07.2024)
</mixed-citation>
			</ref>
			<ref id="B16">
				<label>16</label>
				<mixed-citation publication-type="confproc">Скрибник Е.К. Подлежащее в бурятских конструкциях каузации эмоций / Е.К. Скрибник, Н.Д. Даржаева // Языки и фольклор коренных народов Сибири. — 2024. — 1(49). — с. 9-23.</mixed-citation>
			</ref>
			<ref id="B17">
				<label>17</label>
				<mixed-citation publication-type="confproc">Толдова С.Ю. Разметка лингвистическая / С.Ю. Толдова, Е.А. Логинова, Д.П. Попова // Разметка лингвистическая. — 2011 — URL: https://clck.ru/3Bm726 (дата обращения: 01.07.2024)
</mixed-citation>
			</ref>
		</ref-list>
	</back>
	<fundings>
		<funding lang="RUS">Работа выполнена в рамках государственного задания (проект «Мир человека в монгольских языках: анализ средств выражения эмотивности»).</funding>
		<funding lang="ENG">The work was carried out within the framework of a state assignment (the project “The Human World in the Mongolian Languages: Analysis of Means of Expressing Emotivity”).</funding>
	</fundings>
</article>