BEGIN:VCALENDAR
VERSION:2.0
PRODID:-//pretalx//conf.esoil.ru//pgb2026//talk//CHNE9G
BEGIN:VTIMEZONE
TZID:MSK
BEGIN:STANDARD
DTSTART:20001029T040000
RRULE:FREQ=YEARLY;BYDAY=-1SU;BYMONTH=10;UNTIL=20111030T000000Z
TZNAME:MSK
TZOFFSETFROM:+0400
TZOFFSETTO:+0300
END:STANDARD
BEGIN:STANDARD
DTSTART:20120101T000000
RRULE:FREQ=YEARLY;BYMONTH=1;UNTIL=20131231T200000Z
TZNAME:MSK
TZOFFSETFROM:+0400
TZOFFSETTO:+0400
END:STANDARD
BEGIN:STANDARD
DTSTART:20150101T000000
RRULE:FREQ=YEARLY;BYMONTH=1
TZNAME:MSK
TZOFFSETFROM:+0300
TZOFFSETTO:+0300
END:STANDARD
BEGIN:DAYLIGHT
DTSTART:20000326T030000
RRULE:FREQ=YEARLY;BYDAY=-1SU;BYMONTH=3;UNTIL=20100328T000000Z
TZNAME:MSD
TZOFFSETFROM:+0300
TZOFFSETTO:+0400
END:DAYLIGHT
END:VTIMEZONE
BEGIN:VEVENT
UID:pretalx-pgb2026-CHNE9G@conf.esoil.ru
DTSTART;TZID=MSK:20260916T172400
DTEND;TZID=MSK:20260916T172600
DESCRIPTION:Повышение доступности и полноты д
 остоверной информации о почвенных ресур
 сах имеет существенное значение для обе
 спечения продовольственной безопасност
 и\, управления сельским хозяйством и про
 гнозирования климатических изменений. О
 сновным источником таких данных остаютс
 я результаты полевых почвенных обследов
 аний\, проведение которых требует значит
 ельных временных и трудовых ресурсов и\, 
 как правило\, ограничено определенными т
 ерриториями. В связи с этим научные публ
 икации могут рассматриваться как дополн
 ительный источник почвенной информации\
 , вместе с тем использование научной лит
 ературы для формирования структурирова
 нных наборов данных затруднено многообр
 азием способов представления и организа
 ции информации\, а также распределением 
 содержательно значимых сведений между р
 азличными типами элементов\, включая осн
 овной текст\, таблицы и графические мате
 риалы. Развитие методов обработки естес
 твенного языка и больших языковых модел
 ей открывает возможности для автоматизи
 рованного выявления и интерпретации инф
 ормации\, представленной в научных публи
 кациях\, с учетом специфики предметной о
 бласти\, ее последующей систематизации и
  преобразования в унифицированный машин
 очитаемый формат.\nЦель исследования — р
 азработка системы извлечения данных из 
 текстов научных публикаций и формирован
 ие специализированных наборов данных\, д
 оступных в структурированном машиночит
 аемом виде. В рамках исследования был сф
 ормирован датасет\, включающий ручную ра
 зметку корпуса из 263 русскоязычных стате
 й журнала «Почвоведение»\, опубликованн
 ых в 1990–1991 и 2019–2020 гг. На основе структу
 ры датасета разработана JSON-схема\, опред
 еляющая состав и организацию данных\, по
 длежащих извлечению из текста публикаци
 й. Дополнительно разработан алгоритм пр
 еобразования данных исходного датасета 
 в формат JSON\, обеспечивающий унифицирова
 нное представление и возможность сопост
 авления извлеченных сведений.\nРазработ
 анная схема включает общие сведения о пу
 бликации\, информацию об объектах исслед
 ования (место отбора образцов\, тип расти
 тельности и землепользования\, антропог
 енное воздействие\, классификацию почвы 
 в месте заложения разреза и глубины зале
 гания горизонтов)\, общие физические сво
 йства почв (полевая текстура\, плотность\
 , коэффициент фильтрации влаги)\, а также 
 результаты лабораторных измерений почв
 енных образцов\, включая содержание и за
 пасы органического углерода и карбонато
 в\, показатели водно-солевого баланса и с
 одержание химических элементов.\nДля авт
 оматизации извлечения информации была и
 сследована архитектура\, основанная на п
 ринципах Retrieval-Augmented Generation (RAG)\, обеспечив
 ающая получение релевантных фрагментов 
 исходного текста перед формированием от
 вета языковой моделью. В качестве источн
 ика для поиска использовались тексты на
 учных статей\, предварительно распознан
 ные с помощью OCR-модели и преобразованны
 е в формат Markdown. На их основе была сформи
 рована векторная база данных\, обеспечив
 ающая семантический поиск фрагментов те
 кста\, релевантных извлекаемым сущностя
 м и значениям.\nАлгоритм объединяет мето
 ды обработки табличных данных\, механизм
 ы обеспечения ссылочной целостности и п
 роцедуры привязки извлеченных значений 
 к конкретным фрагментам исходного текст
 а. Для повышения релевантности контекст
 а применялись методы семантического пои
 ска на основе вычисления косинусного сх
 одства векторных представлений и послед
 ующего ранжирования найденных фрагмент
 ов языковой моделью. \nВ результате иссле
 дования сформированы датасет с ручной р
 азметкой корпуса научных публикаций\, фо
 рмальная схема представления почвенных 
 данных и алгоритм их автоматизированног
 о извлечения и преобразования в машиноч
 итаемый формат. Разработанный подход об
 еспечивает возможность систематизации 
 информации\, содержащейся в научной лите
 ратуре\, и ее последующего использования
  для формирования структурированных поч
 венных наборов данных и баз данных.
DTSTAMP:20260923T014029Z
LOCATION:Стенд-холл 1 (коридор 3 этажа)
SUMMARY:Алгоритм извлечения структурирован
 ных почвенных данных из научных публика
 ций - Солдаткина Маргарита Алексеевна
URL:https://conf.esoil.ru/pgb2026/talk/CHNE9G/
END:VEVENT
END:VCALENDAR
