Текущий выпуск Номер 4, 2026 Том 18

Все выпуски

Результаты поиска по 'labeling':
Найдено статей: 13
  1. Макаров И.С., Баганцова Е.Р., Яшин П.А., Ковалёва М.Д., Горбачёв Р.А.
    Разработка и исследование алгоритмов машинного обучения для решения задачи классификации в публикациях Twitter
    Компьютерные исследования и моделирование, 2023, т. 15, № 1, с. 185-195

    Посты в социальных сетях способны как предсказывать движение финансового рынка, так и в некоторых случаях даже определять его направление. Анализ постов в Twitter способствует прогнозированию цен на криптовалюту. Специфика рассматриваемого сообщества заключается в особенной лексике. Так, в постах используются сленговые выражения, аббревиатуры и сокращения, наличие которых затрудняет векторизацию текстовых данных, в следствие чего рассматриваются методы предобработки такие, как лемматизация Stanza и применение регулярных выражений. В этой статье описываются простейшие модели машинного обучения, которые могут работать, несмотря на такие проблемы, как нехватка данных и короткие сроки прогнозирования. Решается задача бинарной текстовой классификации, в условиях которой слово рассматривается как элемент бинарного вектора единицы данных. Базисные слова определяются на основе частотного анализа упоминаний того или иного слова. Разметка составляется на основе свечей Binance с варьируемыми параметрами для более точного описания тренда изменения цены. В работе вводятся метрики, отражающие распределение слов в зависимости от их принадлежности к положительному или отрицательному классам. Для решения задачи классификации использовались dense-модель с подобранными при помощи Keras Tuner параметрами, логистическая регрессия, классификатор случайного леса, наивный байесовский классификатор, способный работать с малочисленной выборкой, что весьма актуально для нашей задачи, и метод k-ближайших соседей. Было проведено сравнение построенных моделей на основе метрики точности предсказанных меток. В ходе исследования было выяснено, что наилучшим подходом является использование моделей, которые предсказывают ценовые движения одной монеты. Наши модели имеют дело с постами, содержащими упоминания проекта LUNA, которого на данный момент уже не существует. Данный подход к решению бинарной классификации текстовых данных широко применяется для предсказания цены актива, тренда ее движения, что часто используется в автоматизированной торговле.

    Makarov I.S., Bagantsova E.R., Iashin P.A., Kovaleva M.D., Gorbachev R.A.
    Development of and research on machine learning algorithms for solving the classification problem in Twitter publications
    Computer Research and Modeling, 2023, v. 15, no. 1, pp. 185-195

    Posts on social networks can both predict the movement of the financial market, and in some cases even determine its direction. The analysis of posts on Twitter contributes to the prediction of cryptocurrency prices. The specificity of the community is represented in a special vocabulary. Thus, slang expressions and abbreviations are used in posts, the presence of which makes it difficult to vectorize text data, as a result of which preprocessing methods such as Stanza lemmatization and the use of regular expressions are considered. This paper describes created simplest machine learning models, which may work despite such problems as lack of data and short prediction timeframe. A word is considered as an element of a binary vector of a data unit in the course of the problem of binary classification solving. Basic words are determined according to the frequency analysis of mentions of a word. The markup is based on Binance candlesticks with variable parameters for a more accurate description of the trend of price changes. The paper introduces metrics that reflect the distribution of words depending on their belonging to a positive or negative classes. To solve the classification problem, we used a dense model with parameters selected by Keras Tuner, logistic regression, a random forest classifier, a naive Bayesian classifier capable of working with a small sample, which is very important for our task, and the k-nearest neighbors method. The constructed models were compared based on the accuracy metric of the predicted labels. During the investigation we recognized that the best approach is to use models which predict price movements of a single coin. Our model deals with posts that mention LUNA project, which no longer exist. This approach to solving binary classification of text data is widely used to predict the price of an asset, the trend of its movement, which is often used in automated trading.

  2. Щербань И.В., Лысенко Л.В., Щербань О.Г., Калитин К.Ю.
    Статистический анализ и моделирование паттернов активации обонятельной луковицы на основе немаркированных пространственных точечных процессов
    Компьютерные исследования и моделирование, 2026, т. 18, № 4, с. 1005-1019

    В нейробиологии исследование механизмов кодирования запахов требует анализа пространственных паттернов активации обонятельных структур (гломерул), реконструируемых по данным мультифотонной микроскопии. Однако отсутствие формального статистического аппарата для анализа обобщенных карт, полученных на группе животных, ограничивает воспроизводимость результатов и затрудняет синтез прогностических моделей. Для преодоления этих ограничений разработана методология анализа карт ольфакторной активности, суммарно зарегистрированных на нескольких животных, основанная на теории немаркированных случайных точечных процессов. Методология включает процедуру предобработки данных и алгоритм численного анализа, реализованный в среде R с использованием пакета spatstat. Предложенный подход позволяет: (1) перейти от исходных карт гломерулярной активности к точечным паттернам с сохранением информации о размерах гломерул; (2) выполнить анализ точечных паттернов и рассчитать пространственно-морфологические характеристики специфичных для каждого одоранта областей (доменов) устойчивой активации гломерул; (3) выполнить статистическую проверку гипотез о пространственной случайности точечных паттернов с использованием $K$-функции Рипли, $G$-функции ближайших соседей и метода Монте-Карло; (4) синтезировать параметрическую модель парных взаимодействий Штрауса, параметры которой $(r_{PI}, \gamma)$ имеют ясную биологическую интерпретацию — масштаб пространственного взаимодействия гломерул и силу комодуляции ответов соответственно.

    Валидация методологии выполнена на экспериментальных данных, полученных на 24 лабораторных крысах (10 особей стимулированы камфорой, 14 — метилбензоатом). Подобранные модели Штрауса продемонстрировали близкие, но специфичные для каждого одоранта параметры: радиус взаимодействия $r_{PI}$ составил 150 мкм для камфоры и 120 мкм для метилбензоата, коэффициент взаимодействия $\gamma$ — 0,95 и 0,89 соответственно. Валидация с использованием $Q$-$Q$-графиков сглаженных остатков подтвердила адекватность моделей, а рассчитанные на этапе (2) суммарная площадь доменов (0,60 мм2 и 0,73 мм2) и плотность реакций (38 и 43 точки/мм2) полностью согласуются с параметрическими сигнатурами $(r_{PI}, \gamma)$ моделей.

    Предложенный подход обеспечивает воспроизводимую количественную оценку гломерулярных доменов в единой стереотаксической системе координат и может быть распространен на другие одоранты и биологические виды. Все выводы получены на наркотизированных животных; экстраполяция на активные обонятельные стратегии бодрствующих животных требует дополнительных исследований.

    Shcherban I.V., Lysenko L.V., Shcherban O.G., Kalitin K.Y.
    Statistical analysis and modeling of olfactory bulb activation patterns using unmarked spatial point processes
    Computer Research and Modeling, 2026, v. 18, no. 4, pp. 1005-1019

    In neuroscience, the study of odor coding mechanisms requires the analysis of spatial activation patterns of olfactory structures (glomeruli) reconstructed from multiphoton microscopy data. However, the lack of a formal statistical framework for analyzing population-level summary maps limits result reproducibility and hinders the development of predictive models. To address these limitations, we developed a novel methodology for the analysis of olfactory activity maps aggregated across multiple animals, based on the theory of unmarked spatial point processes. The methodology includes a data preprocessing procedure and a numerical analysis algorithm implemented in the R environment using the spatstat package.

    The proposed approach enables: (1) transformation of raw glomerular activity maps into point patterns while preserving information about glomerular sizes (replacing size information with local point density is a methodological compromise reflecting the “functional weight” of glomerular input); (2) analysis of point patterns based on spatial morphometric characteristics of domains — regions of stable glomerular activation in the olfactory bulb, each approximated by an ellipse, with ellipse parameters (center coordinates in stereotaxic space, major and minor axis lengths, orientation angles), areas, and intra-ellipse point densities reflecting odorant-specific response signatures; (3) statistical hypothesis testing for spatial randomness (Complete Spatial Randomness) using Ripley’s $K$-function, the nearest-neighbor G-function, and Monte Carlo simulations; (4) synthesis of a parametric pairwise interaction model (Strauss process), whose parameters $(r_{PI}, \gamma)$ have a clear biological interpretation — the spatial interaction scale of glomeruli and the strength of response comodulation, respectively.

    The methodology was validated using experimental data obtained from 24 laboratory rats: 10 animals stimulated with camphor and 14 with methyl benzoate. The fitted Strauss models yielded close but odorant-specific parameters: interaction radii $r_{PI}$ of 150 $\mu$m (camphor) and 120 μm (methyl benzoate); interaction parameters $gamma$ of 0.95 and 0.89, respectively. The total domain areas (0.60 mm2 and 0.73 mm2) and point densities (38 and 43 points/mm2) calculated at the first stage of analysis are fully consistent with the parametric signatures $(r_{PI}, \gamma)$ of the Strauss model. Model validation using $Q$-$Q$ plots of smoothed residuals confirmed their adequacy.

    Our results are consistent with data previously obtained using genetic labeling and functional mapping techniques, demonstrating the correctness of the proposed methodology and the effectiveness of multiphoton laser scanning microscopy for such applications. The proposed framework provides reproducible quantitative assessment of glomerular domains within a unified stereotaxic coordinate system and can be extended to other odorants and biological species. All findings were obtained under anesthesia; extrapolation to active olfactory strategies in awake animals requires further investigation.

  3. Шахин Л., Рашид Б., Mazzara M.
    Новый подход к самообучению для обнаружения видов деревьев с использованием гиперспектральных и лидарных данных
    Компьютерные исследования и моделирование, 2024, т. 16, № 7, с. 1747-1763

    Точное определение деревьев имеет решающее значение для экологического мониторинга, оценки биоразнообразия и управления лесными ресурсами. Традиционные методы ручного обследования трудоемки и неэффективны на больших территориях. Достижения в области дистанционного зондирования, включая лидар и гиперспектральную съемку, способствуют автоматизированному и точному обнаружению в различных областях.

    Тем не менее, эти технологии обычно требуют больших объемов размеченных данных и ручной инженерии признаков, что ограничивает их масштабируемость. Данное исследование предлагает новый метод самообучения (Self-Supervised Learning, SSL) с использованием архитектуры SimCLR для улучшения классификации видов деревьев на основе неразмеченных данных. Модель SSL автоматически обнаруживает сильные признаки, объединяя спектральные данные гиперспектральной съемки со структурными данными лидара, исключая необходимость ручного вмешательства.

    Мы оцениваем производительность модели SSL по сравнению с традиционными классификаторами, такими как Random Forest (RF), Support Vector Machines (SVM), а также методами обучения с учителем, используя набор данных конкурса ECODSE, который включает как размеченные, так и неразмеченные образцы видов деревьев на биологической станции Ordway-Swisher во Флориде. Метод SSL показал значительно более высокую эффективность по сравнению с традиционными методами, продемонстрировав точность 97,5% по сравнению с 95,56% для Semi-SSL и 95,03% для CNN при обучении с учителем.

    Эксперименты по выборке показали, что техника SSL остается эффективной при меньшем количестве размеченных данных, и модель достигает хорошей точности даже при наличии всего 20% размеченных образцов. Этот вывод демонстрирует практическое применение SSL в условиях недостаточного объема размеченных данных, таких как мониторинг лесов в больших масштабах.

    Shaheen L., Rasheed B., Mazzara M.
    Tree species detection using hyperspectral and Lidar data: A novel self-supervised learning approach
    Computer Research and Modeling, 2024, v. 16, no. 7, pp. 1747-1763

    Accurate tree identification is essential for ecological monitoring, biodiversity assessment, and forest management. Traditional manual survey methods are labor-intensive and ineffective over large areas. Advances in remote sensing technologies including lidar and hyperspectral imaging improve automated, exact detection in many fields.

    Nevertheless, these technologies typically require extensive labeled data and manual feature engineering, which restrict scalability. This research proposes a new method of Self-Supervised Learning (SSL) with the SimCLR framework to enhance the classification of tree species using unlabelled data. SSL model automatically discovers strong features by merging the spectral data from hyperspectral data with the structural data from LiDAR, eliminating the need for manual intervention.

    We evaluate the performance of the SSL model against traditional classifiers, including Random Forest (RF), Support Vector Machines (SVM), and Supervised Learning methods, using a dataset from the ECODSE competition, which comprises both labeled and unlabeled samples of tree species in Florida’s Ordway-Swisher Biological Station. The SSL method has been demonstrated to be significantly more effective than traditional methods, with a validation accuracy of 97.5% compared to 95.56% for Semi-SSL and 95.03% for CNN in Supervised Learning.

    Subsampling experiments showed that the SSL technique is still effective with less labeled data, with the model achieving good accuracy even with only 20% labeled data points. This conclusion demonstrates SSL’s practical applications in circumstances with insufficient labeled data, such as large-scale forest monitoring.

Страницы: предыдущая

Журнал индексируется в Scopus

Полнотекстовая версия журнала доступна также на сайте научной электронной библиотеки eLIBRARY.RU

Журнал включен в базу данных Russian Science Citation Index (RSCI) на платформе Web of Science

Международная Междисциплинарная Конференция "Математика. Компьютер. Образование"

Международная Междисциплинарная Конференция МАТЕМАТИКА. КОМПЬЮТЕР. ОБРАЗОВАНИЕ.