Напівавтоматизована система відеомовного телеоперування маніпуляторами Viper X

dc.contributor.advisorБезуглий, М. О.
dc.contributor.authorКліменко, Ігор Євгенович
dc.date.accessioned2026-08-19T09:24:31Z
dc.date.available2026-08-19T09:24:31Z
dc.date.issued2026
dc.description.abstractПояснювальна записка: 73 с., 13 рис., 9 табл., 28 джерел. Об’єктом дослідження є процес напівавтоматизованого телеоперування багатоступеневими роботизованими маніпуляторами, за якого оператор керує системою високої розмірності через низькорозмірний інтерфейс. Предметом дослідження є методи та засоби індукування задача-обумовленого лінійного керуючого відображення на основі представлень, що породжуються попередньо навченою генералістичною політикою. Мета роботи полягає в розробленні напівавтоматизованої системи відеомовного телеоперування маніпуляторами ViperX, у якій керуюче відображення «оператор → робот» формується одноразово під час ініціалізації з початкових мультимодальних спостережень, а подальше керування здійснюється без постійного перепрогнозування дій. У роботі запропоновано формулювання, за якого замість безперервного передбачення дій система оцінює задача-обумовлену коваріацію передбачених дій генералістичної політики й через спектральну структуру цієї коваріації неявно задає геометрію та підсилення відображення користувацького входу в дії робота. Виконано спектральний аналіз збурень регуляризованої матриці Грама, що пов’язує розділеність спектра з часовою стабільністю та згладженістю керування. Запропонований підхід реалізовано шляхом донавчання генералістичної моделі Octo на симуляційних даних aloha_sim для горизонтів дій 1, 5 та 15 кроків; виразність і робастність індукованих відображень оцінено методом детермінованої лінійної реконструкції. Отримані результати свідчать, що проміжний горизонт навчання (5 кроків) забезпечує найкращу крос-горизонтну генералізацію, а індукована структура керування достатньо покриває многовид експертних дій: у найкращому випадку похибка реконструкції становить MSE = 0,113 для відображення з простору входу у простір дій . Це дозволяє припустити, що представлення генералістичних політик можуть бути ефективно повторно використані для побудови стабільних низькорозмірних інтерфейсів телеоперування без задача-специфічного навчання прогнозу дій. Практична цінність роботи полягає у застосовності запропонованого підходу до асистивної робототехніки та дистанційного керування, де зниження когнітивного навантаження оператора й повторне використання відкритих генералістичних моделей мають безпосередній прикладний ефект.
dc.description.abstractotherExplanatory note: 73 p., 13 fig., 9 tab., 28 references. The object of study is the process of semi-automated teleoperation of high–degree-of-freedom robotic manipulators, in which an operator controls a high-dimensional system through a low-dimensional interface. The subject of study is the methods and means of inducing a task-conditioned linear control mapping from the representations produced by a pretrained generalist policy. The aim of the work is to design a video-language teleoperation system for ViperX manipulators in which the operator-to-robot control mapping is established once at initialization from initial multimodal observations, with subsequent control performed without continuous action re-prediction. The work proposes a formulation in which, instead of continuously predicting actions, the system estimates a task-conditioned covariance of the generalist policy’s predicted actions and, through the spectral structure of this covariance, implicitly defines the geometry and gains of the mapping from user 3 input to robot actions. A spectral perturbation analysis of the regularized Gram matrix is carried out, relating spectral separation to the temporal stability and smoothness of control. The approach is implemented by fine-tuning the Octo generalist policy on the simulated aloha_sim dataset for action horizons of 1, 5, and 15 steps; the expressiveness and robustness of the induced mappings are assessed via deterministic linear reconstruction. The results indicate that an intermediate training horizon (5 steps) yields the best cross-horizon generalization and that the induced control structure adequately covers the expert action manifold: in the best case, the reconstruction error is MSE = 0.113 for a mapping from the input space to the action space . This suggests that generalist-policy representations can be effectively repurposed to build stable low-dimensional teleoperation interfaces without task-specific action supervision.
dc.format.extent74 с.
dc.identifier.citationКліменко, І. Є. Напівавтоматизована система відеомовного телеоперування маніпуляторами Viper X : дипломна робота … бакалавра : 151 Автоматизація та комп'ютерно-інтегровані технології / Кліменко Ігор Євгенович. – Київ, 2026. – 74 с.
dc.identifier.urihttps://ela.kpi.ua/handle/123456789/82592
dc.language.isouk
dc.publisherКПІ ім. Ігоря Сікорського
dc.publisher.placeКиїв
dc.subjectтелеоперування
dc.subjectгенералістична політика
dc.subjectковаріаційне відображення
dc.subjectспектральний аналіз
dc.subjectзворотний зв’язок
dc.subjectвізуально-мовні моделі
dc.subjectviperx
dc.subjectaloha
dc.subjectocto
dc.subjectасистивна робототехніка
dc.subjectteleoperation
dc.subjectgeneralist policy
dc.subjectcovariance mapping
dc.subjectspectral analysis
dc.subjectfeedback
dc.subjectvision-language models
dc.subjectassistive robotics
dc.titleНапівавтоматизована система відеомовного телеоперування маніпуляторами Viper X
dc.typeBachelor Thesis

Файли

Контейнер файлів
Зараз показуємо 1 - 1 з 1
Вантажиться...
Ескіз
Назва:
Klimenko_bakalavr.pdf
Розмір:
3.84 MB
Формат:
Adobe Portable Document Format
Ліцензійна угода
Зараз показуємо 1 - 1 з 1
Ескіз недоступний
Назва:
license.txt
Розмір:
8.98 KB
Формат:
Item-specific license agreed upon to submission
Опис: