Напівавтоматизована система відеомовного телеоперування маніпуляторами Viper X
| dc.contributor.advisor | Безуглий, М. О. | |
| dc.contributor.author | Кліменко, Ігор Євгенович | |
| dc.date.accessioned | 2026-08-19T09:24:31Z | |
| dc.date.available | 2026-08-19T09:24:31Z | |
| dc.date.issued | 2026 | |
| dc.description.abstract | Пояснювальна записка: 73 с., 13 рис., 9 табл., 28 джерел. Об’єктом дослідження є процес напівавтоматизованого телеоперування багатоступеневими роботизованими маніпуляторами, за якого оператор керує системою високої розмірності через низькорозмірний інтерфейс. Предметом дослідження є методи та засоби індукування задача-обумовленого лінійного керуючого відображення на основі представлень, що породжуються попередньо навченою генералістичною політикою. Мета роботи полягає в розробленні напівавтоматизованої системи відеомовного телеоперування маніпуляторами ViperX, у якій керуюче відображення «оператор → робот» формується одноразово під час ініціалізації з початкових мультимодальних спостережень, а подальше керування здійснюється без постійного перепрогнозування дій. У роботі запропоновано формулювання, за якого замість безперервного передбачення дій система оцінює задача-обумовлену коваріацію передбачених дій генералістичної політики й через спектральну структуру цієї коваріації неявно задає геометрію та підсилення відображення користувацького входу в дії робота. Виконано спектральний аналіз збурень регуляризованої матриці Грама, що пов’язує розділеність спектра з часовою стабільністю та згладженістю керування. Запропонований підхід реалізовано шляхом донавчання генералістичної моделі Octo на симуляційних даних aloha_sim для горизонтів дій 1, 5 та 15 кроків; виразність і робастність індукованих відображень оцінено методом детермінованої лінійної реконструкції. Отримані результати свідчать, що проміжний горизонт навчання (5 кроків) забезпечує найкращу крос-горизонтну генералізацію, а індукована структура керування достатньо покриває многовид експертних дій: у найкращому випадку похибка реконструкції становить MSE = 0,113 для відображення з простору входу у простір дій . Це дозволяє припустити, що представлення генералістичних політик можуть бути ефективно повторно використані для побудови стабільних низькорозмірних інтерфейсів телеоперування без задача-специфічного навчання прогнозу дій. Практична цінність роботи полягає у застосовності запропонованого підходу до асистивної робототехніки та дистанційного керування, де зниження когнітивного навантаження оператора й повторне використання відкритих генералістичних моделей мають безпосередній прикладний ефект. | |
| dc.description.abstractother | Explanatory note: 73 p., 13 fig., 9 tab., 28 references. The object of study is the process of semi-automated teleoperation of high–degree-of-freedom robotic manipulators, in which an operator controls a high-dimensional system through a low-dimensional interface. The subject of study is the methods and means of inducing a task-conditioned linear control mapping from the representations produced by a pretrained generalist policy. The aim of the work is to design a video-language teleoperation system for ViperX manipulators in which the operator-to-robot control mapping is established once at initialization from initial multimodal observations, with subsequent control performed without continuous action re-prediction. The work proposes a formulation in which, instead of continuously predicting actions, the system estimates a task-conditioned covariance of the generalist policy’s predicted actions and, through the spectral structure of this covariance, implicitly defines the geometry and gains of the mapping from user 3 input to robot actions. A spectral perturbation analysis of the regularized Gram matrix is carried out, relating spectral separation to the temporal stability and smoothness of control. The approach is implemented by fine-tuning the Octo generalist policy on the simulated aloha_sim dataset for action horizons of 1, 5, and 15 steps; the expressiveness and robustness of the induced mappings are assessed via deterministic linear reconstruction. The results indicate that an intermediate training horizon (5 steps) yields the best cross-horizon generalization and that the induced control structure adequately covers the expert action manifold: in the best case, the reconstruction error is MSE = 0.113 for a mapping from the input space to the action space . This suggests that generalist-policy representations can be effectively repurposed to build stable low-dimensional teleoperation interfaces without task-specific action supervision. | |
| dc.format.extent | 74 с. | |
| dc.identifier.citation | Кліменко, І. Є. Напівавтоматизована система відеомовного телеоперування маніпуляторами Viper X : дипломна робота … бакалавра : 151 Автоматизація та комп'ютерно-інтегровані технології / Кліменко Ігор Євгенович. – Київ, 2026. – 74 с. | |
| dc.identifier.uri | https://ela.kpi.ua/handle/123456789/82592 | |
| dc.language.iso | uk | |
| dc.publisher | КПІ ім. Ігоря Сікорського | |
| dc.publisher.place | Київ | |
| dc.subject | телеоперування | |
| dc.subject | генералістична політика | |
| dc.subject | коваріаційне відображення | |
| dc.subject | спектральний аналіз | |
| dc.subject | зворотний зв’язок | |
| dc.subject | візуально-мовні моделі | |
| dc.subject | viperx | |
| dc.subject | aloha | |
| dc.subject | octo | |
| dc.subject | асистивна робототехніка | |
| dc.subject | teleoperation | |
| dc.subject | generalist policy | |
| dc.subject | covariance mapping | |
| dc.subject | spectral analysis | |
| dc.subject | feedback | |
| dc.subject | vision-language models | |
| dc.subject | assistive robotics | |
| dc.title | Напівавтоматизована система відеомовного телеоперування маніпуляторами Viper X | |
| dc.type | Bachelor Thesis |
Файли
Контейнер файлів
1 - 1 з 1
Вантажиться...
- Назва:
- Klimenko_bakalavr.pdf
- Розмір:
- 3.84 MB
- Формат:
- Adobe Portable Document Format
Ліцензійна угода
1 - 1 з 1
Ескіз недоступний
- Назва:
- license.txt
- Розмір:
- 8.98 KB
- Формат:
- Item-specific license agreed upon to submission
- Опис: