전체 글 68

PEFT, LORA

캡스톤디자인 경진대회 3주 전, 올해 가장 중요하다고 생각되는 행사에서 후회없이 가장 좋은 성과를 맞이하기 위해 여름에 열심히 캡디를 하고 있다. 기존에 했던 프로젝트 방향에서는 novelty가 전혀 없고 그저 밖에서 구현되어 있는 라이브러리 가져다가 실험해보고 구현한 수준이라, llm, 컴퓨터 비전, Ros(px4)가 연동된 프로젝트에서 어떻게 하면 연구하는 단까지 발전할 수 있을까 계속 고민하던 중 로컬 LLM을 직접 파인튜닝시켜보자라는 결론이 나게 되었다. 머신러닝, 딥러닝 관련 수업은 수강했지만 자연어 관련해서 딥하게 공부해본 적은 없기에 빠르게 관련 개념을 습득하고 캡디에서 필요한 실험 설계, 과정에서 오류 없이 진행해보도록 하자. 결국 qwen 3.5(4B)를 파인튜닝하려고 하다보니, 클로드..

카테고리 없음 2026.08.07

ROS : # 3 (ROS : Action, launch)

0. ROS의 주요 3요소 토픽은 연속적인 데이터를 수신하는 과정. service는 무언가 수신(request)하면 response하는 구조.서비스랑 유사한데, 큰 차이가 있다면 용도 면에서는 서비스는 짧은 시간 안에 response를 보낼 수 있었음. Action 같은 경우 뭔가 요청했을 때 그거에 대한 실행 결과가 시간에 꽤 걸리는 것들임. 1. ROS Action 위의 영상에서 client는 goal service response에 따라서 result service request를 보내고, action server가 이를 다시 result service response로 보내는 과정이다. Action의 사용 목적 자체가 시간이 오래 걸리는 작업이라는 것을 명심하자. (아래 사진의 cancel ..

#1. Behavior Tree

작년에 학연생으로 있을 때, 지도교수님이 Behavior Tree를 중심적으로 연구를 진행하는 것을 옆에서 계속 보고 있었다. tree 구조를 가지고 있어 if else문으로 판단을 나무가지처럼 갈래별로 결정되기 때문에, 직관적으로 어떻게 그런 의사결정을 내렸는지 이해하기 쉽다는 강점을 가지고 있다. 올해 캡스톤에서 'BT 기반 VLN(Vision-Language Navigation)을 적용한 UAV 자율비행 제어'를 하고 싶기 때문에, BT에 대한 기초적인 공부부터 심도있게 계속 공부해 볼 것이다. 1. Basic Concept요즘 BT는 활용도가 점점 늘고 있다.기본적으로 BT는 directed tree(방향성이 있는 트리)이며 노드로 이루어져 있다.root : 뿌리라는 이름답게, '시작점'을 의미..

ROS : # 1, 2 (ros2 개념, topic, service)

여기에서는 2학년 '로봇 프로그래밍' 수업을 대상으로 학습한다.추가로 내가 학습한 예제들이나 공부하면서 헷갈리는 내용을 정리하며 제대로 공부해보는 것에 의의가 있다. 1. 우분투와 ros의 차이지금 나는 우분투 설치와 각종 프로그램 설치만 해봤지, 우분투가 무엇이고 ros가 무엇인지에 대해 잘 알지 못한다. 일단 그 개념부터 적어본다. 쉽게 비유를 하자면, 우분투는 '윈도우'이고 ROS는 '엑셀' 같은 프로그램 도구이다. 강의 영상에서도 언급되었듯이, ROS의 이름이 Robot Operating System이라서 마치 윈도우나 우분투 같은 진짜 운영체제라고 오해할 수 있지만 ROS는 운영체제가 아니라, 운영체제 위에서 돌아가는 미들웨어이다. [프로그래밍] 미들웨어(Middleware)란?미들웨어(..

[강화학습] Soft Actor-Critic

1줄 요약: Actor Critic + Off policy + Soft policy improvement w.r.t entropy = SOTA [강화학습] Soft Actor-Critic 논문 리뷰재야의 숨은 고수가 되고 싶은 초심자hiddenbeginner.github.io위의 논문 리뷰글을 보고 공부해보았습니다 SAC가 나오게 된 이유는 다음과 같다.기존 On policy 방법론들은 sample inefficient하다(수집한 데이터를 재활용하지 않으므로). -> 따라서 Off policy 방법을 사용하자!Off policy 방법론들은 하이퍼파라미터에 robust하지 않고, 훈련이 instable하다 -> 그럼 maximum entropy 방법을 사용하자!위의 내용을 이해하기 위해서는 On po..

기존 코드 분석 (1) : simple_maze_grid

기존 강화학습 수업을 들었을 때 활용했던 파일과 아예 이름이 똑같기 때문에, 기말고사 끝나고 기계관에서 고생한 것이 생각이 나 ptsd가 오는 파일 이름이다... 이미 석사 논문으로 제출된 논문 코드이기 때문에, 코드의 구조를 함부로 뒤집기보다, 어떤 파라미터가 핵심 역할을 하는지 정확히 파악하고 fine-tuning하는 방법을 선택하려고 한다. (위에는 코드를 수정하기 전 원본 파) Simple_maze_grid 코드는 Dubins Car 모델(자동차처럼 회전 반경이 있는 로봇)이 장애물을 피해 목적지까지 가는 시뮬레이터이다. 위와 같은 시뮬레이션이 등장하게 하는 코드라고 보면 된다. 어떤 정보를 보여주는지 가볍게 정리하자면, 왼쪽 (Global Map): 전체 맵, 로봇의 위치, 목적지, 장애..

논문 스터디 : Behavior Tree Capabilities for Dynamic Multi-Robot Task Allocation with Heterogeneous Robot Teams

📌 서론 (왜 이 연구를 했는가, 기존 연구와의 차별점)배경 문제:최근 로봇들이 점점 더 고도화되면서, 단일 로봇이 수행할 수 있는 능력은 커졌지만, 동시에 임무의 복잡성은 훨씬 더 빠르게 증가했습니다. 따라서 다양한 능력을 가진 **이기종 로봇 팀(heterogeneous robot teams)**을 활용하는 것이 필요해졌습니다.그러나 기존의 멀티 로봇 태스크 할당 문제(MRTAP) 연구는 대부분 동질적인 로봇 팀이나 중앙집중식 방식에 초점이 맞춰져 있었고, 동적으로 변하는 팀 구성이나 로봇의 능력 차이를 반영하지 못했습니다.기존 연구 한계:Behavior Tree(BT)는 로봇 행동을 모듈화하고 직관적으로 설계할 수 있는 도구로 주목받아 왔지만, 기존 접근은 주로 정적 할당에 의존했습니다. 즉, 팀..

Multi Agent 2025.08.29

논문 스터디 : Attention-Tunable Safety Barriers for Human-Autonomy Teaming inSpecialized Aviation Missions

https://drongdrong.tistory.com/73 논문 스터디 : Towards Safe Collaboration Between Autonomous Pilots and Human Crews for Intelligence,Surveillance, and Recon* GPT를 이용한 요약(초록, 결론을 중심으로) 이 논문은 자율 조종사(AP: Automated Pilot)와 인간 분석가가 함께 해상 정보·감시·정찰(Intelligence, Surveillance, and Reconnaissance, ISR) 임무를 수행하는 시뮬레drongdrong.tistory.com 이전에 위와 같은 논문에 대한 스터디를 진행했다. 그리고 오늘 공부할 논문은 위 논문의 후속 연구자료이다. 2025년 7월에 발행..

Multi Agent 2025.08.14

논문 스터디 : Tactical Autonomous Maneuver Testbed forMulti-Agent Air-Ground Teams

이 논문은 소형 무인항공기(QDrone)와 소형 자율지상차량(QCar)을 통합한 **다중 에이전트 공중-지상 팀용 전술 자율 기동 시험대(TAM-T)**를 소개합니다. 주요 내용은 다음과 같습니다.초록 요약Quanser Autonomous Research Studio를 기반으로, QDrone(공중)과 QCar(지상)를 결합해 다중 에이전트 환경에서 행동 모델을 실험하고 상호작용을 관찰할 수 있는 시험대를 구축.프로그래밍 언어와 저수준 자율주행 알고리즘에 종속되지 않는 구조로 설계하여, 고수준 상호작용 연구에 집중 가능.실내 환경에서는 정확한 위치 추정과 실제 데이터 수집을 위해 내부 위치 시스템과 외부 모션 캡처 카메라 모두 필요함을 확인.목표는 지상/공중 자율시스템 통합 역량을 개발하고, 향후 연구를 ..

Multi Agent 2025.08.13