지난호 보기
2026 동계학술대회 수상자 리뷰

작업지원을 위한 VLM 기반 제조 AI 에이전트 프레임워크

글 : 임석준, 이재열 (전남대학교) / elex0104@naver.com

조회수72

1. 연구 개요

그림 1. 제안하는 프레임워크 동작 흐름


본 연구는 VLM 기반 제조 AI 에이전트 프레임워크를 통해 작업자의 의사결정과 작업 수행을 지원하는 시스템을 제안한다. 프레임워크는 요소 인지, 상황 인지, 작업 지원의 세 에이전트로 구성되며, 제조 현장의 객체 인지와 이상 판단, 그리고 지원 제공을 통합적으로 수행한다.


2. 연구 배경 및 목적

최근 LLM(Large Language Model)과 VLM(Vision Language Model)을 특정 산업 도메인에 적용하여 자동화와 지능형 에이전트 시스템을 확장하려는 연구가 활발히 진행되고 있다. 그러나 실제 제조 환경에서는 이미지 품질, 촬영 각도 등 환경 변화로 인해 객체 미탐지가 발생하고, 현재 상황을 부정확하게 이해해 작업자에게 적절한 지원을 제공하지 못하는 한계가 있다. 이에 본 연구는 제조 현장에서 객체 미탐지를 보완하고 작업 상황을 정확히 이해하여, 작업자에게 필요한 정보를 능동적으로 제공하는 VLM 기반 제조 AI 에이전트 프레임워크를 목표로 한다.


3. 제안 방법

그림 2. 제안하는 프레임워크 실행 결과


제안 프레임워크는 세 개의 에이전트로 구성된다. 요소 인지 에이전트는 환경 인지 카메라 입력을 바탕으로 객체 탐지 모델과 객체 탐지 VLM을 함께 활용해 필요한 도구나 부품을 인식하고, 기존 탐지기의 미탐지 문제를 보완한다. 상황 인지 에이전트는 작업자의 1인칭 시점 영상과 적절한 프롬프트를 이용해 현재 작업 단계와 이상 여부를 판단하고, 오류 원인을 분석한다. 작업 지원 에이전트는 앞선 두 에이전트의 결과를 통합하여 증강현실 기반 객체 위치 안내, 이상 수정 정보 제공 등 작업자 맞춤형 지원을 수행한다.


4. 실험 결과

그림 3. 요소 인지 에이전트 탐지 결과

요소 인지 에이전트의 평가 결과, YOLO만 사용할 때 발생하던 미탐지 객체를 객체 탐지 VLM이 추가로 탐지함으로써 인지 성능을 개선하였다. 그 결과 전체 탐지 성능은 mAP@50-95 기준 0.7235에서 0.9116으로 향상되었으며, 이는 약 26%의 성능 향상에 해당한다. 

그림 4. 상황 인지 에이전트 분류 및 원인 분석 결과

또한 상황 인지 에이전트는 부품 대체나 조립 이상 상황을 적절한 프롬프트를 통해 정확히 판별했으며, 미세한 변형까지 이상으로 분류하고 그 원인도 분석할 수 있음을 확인하였다. 

그림 5. 작업지원 에이전트 시각화 및 수정 방법 제시 결과

작업 지원 에이전트는 이러한 분석 결과를 바탕으로 필요한 객체 위치를 시각화하고 이상 수정 방법을 제시하여 작업 지원 가능성을 보였다.

5. 결론 및 향후 연구 방향
본 연구는 제조 환경에서 발생하는 객체 미탐지와 상황 이해 부족 문제를 해결하기 위해 VLM 기반 제조 AI 에이전트 프레임워크를 제안하였다. 요소 인지 에이전트는 미탐지 객체를 보완적으로 탐지했고, 상황 인지 에이전트는 조립 과정에서 발생하는 오류를 인지했으며, 작업 지원 에이전트는 이를 바탕으로 작업자에게 실질적인 지원을 제공하였다. 향후에는 작업 지원과 이상 감지 기능을 더욱 고도화하고, 협동 로봇의 움직임 코드 생성 기능 등을 추가하여 인간-로봇 협업 환경으로 확장하고자 한다.

사단법인 한국CDE학회(구 한국CAD/CAM학회)
(06130) 서울시 강남구 테헤란로7길 22, 한국과학기술회관 1관 909호 | Tel: 02-501-6862 | Fax: 02-501-6863 | E-mail: info@cde.or.kr

대표이사: 정현 / 사업자등록번호: 220-82-60063

Copyright© 2023. Society for Computational Design and Engineering. All rights