1. 연구 개요

그림 1. 제안하는 프레임워크 동작 흐름
본 연구는 VLM 기반 제조 AI 에이전트 프레임워크를 통해 작업자의 의사결정과 작업 수행을 지원하는 시스템을 제안한다. 프레임워크는 요소 인지, 상황 인지, 작업 지원의 세 에이전트로 구성되며, 제조 현장의 객체 인지와 이상 판단, 그리고 지원 제공을 통합적으로 수행한다.
2. 연구 배경 및 목적
최근 LLM(Large Language Model)과 VLM(Vision Language Model)을 특정 산업 도메인에 적용하여 자동화와 지능형 에이전트 시스템을 확장하려는 연구가 활발히 진행되고 있다. 그러나 실제 제조 환경에서는 이미지 품질, 촬영 각도 등 환경 변화로 인해 객체 미탐지가 발생하고, 현재 상황을 부정확하게 이해해 작업자에게 적절한 지원을 제공하지 못하는 한계가 있다. 이에 본 연구는 제조 현장에서 객체 미탐지를 보완하고 작업 상황을 정확히 이해하여, 작업자에게 필요한 정보를 능동적으로 제공하는 VLM 기반 제조 AI 에이전트 프레임워크를 목표로 한다.
3. 제안 방법

제안 프레임워크는 세 개의 에이전트로 구성된다. 요소 인지 에이전트는 환경 인지 카메라 입력을 바탕으로 객체 탐지 모델과 객체 탐지 VLM을 함께 활용해 필요한 도구나 부품을 인식하고, 기존 탐지기의 미탐지 문제를 보완한다. 상황 인지 에이전트는 작업자의 1인칭 시점 영상과 적절한 프롬프트를 이용해 현재 작업 단계와 이상 여부를 판단하고, 오류 원인을 분석한다. 작업 지원 에이전트는 앞선 두 에이전트의 결과를 통합하여 증강현실 기반 객체 위치 안내, 이상 수정 정보 제공 등 작업자 맞춤형 지원을 수행한다.
4. 실험 결과




대표이사: 정현 / 사업자등록번호: 220-82-60063
Copyright© 2023. Society for Computational Design and Engineering. All rights