레이블미

LabelMe

라벨미(LabelMe)는 MIT 컴퓨터과학인공지능연구소(CSAIL)가 만든 프로젝트로 디지털 이미지 데이터셋에 주석을 달아 제공한다.데이터 세트는 역동적이고, 자유롭게 사용할 수 있으며, 공공 기부에 개방되어 있다.LabelMe의 가장 적용 가능한 용도는 컴퓨터 비전 연구에 있다.2010년 10월 31일 현재 LabelMe는 187,240개의 영상, 62,197개의 주석 처리된 영상, 658,992개의 라벨 부착 객체를 가지고 있다.

동기

LabelMe를 만든 동기는 컴퓨터 비전 연구자들이 공개적으로 이용할 수 있는 데이터의 역사에서 비롯된다.이용 가능한 대부분의 데이터는 특정 연구그룹의 문제에 맞춘 것이었고, 새로운 연구자들이 자신의 문제를 해결하기 위해 추가 데이터를 수집해야 하는 원인이 되었다.LabelMe는 이용 가능한 데이터의 몇 가지 일반적인 단점을 해결하기 위해 만들어졌다.다음은 이전 작품과 LabelMe를 구분하는 품질 목록이다.

  • 객체의 단일 인스턴스(instance) 대신 객체 클래스를 인식하도록 설계.예를 들어, 전통적인 데이터 집합은 각각 동일한 크기와 방향을 가진 개의 이미지를 포함할 수 있다.이와는 대조적으로 LabelMe는 다각, 크기, 방향의 개의 이미지를 포함하고 있다.
  • 단일 객체를 표시하기 위해 잘라내거나 정규화하거나 크기를 조정하는 이미지 대신 임의 장면에 포함된 객체를 인식하도록 설계됨.
  • 복잡한 주석:LabelMe는 전체 이미지에 레이블을 붙이는 대신(각 이미지를 단일 개체를 포함하도록 제한함) 객체를 포함하는 다각형 경계 상자를 지정하여 이미지 내의 여러 객체에 대한 주석을 허용한다.
  • 객체 클래스가 다수 포함되어 있으며 새로운 클래스를 쉽게 만들 수 있다.
  • 다양한 이미지: LabelMe에는 다양한 장면의 이미지가 포함되어 있다.
  • 비복사권 이미지 제공 및 주석 공개 추가 허용이것은 자유로운 환경을 조성한다.

주석 도구

LabelMe 주석 도구는 사용자가 프로젝트에 기여할 수 있는 수단을 제공한다.도구는 익명으로 또는 무료 계정에 로그인하여 액세스할 수 있다.도구에 액세스하려면 사용자는 JavaScript 지원 기능이 있는 호환 가능한 웹 브라우저가 있어야 한다.도구가 로드되면 LabelMe 데이터 집합에서 임의의 이미지를 선택하여 화면에 표시한다.이미 영상과 연결된 개체 레이블이 있는 경우 영상 위에 폴리곤 형식으로 겹쳐진다.각각의 구별되는 객체 라벨은 다른 색으로 표시된다.

영상에 라벨이 완전히 붙어 있지 않은 경우 사용자는 마우스를 사용하여 영상에 물체가 포함된 다각형을 그릴 수 있다.예를 들어, 인접한 이미지에서 사람이 건물 앞에 서 있는 경우 사용자는 사람의 테두리에 있는 점을 클릭할 수 있으며, 시작점으로 돌아갈 때까지 외부 가장자리를 따라 계속 클릭할 수 있다.다각형이 닫히면 화면에 버블이 나타나 사용자가 개체의 레이블을 입력할 수 있다.사용자는 사용자가 객체를 가장 잘 설명한다고 생각하는 어떤 라벨이든 선택할 수 있다.사용자가 이미지의 이전 라벨링에 동의하지 않는 경우, 사용자는 개체의 윤곽선 다각형을 클릭하고 폴리곤을 완전히 삭제하거나 텍스트 라벨을 편집하여 새 이름을 지정할 수 있다.

사용자가 이미지를 변경하면 바로 저장되며 누구나 LabelMe 데이터 세트에서 다운로드할 수 있다.이러한 방식으로 도구를 사용하는 사용자 커뮤니티의 기여로 인해 데이터는 항상 변경된다.사용자가 이미지로 작업을 마치면 Show me another image 링크를 클릭할 수 있으며 다른 임의의 이미지를 선택하여 사용자에게 표시할 수 있다.

데이터 문제

LabelMe 데이터 집합에는 몇 가지 문제가 있다.이미지 내의 개체가 크기 및 이미지 위치와 관련하여 균일하게 분포되지 않는 것과 같은 일부는 데이터에 내재되어 있다.이는 한 장면의 흥미로운 물체에 카메라를 집중시키는 경향이 있는 사람들이 주로 찍은 이미지 때문이다.그러나 영상을 임의로 자르고 다시 정렬하면 균일한 분포를 시뮬레이션할 수 있다.[1]다른 문제는 주석 도구의 사용자에게 주어진 자유도에 의해 발생한다.발생하는 몇 가지 문제는 다음과 같다.

  • 사용자는 장면에서 윤곽을 그릴 객체를 선택할 수 있다.가려진 사람은 라벨을 붙여야 하는가?물체의 윤곽선을 그릴 때 물체의 가려진 부분이 포함되어야 하는가?하늘에 라벨을 붙여야 하는가?
  • 사용자는 다각형의 윤곽을 그려 물체의 모양을 직접 설명해야 한다.사람에 대한 손의 손가락의 윤곽을 세세하게 그려야 하는가?객체 윤곽선을 그릴 때 얼마나 많은 정밀도를 사용해야 하는가?
  • 사용자는 객체의 레이블로 입력할 텍스트를 선택한다.라벨은 사람, 사람 또는 보행자여야 하는가?

LabelMe를 만든 사람들은 이러한 결정을 주석자에게 맡기기로 결정했다.그 이유는 사람들이 이미지들의 자연적인 라벨링이라고 생각하는 것에 따라 이미지에 주석을 다는 경향이 있을 것이라고 믿기 때문이다.이것은 또한 데이터에 약간의 가변성을 제공하며, 이것은 연구자들이 이러한 가변성을 설명하기 위해 알고리즘을 조절하는 데 도움을 줄 수 있다.[2]

데이터 확장

WordNet 사용

LabelMe에서 제공하는 객체의 텍스트 라벨은 사용자 입력에서 나오기 때문에 (위에서 설명한 바와 같이) 사용되는 라벨에는 많은 변화가 있다.이 때문에 물체의 분석은 어려울 수 있다.예를 들어, 개의 사진은 개, 개, 사냥개, 똥 또는 동물로 분류될 수 있다.이상적으로는 데이터를 사용할 때 추상적 수준의 객체 클래스 도그는 이러한 텍스트 라벨을 모두 포함해야 한다.

워드넷(WordNet)은 구조적인 방법으로 구성된 단어들의 데이터베이스다.그것은 카테고리에 단어를 할당하거나 워드넷 언어로: 감각을 지정할 수 있다.감지 배정은 자동으로 하기 쉽지 않다.LabelMe의 저자들은 자동 감지 배정을 시도했을 때, 그것이 높은 오류 발생률을 보인다는 것을 발견했고, 그래서 그들은 대신에 단어들을 수동으로 감지하도록 할당했다.처음에는 LabelMe 프로젝트에 지속적으로 새로운 라벨이 추가되기 때문에 이것은 힘든 작업으로 보일 수 있다.오른쪽은 폴리곤의 성장을 단어의 성장(설명)과 비교한 그래프다.보시다시피 단어의 성장은 폴리곤의 지속적인 성장에 비해 작기 때문에 라벨미 팀에 의해 수동으로 최신 상태를 유지할 수 있을 정도로 쉽다.[3]

WordNet 할당이 완료되면 LabelMe 데이터베이스에서 검색하는 것이 훨씬 효과적이다.예를 들어, 동물을 찾는 것은 개, 고양이, 뱀의 사진을 불러올 수 있다.그러나 수동으로 임무가 이루어졌기 때문에, 마우스로 표시된 컴퓨터 마우스의 사진은 동물을 찾는 데 나타나지 않았다.또한, 만약 물체에 개 산책과 같은 더 복잡한 용어가 붙어 있다면, 워드넷은 여전히 개를 검색하여 이러한 물체를 결과로 돌려줄 수 있도록 허용한다.WordNet은 LabelMe 데이터베이스를 훨씬 더 유용하게 만든다.

객체-부품 계층

겹침이 허용되는 대규모 개체 데이터 집합을 갖는 것은 개체를 다른 개체의 일부로 분류하고 시도하기에 충분한 데이터를 제공한다.예를 들어, 바퀴가 할당된 라벨의 대부분은 아마도 자동차나 자전거와 같은 다른 라벨에 할당된 물체의 일부일 것이다.이를 부품 레이블이라고 한다.레이블 P가 레이블 O의 부품 레이블인지 확인하려면:[4]

  • I 은(는) 객체를 포함하는 이미지 집합을 나타냄(예: 자동차)
  • I P 은(는) 부품이 포함된 이미지 집합을 나타낸다(예: 휠).
  • O와 P 부분, , P {P 사이의 겹치는 점수는 부품 폴리곤 면적에 대한 교차 영역의 비율로 정의되도록 한다.(예: ( ) ( P) {mathrmatrm {
  • 나는 O, P⊆ 1세 P_{\mathrm{O},\mathrm{P}{\displaystyle \mathrm{나는}}\mathrm{나는}_{\mathrm{P}\subseteq}\,};β{\displaystyle \mathrm{S}_{\mathrm{O},\mathrm{P}}을이 개체와 부분 다각형 SO, P을의 이미지를 의미한다;\beta \,}이β{\displaystyle \beta\와 같이,}일부 번째 것입니다.reshold 값LabelMe의 작성자는= 0. 을(를) 사용한다.
  • The object-part score for a candidate label is where and are the number of images in and , respectively, and is a concentration parameter.LabelMe의 작성자는 = 을(를) 사용한다

이 알고리즘은 부품 물체가 외부 물체 내에 자주 포함되어 있을 때 물체의 일부를 자동으로 분류할 수 있도록 한다.

객체 깊이 순서 지정

물체가 겹치는 또 다른 예는 한 물체가 실제로 다른 물체 위에 있을 때입니다.예를 들어, 이미지에는 건물 앞에 서 있는 사람이 포함될 수 있다.사람이 건물의 일부가 아니기 때문에 위와 같은 부품 라벨이 아니다.대신 우연히 겹치는 두 개의 분리된 물체다.어떤 물체가 전경이고 어떤 것이 배경인지 자동으로 판단하기 위해 LabelMe의 저자는 다음과 같은 몇 가지 옵션을 제안한다.[5]

  • 만약 어떤 물체가 다른 물체 안에 완전히 포함되어 있다면, 내부 물체는 전경에 있어야 한다.그렇지 않으면 영상에 보이지 않을 것이다.유일한 예외는 투명하거나 반투명한 물체지만 이런 경우는 드물다.
  • 그 물체들 중 하나는 전경에 있을 수 없는 것으로 분류될 수 있었다.예로는 하늘, 땅, 길이 있다.
  • 교차 영역 내에 더 많은 다각형 점이 있는 물체는 가장 앞쪽일 가능성이 높다.저자들은 이 가설을 시험했고 매우 정확하다는 것을 발견했다.
  • 히스토그램 교차점을[6] 사용할 수 있다.이를 위해 교차 영역의 색상 히스토그램을 두 객체의 색상 히스토그램과 비교한다.더 가까운 색상 히스토그램이 있는 객체는 전경으로 지정된다.이 방법은 다각형 점을 세는 것보다 정확도가 떨어진다.

매트랩 도구 상자

LabelMe 프로젝트는 Matlab에서 LabelMe 데이터 집합을 사용하기 위한 도구 세트를 제공한다.Matlab에서는 종종 연구가 이루어지기 때문에, 이것은 컴퓨터 비전의 기존 도구와 데이터세트를 통합할 수 있게 한다.전체 데이터셋을 오프라인으로 다운로드하여 사용할 수도 있고, 툴박스를 통해 주문형 컨텐츠의 동적 다운로드가 가능하다.

참고 항목

참조

  1. ^ 러셀 외 2008, 섹션 2.5
  2. ^ 러셀 외 2008, 섹션 2.2
  3. ^ 러셀 외 2008, 섹션 3.1
  4. ^ 러셀 외 2008, 섹션 3.2
  5. ^ 러셀 외 2008, 섹션 3.3
  6. ^ 스웨인 & 발라드 1991
참고 문헌 목록
  • Russell, Bryan C.; Torralba, Antonio; Murphy, Kevin P.; Freeman, William T. (2008). "Label Me: A Database and Web-Based Tool for Image Annotation" (PDF). International Journal of Computer Vision. 77 (1–3): 157–173. doi:10.1007/s11263-007-0090-8. S2CID 1900911.
  • Swain, Michael J.; Ballard, Dana H. (1991). "Color indexing". International Journal of Computer Vision. 7: 11–32. doi:10.1007/BF00130487. S2CID 8167136.

외부 링크