Pegasus 1.6 by TwelveLabs — Transforms egocentric video into robot training data
TwelveLabs Pegasus 1.6 — 1인칭 영상을 로봇 학습 데이터로 변환
TwelveLabs의 Pegasus 1.6은 웨어러블 카메라나 로봇에서 촬영한 1인칭 영상을 분석해 시간 정보가 담긴 작업 라벨과 메타데이터를 생성합니다. 로봇 팀은 수작업 라벨링을 줄이고 영상 데이터를 학습 파이프라인에 활용할 수 있습니다.
- 주제
AI 요약
TwelveLabs가 로봇과 Physical AI 팀을 위한 영상 이해 모델 Pegasus 1.6을 공개했습니다. 사람이나 로봇 시점에서 촬영한 원격 조작 영상과 웨어러블 영상을 분석해 라벨과 타임스탬프가 포함된 데이터를 생성합니다. 회사는 수작업 라벨링 과정 없이 결과를 학습 파이프라인에 넣을 수 있다고 설명합니다.
1인칭 영상 분석
Pegasus 1.6은 Pegasus 1.5의 Time-Based Metadata(TBM)를 확장해 1인칭 영상과 작업 내레이션을 지원합니다. TBM은 사용자가 정한 스키마에 따라 타임스탬프가 포함된 구조화 메타데이터를 추출합니다. 이번 버전에서는 손·도구·물체 사이의 상호작용 인식과 세부 메타데이터 추출 성능을 개선하고, 영상 속 단서를 바탕으로 등장 개체의 이름을 식별하는 grounded entity recognition도 강화했다고 합니다. 대량 영상 처리 속도도 높였습니다.
공동창업자 겸 CTO인 Aiden Lee는 로봇 팀이 작업 라벨링과 다음 행동 예측에 쓸 수 있는 1인칭 영상을 많이 보유하지만, 범용 영상 모델은 방송이나 제3자 시점 영상에 주로 맞춰져 있다고 설명합니다. Pegasus 1.6은 원본 영상에서 작업 라벨, 규정 준수 평가, 타임스탬프를 생성합니다. Lee는 수작업 라벨링 비용이 영상 한 시간당 4~22달러라고 덧붙였습니다.
Product Hunt 반응
- @aiden_lee7 — 안녕하세요. TwelveLabs 공동창업자 겸 CTO Aiden입니다. 오늘 Pegasus 1.6을 소개하게 되어 기쁩니다. 저희가 만나는 로봇 및 Physical AI 팀은 모두 같은 문제를 겪습니다. 행동 라벨링과 다음 행동 예측의 원재료가 되는 1인칭 영상이 몇 시간씩 쌓여 있지만, 그 영상을 이해하도록 만든 기반 모델이 없습니다. 범용 영상 모델은 방송 영상과 제3자 시점 영상으로 학습합니다. 웨어러블 카메라나 로봇 자체 카메라로 촬영한 영상을 넣으면 실제로 무슨 일이 일어나는지 놓칩니다. Pegasus 1.6은 이 문제에 대한 저희의 답입니다. TwelveLabs가 1인칭 영상 이해를 위해 만든 첫 모델입니다. Pegasus 1.6은 사용자 정의 스키마에서 타임스탬프가 포함된 구조화 메타데이터를 추출하는 Pegasus 1.5의 Time-Based Metadata(TBM)를 확장해 1인칭 영상과 작업 내레이션을 지원합니다. 손·도구·물체 상호작용을 더 세밀하게 인식하고 대량 영상 처리 속도도 높였습니다. 1.5의 기능에 더해 상세 메타데이터 추출과 grounded entity recognition, 즉 영상 속 단서를 바탕으로 등장인물의 이름을 식별하는 성능도 개선했습니다. 로봇 및 데이터 팀은 원본 1인칭 영상을 넣고 구조화된 작업 라벨, 규정 준수 평가, 타임스탬프를 받아 학습 파이프라인에 바로 쓸 수 있습니다. 영상 한 시간당 4~22달러가 드는 수작업 라벨링 과정도 거치지 않아도 됩니다. Physical AI는 저희에게 새로운 분야입니다. 사람이나 원격 조작 장비의 1인칭 데이터를 다루다가 예외 상황을 만나면 알려주세요. 감사합니다.
- @fmerian — 이번 출시를 축하합니다. 계속 좋은 성과 내세요.
- @cloudalchemist — 정말 흥미롭네요. 기존 상용 모델에 얼마나 의존하나요, 아니면 자체적으로 충분히 작동하나요?
- @fmerian — @c3lim 및 @TwelveLabs 팀과 이번 출시를 함께 준비해 즐거웠습니다. Pegasus 1.5는 6개월 전에 출시됐고, 자동으로 안정적인 구간 분할, 긴 영상 지원, 최첨단 성능을 제공했습니다. Pegasus 1.6은 1인칭 영상 지원과 더 빠른 처리를 추가해 로봇 및 Physical AI 팀에 새로운 기회를 열어줍니다. 커뮤니티에서 1.5를 좋아해 주셨고 오늘의 제품으로 선정돼 일일 뉴스레터에도 소개됐습니다. 1.6도 마음에 드시길 바랍니다. 다음 출시 소식을 보려면 @TwelveLabs를 팔로우하세요. 곧 소식이 있습니다.
- @hamza_afzal_butt — 1인칭 영상이 로봇 학습의 주요 데이터 원천 가운데 하나가 될 수 있다고 보시나요? @aiden_lee7과 팀의 출시를 축하합니다. 제품을 발굴해 준 @fmerian에게도 감사합니다.
- @fmerian — 계속 응원해 주셔서 감사합니다!
- @tl_yashgugale — @aiden_lee7, @fmerian, @hamza_afzal_butt 네, 확실합니다. 이 분야에서 가장 큰 반응을 얻는 영역이며, 저희 모델은 품질과 규모 면에서 이 흐름을 이끌도록 특별히 만들었습니다.
- @german_merlo1 — 정말 인상적입니다. 다음은 무엇인가요? 1.7 로드맵이 궁금합니다. 다음 출시도 기대하겠습니다.
- @fmerian — 제품을 만든 분들께 감사드립니다. 다음 출시 소식을 받으려면 @TwelveLabs를 팔로우하세요.
- @anilpai — Bedrock에서 호스팅할 계획이 있나요?
- @mufassir_kazi — ElevenLabs와 이름이 비슷해서 TwelveLabs를 알게 됐는데, 이렇게 성숙하고 멋진 제품으로 성장하는 모습을 보니 좋습니다.
원문: Product Hunt / 번역·요약: Trawling