Hugging Face

apple/LensVLM-9B

Apple LensVLM-9B — 압축 문서에서 필요한 페이지만 확장하는 비전 언어 모델

Apple이 9B 규모의 비전 언어 모델 LensVLM을 공개했습니다. 압축된 텍스트 이미지에서 필요한 페이지만 골라 원래 해상도로 확장하며, 5x·10x·15x 압축 옵션을 제공합니다.

AI 요약

Apple의 LensVLM은 압축된 텍스트 이미지 전체를 무조건 원래 크기로 복원하는 대신, 학습된 도구를 사용해 관련 페이지를 선택적으로 확장하는 9B 규모 비전 언어 모델(VLM)입니다.

실행 방법

코드를 복제한 뒤 requirements.txt에 명시된 패키지를 설치하고 scripts/run_demo.py를 실행합니다. 사용자 문서는 demo.py에 텍스트 파일과 질문을 지정해 처리하며, 압축률은 5x·10x·15x 가운데 선택합니다. 데이터 준비와 평가는 저장소 README에서 안내합니다.

코드와 라이선스

모델 파일과 Qwen 모델에 적용한 Apple의 수정 사항은 Apple Machine Learning Research Model License를 따릅니다. 동봉된 소스 코드는 별도로 배포하며 Apple Sample Code License를 적용합니다. 관련 논문 제목은 *LensVLM: Selective Context Expansion for Compressed Visual Representation of Text*입니다.

원문: Hugging Face / 번역·요약: Trawling