안녕하세요 재윤님 리뷰 잘 읽었습니다. 재윤님이 생각하신대로 ant-gpt 같은 대규모 foundation 모델대비 적은 파라미터수를 가지는 모델로 open vocab 세팅에서 더…
안녕하세요 성준님, 좋은 리뷰 감사합니다. table 2를 통해 visual 정보를 가지고 직접 prediction했을때보다 action label을 뽑아서 LLM에 입력하는 것이 더…
안녕하세요 인택님 좋은 리뷰 감사합니다. 1. Stage 1에서는 answer가 image를 직접 못 보도록 막는다고 했는데, inference 때도 이 bottleneck mask를…
안녕하세요 찬미님 좋은 리뷰 감사합니다. 1. Multimodal RAG라고 했는데, 실제로 retrieval되는 context 자체에도 이미지가 포함되는 건가요? 아니면 query를 만들 때만…
안녕하세요 인택님, 좋은 리뷰 감사합니다. 학습을 2stage로 진행한다고 설명해주셨는데, stage 1에서 visual bottlenecking으로 학습시켰다가 stage2에서 이미지+latent를 같이보게 만들면 다시 모델이…
안녕하세요 재윤님 리뷰 잘 읽었습니다. 재윤님이 생각하신대로 ant-gpt 같은 대규모 foundation 모델대비 적은 파라미터수를 가지는 모델로 open vocab 세팅에서 더…