| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | 4 | 5 | ||
| 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| 13 | 14 | 15 | 16 | 17 | 18 | 19 |
| 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| 27 | 28 | 29 | 30 |
- REST API
- 신경망 학습
- 4948
- 밑바닥부터 시작하는 딥러닝
- Python
- N-Queen
- 오블완
- 경사하강법
- 기계학습
- 손실함수
- end to end
- 티스토리챌린지
- streamlit
- 파이싼
- Retrieval
- 가상환경
- 1002
- n과 m
- 재귀
- pyenv
- BOJ
- 파이썬
- 15649
- video retireval
- 개발환경
- 9020
- 백트래킹
- 그리디 알고리즘
- 1101
- 백준
- Today
- Total
목록전체 글 (299)
파이톨치
5월 13일 논문 작성과 면접이 얼마 남지 않아서, 압박감이 느껴진다. 압박감이 느껴져 최근에는 나의 생각조차 AI에게 맡겨버린지 오래되었다. 이러한 습관을 고치기 위해 조금이나마 글을 적어본다. 예전에는 나의 생각과 언어를 말하는 것이 자연스러웠다. 하지만 최근에는 다음 단어가 생각나지 않을 때가 많다. 나의 생각을 글로 적지 않은지 오래 되어 그런듯 하다. LLM이 나보단 글을 잘 쓸지 모른다. 하지만 그것에 의존해서는 안된다. 분명 "나"라는 사람에게는 나만의 이야기가 있다. 하지만 나의 생각조차 기계에 맡겨버린다면 그것이 무슨 의미가 있겠는가? 그래선 안된다. 나의 생각이 정갈하게 들지 않으니, 나이를 먹어서도 생각이 그대로이다. 깊게 고민하지 않으니 어린 아이 같은 행동을 하게 된다. 때문..
보호되어 있는 글입니다.
Linear Algebra Determinant Determinant는 정사각행렬에 붙는 하나의 스칼라 값이고 그 값은 선형변환이 공간을 얼마나 늘리거나 줄이는지 그리고 방향을 뒤집는지까지 함께 담는다. 이 관점만 잡히면 공식이 많아 보여도 한 줄로 정리된다. Determinant는 부피의 배율과 방향 정보를 주는 값이다. 가장 직관적인 정의는 선형변환 A가 R^n의 한 영역을 다른 영역으로 보낼 때 n차원 부피가 얼마나 변하는지를 보는 것이다. 단위 정육면체의 부피는 1인데 이를 A로 보내면 어떤 평행육면체가 되고 그 부피가 ∣det(A)∣가 된다.그리고 부호는 방향을 말한다. 방향이 보존되면 양수이고 뒤집히면 음수다. 이 한 문장이 det의 거의 모든 성질을 자연스럽게 설명한다.두 열벡터가 만드는 ..
Concept DescriptionCombinational CircuitOutput depends only on the present inputs.Sequential CircuitOutput depends on present inputs + past inputs (state).Storage ElementA device that can store one bit of information (e.g., latch, flip-flop).FeedbackA technique where the output is fed back to the input to remember a previous state.Clock SignalA periodic signal that synchronizes state changes in ..
TypeModelSizeModality#Frames R@1 ↑mAP ↑Generation (LLM)Qwen2.5-Omni7BV-only96 Qwen2.5-Omni7BA-only — Qwen2.5-Omni7BA+V 96 Qwen2.5-VL7BV-only96 InternVL3.58BV-only96 Gemini 2.5 Pro—A+V128 GPT-4o—A+V128 Retrieval (Encoders)LanguageBind-Video428MV-only8 LanguageBind428MV+A8 InternVideo21BV-only8 MM-Ret148MV-only1 UniIR428MV-only1 CoVR588MV-only15 VAST V+A+S
Omni Captioning PapersAVoCaDOAVoCaDO는 영상+오디오(AV)를 시간적으로 맞물리게(temporal orchestration) 서술하는 캡셔닝 모델. 107K AV 캡션 SFT와 GRPO 보상 3종(체크리스트, 대화 정확도, 길이 정규화)로 학습해, 여러 AV 캡셔닝 벤치마크에서 오픈소스 SOTA 및 일부 상용 모델 수준까지 도달.문제의식 & 아이디어기존 비디오 캡셔닝은 비전 중심이라 오디오(대사, 효과음, 음악) 정보와 시점 정합을 놓침.단순히 “비디오 설명 + 오디오 설명을 이어붙이기”는 시간적 대응 실패 → QA 성능 저하.파일럿 실험: 공동 처리(AV joint caption)가 분리 후 연결 대비 +15.8%, 특히 AV 이벤트 정합 과제에서 +27.8% 향상. → AV..
VideoAgentVideoAgent는 “롱비디오를 이벤트 맥락 메모리와 객체-ID 메모리로 구조화”해 LLM의 단계적 툴 사용을 가능하게 만든 설계다. 이 구조 덕분에 ‘무엇이·언제·몇 번’을 빠르게 조회·추론할 수 있고, 이는 네가 구상 중인 반복 객체 기반 이미지 쿼리→모멘트 리트리벌과 정확히 맞물린다.RT-DETR+ByteTrack으로 트랙을 만들고, CLIP/DINOv2로 object ID를 묶어 프로토타입 썸네일·임베딩을 생성 → 이것이 user-friendly image query로 바로 쓰임.VideoAgent2: Enhancing the LLM-Based Agent System for Long Form Video Understanding by Uncertainty-Aware CoT RE..
목표외부 고유명/월드지식 없이 롱비디오에서 사용자가 찾을 법한 대상·순간을 빠르게 찾기.댓글의 이름 의존은 최소화. 영상 내부에서 반복·지속 등장하는 대상을 기반으로 이미지 쿼리(프로토타입) 자동 생성 → 모멘트 리트리벌에 활용.왜 VideoAgent류 접근이 잘 먹히는가이중 메모리 구조:Temporal memory: 세그먼트 캡션/비디오 임베딩으로 전반 맥락을 가볍게 저장 → 텍스트 질의에 강함.Object memory: 탐지+추적(+간단 re-ID)로 동일 개체를 묶어 어디서 몇 번 나오는지 빠르게 질의 가능.툴 조합 최소화: 캡션 검색, 세그먼트 로컬라이즈, 오브젝트 조회만으로도 대부분의 질문 처리.반복성에 강함: “여러 번 나온다”를 개체 단위로 세고, 시간대 인덱스를 바로 뽑아 점수화 가능.우리..