Lilcob/-DL_PaperReadingMeeting

Deep Learning Paper Reading Meeting-Archive

HTML

248

49 commits

updated Sep 1, 2026

See the code

README

Deep learning Paper Reading Meeting Archive

Last updated: 2026-09-01 (KST) · YouTube channel This page is an archive of the Deep Learning Paper Reading Meeting. you would like to attend the meeting or have any questions, Write in the GitHub issue table or email us at 'tfkeras@kakao.com'

TasksPaperLinkPerformance IndexHighlights
NLPAttention is all you needYoutube
Paper
Abstractive Text Summarization, Constituency Parsing완전한 어텐션 기반(Transformer) 모델을 제안하여, RNN/CNN을 사용하지 않고도 SOTA 달성.
NLPBERTYoutube
paper
Autoencoding Transformers, Transformers, Language Models마스크드 LM과 NSP 기법을 통해 범용적인 언어 이해 성능을 혁신적으로 향상.
NLPERNIEYoutube
paper
Chinese Named Entity Recognition, Chinese Sentence Pair Classification지식 그래프를 통합하여 중국어에 특화된 언어 모델 성능을 높임.
NLPRoBERTaYoutube
paper
Autoencoding Transformers, Transformers더 많은 데이터와 긴 학습, 대규모 배치를 활용해 BERT보다 높은 성능 달성.
NLPXLNETYoutube
paper
Autoregressive Transformers, Transformers순열 기반 언어 모델링으로 BERT의 NSP 한계를 극복하고 성능을 개선.
NLPSentenceBertYoutubeLinear-Probe Classification, Semantic SimilarityBERT를 문장 임베딩에 최적화하여 문장 간 유사도 계산을 간단하면서도 효과적으로 수행.
NLPDefending Against neural fake newsYoutubeFake News Detection, Text GenerationGPT류 모델이 생성한 텍스트와 실제 뉴스 텍스트를 구분하기 위한 방법론 제안 및 실험.
NLPTransformer-XLYoutube
blog
Language Modelling긴 시퀀스 처리를 위해 세그먼트 메모리를 순환적으로 연결하는 새로운 구조 제안.
NLPUnderstanding back translation at scaleYoutube
blog
Machine Translation, Translation대규모 역번역(back-translation) 실험을 통해 번역 품질 향상을 체계적으로 분석.
NLPDeep Contextualized Word RepresentationsYoutubeCitation Intent Classification , Conversational Response Selection문맥에 따라 단어 임베딩이 동적으로 변하는 ELMo를 통해 다양한 NLP 태스크 성능 향상.
NLPUniviersal LM Fine-tuning for text classificationYoutubeClassification, General Classification범용 언어 모델 사전학습 후 파인튜닝 방식을 제안해 소규모 데이터에서도 뛰어난 성능 달성.
NLPSubword-level Word Vector Representations for KoreanYoutubeDocument Classification, Language Modelling한국어 형태론에 맞춰 서브워드 단위 임베딩을 제안하여 분절 문제를 효과적으로 해결.
NLPA Decomposable Attention Model for Natural Language InferenceYoutubeNatural Language Inference간단한 어텐션 구조만으로도 NLI 태스크에서 준수한 성능을 달성한 모델 제안.
NLPReformerYoutubeTransformersLSH 기반 어텐션으로 긴 시퀀스 처리 시 메모리와 연산량을 크게 절감.
NLPNeural Machine Translation by Jointly Learning to Align and TranslateYoutubeDialogue Generation, Machine Translation기념비적인 연구로, NMT에서의 어텐션(align) 메커니즘을 처음 제안.
NLPELECTRAYoutubeAutoencoding Transformers, Transformers제너레이터-디스크리미네이터 구조로 적은 연산으로 효율적인 사전학습 구현.
NLPSBERT-WKYoutubeSemantic Textual Similarity, Sentence EmbeddingBERT 내부 레이어 가중치(Weighted-KMeans) 조합으로 문장 임베딩 생성.
NLPRevealing the Dark Secrets of BERTYoutubeBERTBERT 내부 표현 구조와 잠재적 취약점을 심층 분석한 연구.
NLPPEGASUSYoutubeAbstractive Text Summarization문장 누락(gap-sentence) 기반 사전학습 기법으로 요약 태스크에 특화된 성능 제시.
NLPDocument-level Neural Machine Translation with Inter-Sentence AttentionYoutubeMachine Translation, Translation문서 단위 전체 문맥(문단 간 관계)을 고려해 번역 품질을 높임.
NLPPhrase-Based & Neural Unsupervised MachineYoutubeTranslation, Unsupervised Machine Translation무감독 기법으로 평행 데이터 없이 양방향 번역을 학습하는 모델 제안.
NLPBARTYoutubeSequence To Sequence Models, Transformers디노이징 오토인코더 방식의 사전학습으로 요약·생성 분야에서 강력한 성능 발휘.
NLPBAEYoutubeAdversarial Attack, Adversarial Text토큰 치환 방식으로 텍스트를 교란해 분류 모델을 공격·취약점 연구.
NLPA Generative Model for Joint Natural Language Understanding and GenerationYoutubeNatural Language Understanding, Task-Oriented Dialogue Systems언어 이해(NLU)와 생성(NLG)을 단일 모델에서 통합적으로 수행하는 대화 시스템 제안.
NLPLearning Contextual Representations for Semantic Parsing with Generation-Augmented Pre-TrainingYoutubeLanguage Modelling, self-Supervised Learning생성 기반 사전학습을 활용하여 의미파싱(semantic parsing) 정확도를 향상.
NLPGraph Attention NetworksYoutubeDocument Classification, Graph Attention그래프에서 어텐션 기법을 적용해 노드·문서 분류 성능을 개선한 모델.
NLPSwitch TransformersYoutubeLanguage Modelling, Question Answering초대규모 파라미터 모델에 전문가 혼합(MoE)을 적용해 효율적 스케일링 구현.
NLPDeText: A Deep Text Ranking Framework with BERTYoutubeRanking검색 및 추천 시스템에서 BERT 스타일 랭킹 모델을 적용해 정확도 향상.
NLPFace book Chat bot , Blender botYoutubeChatbot지식, 인격 등 여러 스킬을 혼합한 오픈도메인 챗봇으로 대화 맥락을 풍부하게 유지.
NLPExtracting Training Data from Large Language ModelsYoutubeLanguage Modelling대형 언어 모델이 학습 데이터를 “기억” 및 유출할 수 있는 프라이버시 이슈 연구.
NLPLongformer: The Long-Document TransformerYoutubeLanguage Modelling, Question Answering희소 어텐션(sparse attention)을 적용해 긴 문서를 효율적으로 처리.
NLPVisualizing and Measuring the Geometry of BERTYoutubeWord EmbeddingsBERT 임베딩 공간의 기하학적 특성과 분포를 시각화 및 정량 분석.
NLPEncode, Tag, Realize High Precision Text EditingYoutubeAbstractive Text Summarization, Sentence Fusion단계별(인코드→태깅→실현) 접근으로 정밀한 텍스트 편집 및 요약 방안 제안.
NLPmultimodal transformer for unaligned multimodal language sequencesYoutubeMultimodal Sentiment Analysis, Time Series서로 정렬되지 않은 멀티모달 입력(음성·영상 등) 처리를 Transformer로 수행하여 감정분석·시계열 분석.
NLPSCGPT : Few-shot Natural Language Generation for Task-Oriented DialogYoutubeData-to-Text Generation, Few-Shot Learning대화 시스템에서 소량의 데이터로 텍스트 생성(task-oriented)을 수행하는 GPT 기반 프레임워크.
NLPColBERT: Efficient and Effective Passage Search viaContextualized Late Interaction over BERTYoutubeDocument Ranking, Information RetrievalBERT 임베딩을 기반으로 후반부(Late) 상호작용을 적용해 효율적인 패시지 검색을 구현.
NLPRestoring and Mining the Records of the Joseon Dynasty via Neural LanguageModeling and Machine TranslationYoutubeLanguage Modelling, Machine Translation조선왕조실록 등 옛 문서를 복원하고 번역하기 위해 NLM·MT 기술을 활용.
NLPImproving Factual Completeness and Consistency of Image to Text Radiology Report GenerationYoutubeNatural Language Inference, Text Generation영상→텍스트 변환 시 사실성(팩추얼)과 일관성을 높여 의료 보고서 품질 향상.
NLPFinBERTYoutubeLanguage Modelling, Pretrained Language Models금융 도메인(감성 분석 등)에 특화된 BERT 변형 모델로 높은 성능 달성.
NLPLayoutLM: Pre-training of Text and Layout for Document Image UnderstandingYoutubeDocument Image Classification, Document Layout Analysis문서 이미지에서 텍스트와 레이아웃 정보를 동시에 학습해 인식 정확도 향상.
NLPQuery Suggestions as Summarization in Exploratory SearchYoutubeQuery suggestions쿼리 제안을 요약(summarization) 방식으로 접근해 탐색적 검색을 지원.
NLPH-Transformer-1D Paper: Fast One Dimensional Hierarchical Attention For SequencesYoutubeLanguage Modelling계층적(hierarchical) 어텐션을 적용해 1D 시퀀스 처리 속도를 높인 모델.
NLPEnd-to-End Progressive Multi-Task Learning Framework for Medical Named Entity Recognition and NormalizationYoutubeKnowledge Graphs, Medical Named Entity Recognition의료 개체 인식과 정규화를 점진적 멀티태스크 학습으로 통합 수행.
NLPDISEASES : Text mining and data integration of disease–gene associationsYoutubeText mining, Data integration, Information extraction생물의학 텍스트를 활용해 질병–유전자 연관성을 통합적으로 발굴·구현.
NLPRoFormer: Enhanced Transformer with Rotary Position EmbeddingYoutubeSemantic Text MatchingRotary Position Embedding 기법으로 위치 인코딩을 개선해 매칭 성능 향상.
NLPA Multiscale Visualization of Attention in the Transformer ModelYoutubeTransformer멀티스케일 어텐션 시각화로 Transformer 동작과 메커니즘 파악에 도움.
NLPCAST: Enhancing Code Summarization with Hierarchical Splitting and Reconstruction of Abstract Syntax TreesYoutubeSoftware Engineering코드 요약 시 AST를 계층적으로 분할·재구성하여 더 간결하고 정확한 요약 제공.
NLPMERL: Multimodal Event Representation Learning in Heterogeneous Embedding SpacesYoutubeLanguage Grounding, Multi-modal NLP서로 다른 모달(텍스트, 이미지 등)을 동일 임베딩 공간에서 이벤트로 학습.
NLPBig Bird - Transformers for Longer SequencesYoutubeLinguistic Acceptability, Natural Language Inference희소 어텐션으로 4k 토큰 이상의 긴 입력을 처리 가능하게 만든 모델.
NLPDecoding-Enhanced BERT with Disentangled AttentionYoutubeCommon Sense Reasoning, Coreference Resolution디코딩 모듈과 분리 어텐션을 결합해 상식 추론과 코리퍼런스 해결 성능을 높임.
NLPSentiPrompt: Sentiment Knowledge Enhanced Prompt-Tuning for Aspect-Based Sentiment AnalysisYoutubeAspect-Based Sentiment Analysis, Language Modelling감성 지식을 프롬프트 튜닝에 접목해 ABSA(Aspect 기반 감성분석) 성능 향상.
NLPIMPROVING BERT FINE-TUNING VIA SELF-ENSEMBLE AND SELF-DISTILLATIONYoutubeNatural Language Inference, Text Classification여러 BERT 체크포인트를 앙상블 후 셀프 디스틸로 성능 및 안정성 개선.
NLPACHIEVING HUMAN PARITY ON VISUAL QUESTION ANSWERINGYoutubequestion-answering,Question Answering시각적 질의응답(VQA) 분야에서 인간 수준에 근접하거나 달성한 모델.
NLPDeep Encoder, Shallow Decoder: Reevaluating non- autoregressive machine translationYoutubeKnowledge Distillation, Machine Translation인코더를 깊게, 디코더를 얕게 설계하여 비자동회귀 MT(non-AR MT) 성능 향상 제시.
NLPLaMDA : Language Models for Dialog ApplicationsYoutubeInformation Retrieval다중 턴 대화를 위한 대규모 언어모델, 풍부한 대화 능력(오픈엔드).
NLPCompetition-Level Code Generation with AlphaCodeYoutubeCode Generation프로그래밍 경진대회 수준의 코드 솔루션을 생성하는 모델.
NLPRetrieval-Augmented Generation for Knowledge-Intensive NLP TasksYoutubeKnowledge-Intensive NLP외부 지식을 검색(Retrieval) 후 생성(Generation)에 활용해 복잡한 질의 해결.
NLPSimCLS: A Simple Framework for Contrastive Learning of Abstractive SummarizationYoutubeAbstractive Summarization요약 결과를 대조학습으로 평가·개선해 더 높은 품질의 추상적 요약 가능.
NLPGraph-Bert: Only Attention is Needed for Learning Graph RepresentationsYoutubeGraph Representations그래프 구조에 직접 어텐션만으로 임베딩을 학습, GNN 없이도 성능 확보.
NLPSimCSE:Simple Contrastive Learning of Sentence EmbeddingYoutubeSentence Embedding최소한의 데이터 증강과 대조학습만으로 문장 임베딩 품질을 대폭 향상.
NLPTypical decoding for Natural LanguageYoutubeText Generation생성 과정에서 “typical decoding”을 도입해 다양성과 품질의 균형을 꾀함.
NLPPerceiver IO : A GENERAL ARCHITECTURE FOR STRUCTURED INPUTS & OUTPUTSYoutubeMultimodal Processing다양한 형태의 입·출력을 일관된 Transformer 구조로 처리할 수 있는 범용 프레임워크.
NLPExploiting Cloze Questions for Few Shot Text Classification and Natural Language InferenceYoutubeText Classification, Natural Language Inference클로즈(cloze) 스타일의 질문을 이용해 소량의 데이터로 분류·추론 태스크를 수행
NLPLearning to Generalize to More:Continuous Semantic Augmentation for Neural Machine TranslationYoutubeMachine Translation연속적 의미 증강(continuous semantic augmentation)을 통해 번역 모델의 일반화 성능 제고.
NLPMultitask Prompted Training Enables Zero-Shot TaskYoutubeZero-Shot Learning멀티태스크 프롬프트 학습으로, 새로운 태스크에 대한 제로샷 성능을 높임.
NLPEfficient Passage Retrieval with Hashing for Open-domain Question Answering(BPR)YoutubeOpen-domain QA해싱을 활용한 효율적 패시지 검색으로 오픈도메인 QA 시스템 성능 향상.
NLPLORA: LOW-RANK ADAPTATION OF LARGE LANGUAGE MODELSYoutubeLanguage Modelling, LLM finetuning대형 언어 모델에 저순위 행렬(LoRA)을 추가해 파인튜닝 비용을 절감하는 기법.
NLPWeakly-supervised Text Classification Based on Keyword GraphYoutubeText Classification키워드 그래프를 이용한 약지도(weakly-supervised) 텍스트 분류 기법.
NLPImproving the Quality Trade-Off for Neural Machine Translation Multi-Domain AdaptationYoutubeMachine Translation다중 도메인 번역 적응 시 품질과 비용 간 균형을 개선하는 접근 제안.
NLPAEDA: An Easier Data Augmentation Technique for Text ClassificationYoutubeText Classification문장부호(punctuation) 삽입만으로 간단히 데이터 증강을 수행하는 기법 제안.
NLPGTRANS-Grouping and Fusing Transformer Layers for Neural Machine TranslationYoutubeMachine TranslationTransformer 레이어를 그룹화·융합해 번역 성능 및 효율을 동시에 추구.
NLPSPLADE : Sparse Lexical and Expansion Model for First Stage RankingYoutubeInformation Retrieval문서 랭킹의 첫 단계에서 희소 레키컬 확장을 활용해 성능을 높인 모델.
NLPDebiased Contrastive learning of Unsupervised Sentence RepresentationYoutubeSentence Representation비지도 문장 임베딩에서 대조학습을 통해 편향(spurious correlation)을 완화.
NLPCalibrating Sequence Likelihood Improves Conditional Language GenerationYoutubeConditional Language Generation시퀀스 확률 보정을 통해 조건부 텍스트 생성 결과의 일관성과 품질 개선.
NLPCHAIN-OF-THOUGHT PROMPTING ELICITS REASONING IN LARGE LANGUAGE MODELSYoutubeReasoning단계별 추론(Chain-of-Thought)을 유도해 대형 언어모델의 논리적 사고력 강화.
NLPA Quantitative Analysis of Statistical and Graph-Based Term Weighting Schemes for Keyword ExtractionYoutubeKeyword Extraction통계·그래프 기반 가중치 스킴을 비교하여 키워드 추출 효율을 정량 분석.
NLPImproving Neural Machine Translation with Soft Template PredictionYoutubeMachine Translation소프트 템플릿 예측으로 번역 과정에서 더 자연스러운 구조와 유창성 확보.
NLPMinerva - Solving Quantitative Reasoning Problems with Language ModelsYoutubeQuestion Answering대형 언어 모델로 수학·정량적 추론 문제를 해결해 높은 정확도 달성.
NLPPaLM: Scaling Language Modeling with PathwaysYoutubeLanguage ModelingPathways 아키텍처로 대규모 언어 모델을 스케일링해 다양한 태스크 성능 향상.
NLPUnsupervised Neural Machine Translation for Low-Resource Domains via Meta-LearningYoutubeUnsupervised Machine Translation메타학습을 도입해 저자원 도메인에서 무감독 번역 모델의 성능을 향상.
NLPCausal Inference in Natural Language Processing: Estimation, Prediction, Interpretation and BeyondYoutubeCausal InferenceNLP 태스크에 인과 추론 기법을 적용해 예측과 해석력을 높이는 연구.
NLPBRIO: Bringing Order to Abstractive SummarizationSYoutubeAbstractive Summarization요약 결과물의 구조 및 일관성을 개선해 더 읽기 쉬운 추상적 요약 생성.
NLPTowards Robust and Reproducible Active Learning using Neural NetworksYoutubeActive Learning재현 가능하며 안정적인 능동학습 전략을 제안해 실제 적용성을 높인 연구.
NLPScaling Instruction-Finetuned Language ModelsYoutubeInstruction Tuning지시(instruction) 기반 데이터로 파인튜닝 시 모델 스케일업 효과를 분석.
NLPPacked Levitated Marker for Entity and Relation ExtractionYoutubeEntity and Relation Extraction마커(marker) 기법을 활용해 엔티티 및 관계를 통합적으로 추출하는 방법 제시.
NLPLLaMA Review!YoutubeLarge Language ModelsMeta AI에서 공개한 LLM 시리즈로, 상대적으로 적은 파라미터로도 높은 성능 발휘.
NLPP-Tuning v2: Prompt Tuning Can Be Comparable to Fine-tuning Universally Across Scales and TasksYoutubePrompt Tuning다양한 크기의 모델에서 프롬프트 튜닝이 풀 파인튜닝에 맞먹는 성능을 보여줌.
NLPMCSE:Multimodal Contrastive Learning of Sentence EmbeddingsYoutubeMultimodal Sentence Embedding문장 임베딩을 멀티모달 대조학습으로 확장해 텍스트+이미지 등 통합 표현 학습.
NLPHyperbolic Image EmbeddingsYoutubeImage Embeddings이미지 임베딩을 쌍곡공간(hyperbolic space)에 매핑해 계층적·트리 구조 표현 향상.
NLPLIMA Less Is More for AlignmentYoutubeAlignment소량 데이터로도 효율적 정렬(alignment) 가능성을 보인 모델 연구.
NLPInstruct GPT : Training language models to follow instructions with human feedbackYoutubeInstruction Tuning인간 피드백을 활용한 RL 기법으로 GPT가 지시사항을 잘 따르도록 학습.
NLPIter-RetGen : Enhancing Retrieval augmented Large Language Models with Iterative RetrievalYoutubeRetrieval-Augmented Generation반복(iterative) 검색 전략으로 지식 기반 텍스트 생성 품질을 단계적으로 향상.
NLPTextbooks Are All You needYoutubeLanguage Modeling, Instruction Tuning교과서 수준의 간단한 텍스트만으로도 대형 언어 모델을 효율적으로 학습할 수 있음을 시사.
NLPEmbedding Text in Hyperbolic spaceYoutubeHyperbolic Embeddings, Representation Learning쌍곡공간 임베딩으로 텍스트 간 계층적·트리 관계를 효과적으로 학습.
NLPOpineSum : Entailment based self training for abstractive opinion summarizationYoutubeOpinion Summarization, Entailment엔테일먼트 기반 셀프 트레이닝으로 사용자 의견 요약 품질을 높이는 기법.
NLPDo Androids Laugh at Electric Sheep Humor “Understanding” Benchmarks from The New Yorker CaptionYoutubeHumor Detection, Benchmarking만화 캡션 등 유머 이해 능력을 평가하는 벤치마크를 제시, AI의 ‘유머 인식’ 성능을 검증.
NLPPUNICA: Multi-Tenant LoRA ServingYoutubeParameter Efficient Tuning, LoRA ServingLoRA(저순위 어댑터) 기반 모델을 다중 사용자 환경에서 효율적으로 서비스하는 플랫폼.
NLPFrom Pretraining Data to Language Models to Downstream TasksYoutubeLanguage Models, Transfer Learning사전학습 데이터 선정부터 다운스트림 태스크 적용까지 일관된 언어 모델 학습·분석 파이프라인 제안.
NLPEfficient Memory Management for Large Language Model Serving with pagedAttentionYoutubeMemory Optimization, Large Language ModelspagedAttention 기법을 통해 LLM 추론 시 메모리 사용을 효율적으로 관리하는 방법.
NLPNatural Posterior Network Deep Bayesian Uncertainty for Exponential Family DistYoutubeBayesian Learning, Uncertainty Estimation지수 가족 분포 기반 심층 베이지안 접근으로 모델 불확실성을 더 정확히 추정.
NLPMamba: Linear Time Sequence Modeling with Selective State SpacesYoutubeSequence Modeling, State Space Models상태 공간을 선택적으로 활용해 선형 시간 복잡도로 시퀀스 모델링 성능 유지.
NLPChatGPT for Robotics Design Principles and Model AbilitiesYoutubeHuman-Robot Interaction, Language ModelsChatGPT를 로보틱스 설계에 적용해 모델 능력과 디자인 원칙을 점검·분석.
NLPMeta in context Learning In large Language ModelsYoutubeMeta-learning, In-Context Learning대형 언어 모델에서 인컨텍스트 학습을 메타학습 관점으로 해석, 능력을 향상시키는 방법 분석.
NLPLarge Language Models Understand and Can be Enhanced by Emotional StimuliYoutubeEmotion-Aware LLM, Sentiment Analysis감정 자극(Emotional Stimuli)이 대형 언어 모델 이해력 및 성능 향상에 기여함을 제시.
NLPIgnore This Title and HackaPromptYoutubePrompt Engineering, Adversarial Prompts‘무시해야 할 제목’ 같은 어드버서리얼 프롬프트를 통해 모델을 교묘히 우회·오류 유발.
NLPAlpacaFarm : A Simulation Framework for Methods that Learn from Human FeedbackYoutubeRLHF Simulation, LLM Fine-Tuning인간 피드백 기반 학습(RLHF)을 시뮬레이션할 수 있는 AlpacaFarm 프레임워크 제안.
NLPWhy Can GPT Learn In Context Language Models Secretly Perform Gradient DesceYoutubeIn-Context Learning, Gradient DescentGPT가 내부적으로 그래디언트 디센트를 모사해 인컨텍스트 학습을 수행한다는 가설.
NLPSmoothQuant : Accurate and Efficient Post Training Quantization for Large LanguageYoutubeQuantization, Model Compression대형 언어 모델을 후처리 단계에서 양자화(SmoothQuant)하여 정확도·효율 동시 확보.
NLPGenerative Representational Instruction TuningYoutubeInstruction Tuning, Representation Learning생성적 표현(Representational)과 지시 기반 튜닝을 결합해 모델 표현력 개선.
NLPGraph of Thought : Solving Elaborate Problems with Large Language ModelsYoutubeComplex Reasoning, Graph-based Thinking그래프 사고(Graph of Thought) 기법으로 복잡 문제를 대형 언어 모델이 단계적으로 해결.
NLPHallucination of Multimodal Large Language modelsYoutubeMultimodal LLM, Hallucination이미지·텍스트 등 멀티모달을 처리하는 LLM에서 발생하는 할루시네이션과 그 완화 방안 연구.
NLPRAPTOR : Recursive Abstractive Processing For Tree Organized RetrievalYoutubeAbstractive Summarization, Tree Retrieval트리 구조 데이터를 재귀적으로 요약해 복잡한 문서 검색 성능을 향상하는 기법.
NLPChain of Thought Reasoning Without PromptingYoutubeChain of Thought, Zero-Prompt Reasoning별도 프롬프트 없이도 모델이 단계적 사고 과정을 학습·활용(Chain of Thought) 가능.
NLPLet the Flows Tell: Solving Graph Combinatorial Optimization Problems with GFlowNetsYoutubeGFlowNet, Graph OptimizationGFlowNets를 활용해 그래프 조합 최적화 문제에서 해 공간을 효율적으로 탐색·해결
NLPMoRA: High-Rank Updating for Parameter-Efficient Fine-TuningYoutubeParameter Efficient Tuning, High-Rank Update저순위 LoRA와 반대로 고순위(MoRA) 업데이트 방식으로 미세조정 효율과 성능을 동시 개선.
NLPAdapting Visual Language Models for Generalizable Anomaly Detection in MedicalYoutubeMedical Anomaly Detection, Vision-Language Models비전-언어 모델을 의료 이상 탐지에 활용, 다양한 환경에서 일반화 성능을 높이는 접근.
NLPGradient Boosting Reinforcement Learning (GBRL)YoutubeReinforcement Learning, Gradient Boosting그래디언트 부스팅 개념을 RL에 접목해 학습 효율 및 정책 품질을 개선한 기법.
NLPDesigning a Dashboard for Transparency and Control of Conversational AIYoutubeConversational AI, Transparency대화형 AI 작동을 투명하게 모니터·제어 가능한 대시보드를 설계해 사용자 신뢰도 향상.
NLPHow Johnny Can Persuade LLMs to Jailbreak ThemYoutubeAdversarial Prompting, Model Security사용자 프롬프트를 통해 모델 정책을 우회(jailbreak)시키는 기법과 방어 시나리오 연구.
NLPLongRoPE : Extending LLM Context Window Beyond 2 Million TokensYoutubeExtended Context, Rotary Positional EmbeddingRoPE를 확장해 최대 수백만 토큰 이상의 장문을 처리할 수 있는 LLM 구조 제안.
NLPCoVe : Chain of Verification Reduces Hallucination in LLMYoutubeHallucination Reduction, Verification모델 출력의 사실성을 검증(Verification)하는 체인을 추가해 할루시네이션 완화.
LLM InferenceREFLEG: Rethinking RAG-based Decoding for LLM EfficiencyYoutubeRAG Decoding, LLM Efficiency, Retrieval-Augmented GenerationRAG 기반 디코딩 방식을 재설계해 검색 기반 생성의 효율성과 응답 품질을 함께 개선하려는 접근.
LLM InferenceSpecEE: Accelerating Large Language Model Inference with Speculative Early ExitingYoutubeSpeculative Decoding, Early Exit, LLM InferenceSpeculative decoding과 early exiting을 결합해 LLM 추론 속도를 높이는 효율화 기법.
LLM ReasoningDeepConf: Deep Think With ConfidenceYoutubeConfidence Estimation, Reasoning, LLM모델의 추론 과정에서 confidence를 활용해 더 신뢰도 높은 답변과 사고 경로를 유도하는 방법.
VisionControlNet : Adding Conditional Control to Text to Image Diffusion ModelYoutubeText-to-Image, Conditional DiffusionDiffusion 기반 텍스트→이미지 생성에 조건부 제어를 추가해 생성 결과를 세밀하게 통제.
VisionInterpreting CLIP’s Image Representation via Text Based DecompositionYoutubeVision-Language Models, Representation AnalysisCLIP 임베딩을 텍스트 기반으로 분해·해석해 시각 표현 구조 이해를 개선.
VisionOpen-World Semantic Segmentation Including Class SimilarityYoutubeOpen-World Segmentation, Class Similarity클래스를 모르는 오픈월드 세그멘테이션 상황에서 클래스 유사도 등을 고려해 분할 정확도 향상.
VisionDynamic Sparse Voxel Transformer with Rotated Sets (DSVT)Youtube3D Object Detection, Sparse Transformer3D 점구름(voxel)에서 회전된 셋을 활용, 희소성·동적성을 겸비한 Transformer로 물체 탐지.
VisionIs ImageNet Worth 1 Video?YoutubeVideo Pretraining, ImageNet Alternative단 하나의 긴 동영상이 ImageNet에 상응하는 사전학습 효과를 낼 수 있는지 실험적으로 검증.
VisionSAM2YoutubeSemantic Segmentation, SAMSegment Anything Model(SAM)을 확장 혹은 개선하여 세분화 정확도 향상 모색. 심지어 동영상
VisionSparK : DESIGNING BERT FOR CONVOLUTIONAL NETWORKSYoutubeConvNets, BERT-like ArchitectureCNN에 BERT 구조를 접목해 시각 특징 학습을 강화하는 SparK 모델 제안.
VisionDiffusion-based Semantic-Discrepant Outlier Generation for Out-of-Distribution DetectionYoutubeOOD Detection, Diffusion Models정상 데이터와 다른(semantic discrepancy) 샘플을 생성해 OOD 탐지 성능 강화.
VisionTri Perspective View for Vision Based 3D Semantic Occupancy PredictionYoutube3D Occupancy, Semantic Prediction세 가지 관점(Tri Perspective)으로 3D 공간의 점유 및 의미 정보를 예측하는 접근.
VisionUniCLIP Unified Framework for Contrastive Language Image Pre trainingYoutubeCLIP, Contrastive Pretraining언어–이미지 대조학습을 하나로 통합한 프레임워크로 범용 비전-언어 표현 학습 지원.
VisionBEVFusion: Multi-Task Multi-Sensor Fusion with Unified Bird's-Eye View RepresentationYoutubeSensor Fusion, 3D Detection라이다·카메라 등 센서 정보를 Bird’s-Eye View로 융합해 다중 태스크를 동시 처리.
VisionSemiVL: Semi-Supervised Semantic Segmentation with Vision-Language GuidanceYoutubeSemi-Supervised Segmentation, Vision-Language비전-언어 정보를 활용해 반지도(세미 슈퍼바이즈) 세그멘테이션 성능을 높임.
VisionYDTR Infrared and Visible Image Fusion via Y Shape Dynamic TransformerYoutubemage Fusion, Transformer적외선·가시광 이미지를 Y자형 동적 Transformer로 융합해 시각적 품질 향상.
VisionSTABLEREP : Synthetic Images from Text-to-Image Models Make Strong Visual Representation LearnersYoutubeSynthetic Data, Representation Learning텍스트→이미지 합성 데이터를 활용해도 강력한 시각 표현 학습을 달성할 수 있음.
VisionDiffusion models Beat GANs on Image SynthesisYoutubeImage Synthesis, Diffusion vs. GAN확산(diffusion) 모델이 이미지 생성 품질 면에서 GAN을 능가한다는 연구 결과.
VisionDOMINO Discovering Systematic Errors with Cross Modal EmbeddingsYoutubeError Analysis, Cross-Modal Embeddings모델의 체계적 에러를 멀티모달 임베딩을 통해 탐색·분류해 개선 여지 확인.
VisionEmergent Complexity and Zero shot Transfer via Unsupervised Environment DesignYoutubeUnsupervised Environment Design, Zero-Shot Transfer학습 환경을 자동 설계해 에이전트가 예측 못한 태스크로 제로샷 전이 가능하게 만듦.
VisionRT-DETR : DETRs Beat YOLOs On Real time Object DetectionYoutubeObject Detection, Transformer-based DETRDETR 계열 모델이 실시간 객체 검출(throughput)에서 YOLO와 경쟁·상회하는 결과 보고.
VisionMasked Auto encoders Are Scalable Vision LearnersYoutubeMAE, Self-Supervised Learning이미지 일부를 마스킹 후 복원하는 MAE 기법으로 대규모 시각 표현 학습의 효과를 입증.
VisionLLM-grounded DiffusionYoutubeVision-Language Models, Diffusion대형 언어 모델(LLM)을 접목해 텍스트 이해력을 강화한 이미지 생성.
VisionDepth Anything Unleashing the Power of Large Scale Unlabeled DataYoutubeDepth Estimation, Unlabeled Data대규모 비라벨 데이터에서 깊이(depth) 정보를 학습해 다양한 비전 태스크로 확장 가능.
VisionObject LabYoutubeObject Discovery, 3D Reconstruction객체 탐지·3D 재구성을 결합한 ‘Object Lab’ 환경을 통해 직관적 오브젝트 연구.
VisionYOLOYoutube
paper
Object detectionObject detection
VisionYOLO-v2YoutubeObject detectionObject detection
VisionResnetYoutube
paper
Image classificationImage classification
VisionGANYoutubeGenerative Adversarial Networks, Generative ModelsGenerative Adversarial Networks, Generative Models
VisionImage Style Transfer Using CNNYoutubeConvolutional Neu- ral NetworkCNN을 활용해 콘텐츠 이미지는 유지하고, 스타일 이미지를 결합하여 새로운 스타일 이미지 생성.
VisionSINGANYoutubeImage Generation, Image Manipulation단일 이미지만으로 멀티 스케일 GAN을 학습해 다양한 이미지 변환·조작 수행 가능.
VisionFCNYoutubeSemantic Segmentation Models완전 합성곱 네트워크(FCN)로 픽셀 단위 세그멘테이션 수행, 보다 정확한 분할 실현.
VisionDeepLabV3YoutubeSemantic Segmentation Models팽창(a trous) 컨볼루션과 ASPP로 객체 크기 변화에 대응하며 세밀한 분할 가능.
VisionUnetYoutube
paper
Cell Segmentation, Multi-tissue Nucleus Segmentation인코더-디코더 구조로 의료영상과 같은 소량 데이터 환경에서도 높은 분할 정확도.
VisionCyCADAYoutubeDomain Adaptation, Semantic Segmentation생성적 적대 학습을 통해 소스·타겟 도메인 차이를 줄여 세그멘테이션 성능 향상.
VisionD-SNEYoutubeDomain Adaptationt-SNE 시각화를 기반으로 도메인 불일치를 줄여 분류·세그멘테이션 성능 개선.
VisionFaster-RCNNYoutubeReal-Time Object Detection, Region ProposalR-CNN 계열을 개선해 영역 제안(Region Proposal) 과정을 통합, 속도·정확도 동시 향상.
VisionWeakly Supervised Object Detection With Segmentation CollaborationYoutubeGeneral Classification, Image Classification이미지 레벨 라벨만으로 객체를 검출하고, 분할 협업으로 정확도 보완하는 약지도 방식.
VisionDon't Judge an Object by Its Context: Learning to Overcome Contextual BiasYoutubeobject classification주변 문맥에 의존하는 편향을 줄이고 객체 자체 특징으로 분류 정확도를 높이는 연구.
Visiondata efficient image recognition with contrastive predictive codingYoutubeGeneral Classification, Object Detection적은 데이터 상황에서 대조 예측 부호화(CPC)로 효율적인 시각 특성 학습 달성.
VisionDeep Feature Consistent Variational AutoencoderYoutubeStyle TransferVAE에 딥 특징 일관성 조건을 추가해 스타일 전이 품질·다양성 개선.
VisionAttention Branch Network: Learning of Attention Mechanism for Visual ExplanationYoutubeDecision Making, Image Classification분기된 어텐션 브랜치로 시각적 중요 영역을 강조, 해석 가능성과 분류 정확도 동시 향상.
VisionRELATION-SHAPE CONVOLUTIONAL NEURAL NETWORK FOR POINT CLOUD ANALYSISYoutubepoint cloud점구름 데이터에서 물체 형태·상호 관계를 학습하기 위한 CNN 기반 구조 제안.
VisionEfficientNetYoutubeCNN너비·깊이·해상도를 동시에 확장해 효율적으로 정확도 향상(Scaling)을 달성한 CNN 모델.
VisionDeep Clustering for Unsupervised Learning of Visual FeaturesYoutubeDeep Clustering, Image Clustering비지도 클러스터링과 이미지 특징 학습을 결합해 시각 표현 학습 정확도 향상.
VisionBoosting Few-shot visual learning with self-supervisionYoutubeFew-Shot Learning, Self-Supervised Learning자가 지도 방식으로 특성 품질을 향상, 극소량(Few-shot) 샘플에서도 높은 정확도 가능.
VisionRethinking Pre-training and Self-trainingYoutubeData Augmentation, Object Detection사전학습 + 셀프 트레이닝 전략 재검토로 객체 검출 등에서 데이터 효율성 향상.
VisionBYOL : Bootstrap Your Own LatentYoutubeRepresentation Learning, Self-Supervised Image Classification서로 다른 네트워크 간 상호 학습(교사·학생)으로 점진적 표현 학습 향상.
VisionDeep Image PriorYoutubeImage Denoising, Image Inpainting네트워크 구조 자체로 이미지를 자연스럽게 복원하도록 유도, 별도 사전학습 불필요.
VisionObject-Centric Learning with Slot AttentionYoutubeObject Discovery슬롯 어텐션 기법으로 이미지 내 객체들을 분리·학습해 객체 중심 표현을 확보.
VisionYolo V4YoutubeData Augmentation, Real-Time Object DetectionMosaic, IoU-aware 등 다양한 기법을 결합해 실시간 검출 성능을 대폭 향상한 YOLO 후속.
VisionDynamic Routing Between CapsulesYoutubeImage Classification캡슐 간 동적 라우팅(Dynamic Routing)으로 시각적 계층 구조를 보존하며 분류 정확도 향상.
VisionSemi-Supervised Classification with Graph Convolutional NetworkYoutubeClassification, Document Classification그래프로 연결된 노드 관계를 활용해 반지도 분류·문서 분류 정확도 향상.
VisionGenerative Pretraining from PixelsYoutubeRepresentation Learning, Self-Supervised Image Classification픽셀 단위에서 생성적 사전학습 후, 다양한 시각 태스크로 전이 가능.
VisionMaskFlownetYoutubeFeature MatchingOptical Flow 예측과 마스킹을 결합해 정교한 특징 매칭을 수행하는 네트워크.
VisionAdversarial Robustness through Local LinearizationYoutubeAdversarial Defense, Adversarial Robustness적대적 공격 주변에서 모델을 국소 선형화하여 내재적 강건성을 확보.
VisionLocating Objects Without Bounding BoxesYoutubeObject Localization바운딩 박스 라벨 없이 객체 위치를 추론해 라벨 비용 절감 및 유연성 확보.
VisionTraining data-efficient image transformers & distillation through attentionYoutubeDocument Image Classification, Document Layout Analysis트랜스포머와 어텐션 기반 지식 증류를 통해 데이터 효율적으로 문서 인식 성능 향상.
VisionWhat Makes Training Multi-modal Classification Networks Hard?YoutubeAction Classification, Action Recognition멀티모달 분류 네트워크 학습 시 발생하는 편향·난관을 분석해 해법 모색.
VisionMeta-Transfer Learning for Zero-Shot Super-ResolutionYoutubeImage Super-Resolution, Meta-Learning메타 전이학습을 통해 초해상도(SSR) 문제에서 제로샷 환경도 효과적으로 대응.
VisionPatch SVDD: Patch-level SVDD for Anomaly Detection and SegmentationYoutubeAnomaly Detection, Self-Supervised Learning국소(패치) 단위 SVDD 적용으로 미세한 이상 탐지·세그멘테이션 가능.
VisionStyle GANYoutubeDisentanglement, Image Generation스타일 공간을 제어해 이미지 생성의 다채로운 변형·속성 조절 가능.
VisionHigh-Performance Large-Scale Image Recognition Without NormalizationYoutubeImage Classification정규화 없이도 대규모 이미지 분류에서 높은 성능을 내는 학습 기법 제안.
VisionFocal Loss for Dense Object DetectionYoutubeObject Detection클래스 불균형 심한 객체 검출 상황에서 포컬 로스로 성능 극대화.
VisionEditing in Style : Uncovering the Local Semantics of GANsYoutubeDense Object Detection, Long-tail LearningGAN 내부 로컬 스타일 코드를 편집해 이미지 수정·생성 자유도를 확보.
VisionEfficientNet 2YoutubeConvolutional Neural Networks, Image ModelsEfficientNet를 확장한 모델로, 크기·성능 균형을 한층 향상.
VisionStyle ClipYoutubeImage Manipulation텍스트 프롬프트와 GAN을 결합해 직관적으로 이미지 스타일 조절 가능.
VisionSwin TransformerYoutubeImage Models, Vision Transformers스윈(Window) 어텐션으로 고해상도 이미지를 효율적으로 처리하는 비전 트랜스포머.
VisionNBDT: Neural-backed Decision TreeYoutubeNeural-Backed Decision Trees신경망으로 학습한 계층적 트리 구조로 결정 과정을 시각적으로 해석 가능.
VisionEfficientDetYoutubeSemantic Segmentation Models, One-Stage Object Detection Models, Object Detection ModelsBiFPN과 EfficientNet 백본으로 높은 정확도와 빠른 속도를 동시에 달성한 검출 모델.
VisionMLP - MIXER: An all-MLP Architecture for VisionYoutubeImage Classification어텐션 없이도 채널·공간 MLP만으로 이미지 분류를 수행, 단순 구조로도 준수한 성능 달성.
VisionYou Only Look at One Sequence: Rethinking Transformer in Vision through Object DetectionYoutubeObject Detection비전 트랜스포머를 한 번의 시퀀스 처리로 객체 검출에 적용, 효율적 구조 제안.
VisionHierarchical Long-term Video Frame Prediction without SupervisionYoutubeVideo Prediction비지도 학습으로 장기 비디오 프레임을 계층적으로 예측·생성.
VisionClosed-Form Factorization of Latent Semantics in GANsYoutubeImage Generation, Image ManipulationGAN 잠재공간을 닫힌 형태로 분해해 특정 속성만 선택적으로 수정·생성 가능.
VisionYou Only Learn One Representation: Unified Network for Multiple TasksYoutubeMulti-Task Learning, Real-Time Object Detection여러 비전 태스크를 단일 표현(Representation)으로 처리하는 통합 네트워크 제안, 실시간 객체 검출 등 동시 수행.
VisionStyleSpace AnalysisYoutubeImage Generation스타일 공간(StyleSpace)을 분석해 이미지를 세부적으로 조작·생성하는 방법론 연구.
VisionRepresentative graph neural networkYoutubeRepresentative Graph, Dynamic Sampling, Semantic Segmentation그래프 신경망에 대표성(Representative) 개념을 도입해 동적 샘플링·의미론적 세그멘테이션 성능 개선.
VisionYOLOXYoutubeOne-Stage Object Detection ModelsYOLO 계열을 확장·개선한 원스테이지 검출 모델로 앵커 프리(anchor-free) 구조가 특징.
VisionJoint Contrastive Learning with Infinite PossibilitiesYoutubeContrastive Learning대조학습을 확장해 ‘무한’한 양상의 표현 학습 가능성을 모색, 다양한 뷰·도메인 통합 학습.
VisionAuto-DeepLab: Hierarchical Neural Architecture Search for Semantic Image SegmentationYoutubeImage Classification, Neural Architecture Search자동화된 계층형 아키텍처 탐색을 통해 세그멘테이션 모델을 최적 설계, 이미지 분류 등에도 적용 가능.
VisionExplaining in style training a gan to explain a classifier in stylespaceYoutubeImage ClassificationStyleSpace 기반으로 분류기의 결정 경로를 GAN으로 시각화·설명하는 접근.
VisionEnd-to-End Semi-Supervised Object Detection with Soft TeacherYoutubeInstance Segmentation, Object Detection반지도 학습에서 Teacher 모델을 소프트하게 결합해 물체 검출·인스턴스 분할 성능 향상.
VisionUnderstanding Dimensional Collapse in Contrastive Self Supervised LearningYoutubeContrastive Learning, Learning Theory대조학습 시 발생하는 표현 차원의 붕괴 현상을 이론적으로 분석하고, 이를 완화하는 방안 제시.
VisionEncoding in Style: a Style Encoder for Image-to-Image TranslationYoutubeConditional Image Generation, Face Generation스타일 인코더를 도입해 얼굴·이미지 변환 시 개별 스타일 요소를 보다 정확히 제어.
VisionDetection in Crowded Scenes: One Proposal, Multiple PredictionsYoutubeObject Detection, Pedestrian Detection혼잡한 장면에서 하나의 영역 제안으로 여러 객체(보행자 등)를 예측해 검출 정확도 높임.
VisionA Normalized Gaussian Wasserstein Distance for Tiny Object DetectionYoutubeObject Detection작은 물체 검출을 위해 정규화된 가우시안 Wasserstein 거리를 활용, 좌표 회귀를 안정화.
VisionSiamese Neural network for one-shot image recognitionYoutubeOne-Shot Learning쌍둥이(Siamese) 네트워크로 극소량 샘플(1샷)만으로 이미지 인식 가능.
VisionGrounded Language-Image Pre-trainingYoutubeObject Detection Phrase Grounding이미지와 언어를 연결해 사물 검출·어구(phrase) 정합을 사전학습으로 습득, 다양한 멀티모달 태스크에 적용.
VisionTransfer Learning for Pose Estimation of Illustrated CharactersYoutubeActivity Recognition, Pose Estimation일러스트(만화) 캐릭터 포즈 추정에 기존 인체 포즈 모델을 전이학습, 동작 인식 정확도 개선.
VisionSparse R-CNN: End-to-End Object Detection with Learnable ProposalsYoutubeObject Detection, Object Recognition사전에 학습된(proposal) 박스를 직접 예측·조정하는 방식으로, RCNN 단계를 간소화·속도↑
VisionNeRF: Representing Scenes as Neural Radiance Fields for View SynthesisYoutubeNeural Rendering, Novel View Synthesis신(scene)을 연속적 방사장(Radiance Field)으로 표현해 다양한 시점 뷰 합성(3D 렌더링) 가능.
VisionHRnet: Deep High-Resolution Representation Learning for Human Pose EstimationYoutubePose Estimation, Human Pose고해상도 특징 맵 유지 구조로 인체 포즈 추정 등에서 높은 정밀도 발휘.
VisionMobileViT : Light-weight, general-purpose, and Mobile-friendly Vision TransformerYoutubeMobile Vision Transformer, Lightweight Architecture모바일 환경에서도 효율적으로 동작하도록 설계된 경량 비전 트랜스포머 구조 제안.
VisionEffectively Leveraging Attributes for Visual SimilarityYoutubeAttribute-based Image Retrieval, Visual Similarity시각적 유사도 계산 시 속성(attributes)을 적극 활용해 검색·추천 품질 향상.
VisionHard Negative Mixing for Contrastive learningYoutubeContrastive Learning, Hard Negative Mining어려운 음성 샘플(하드 네거티브)을 혼합함으로써 대조학습 임베딩을 더욱 견고하게 학습.
VisionHOTR : Human-Object Interaction Detection with TransformerYoutubeHuman-Object Interaction Detection, Transformer사람과 사물의 상호작용(HOI)을 Transformer로 검출하여 행동 이해·분석에 활용.
VisionSSD: A UNIFIED FRAMEWORK FOR SELF-SUPERVISED OUTLIER DETECTIONYoutubeSelf-Supervised Outlier Detection자가 지도 방식으로 이상치(outlier) 검출을 수행하는 통합 프레임워크.
VisionStyleHEAT : One-Shot High-Resolution Editable Talking Face Generation via Pre-trained StyleGANYoutubeTalking Face, One-Shot Generation스타일GAN을 활용해 단일 얼굴 이미지만으로도 고해상도·편집 가능한 페이스 영상 생성 가능.
VisionSelf-Supervised Transformers for Unsupervised Object Discovery using Normalized CutYoutubeUnsupervised Object Discovery, Self-Supervised Transformers정규화 컷(NCut)과 트랜스포머 결합으로 라벨 없이 객체 분할 정확도 향상.
VisionTransfusion: Understanding Transfer Learning for Medical ImagingYoutubeMedical Imaging, Transfer Learning의료 영상에 특화된 전이학습 전략을 분석, 기존 대비 정확도·효율 개선.
VisionUCTransNetYoutubeMedical Segmentation, U-Net + TransformeU-Net과 트랜스포머를 결합해 의료 영상 분할에서 높은 정확도 달성.
VisionA Simple Baseline for Semi-supervised Semantic Segmentation with Strong Data AugmentationYoutubeSemi-supervised Semantic Segmentation, Data Augmentation강력한 증강 기법을 적용해 반지도 세그멘테이션의 기본 성능을 크게 끌어올린 방법론.
VisionVision Transformer with Deformable AttentionYoutubeDeformable Attention, Vision Transformer비정형(Deformable) 어텐션으로 스케일 변화가 큰 물체 인식 성능 개선.
VisionMore ConvNets in the 2020s: Scaling up Kernels Beyond 51x51 using SparsityYoutubeSparse Large-Kernel Conv, Scalable CNN51×51을 넘는 초대형 커널을 희소 기법으로 처리해 CNN의 확장성과 정확도 높임.
VisionPseCo: Pseudo Labeling and Consistency Training for Semi-Supervised Object DetectionYoutubeSemi-Supervised Object Detection, Consistency Regularization반지도 학습에서 의사 라벨링과 일관성 훈련을 결합, 적은 라벨로도 객체 검출 성능 향상.
VisionMetaFormer is Actually What You Need for VisionYoutubeTransformer Variation, MetaFormer“어텐션”보다 중요한 건 메타포머 구조라 주장, 다양한 비전 태스크에 적용 가능.
VisionAn Image is Worth 16x16 Words:Transformers for Image Recognition at ScaleYoutubeVision Transformer (ViT), Large-Scale Recognition이미지 패치를 토큰화한 대규모 트랜스포머로 분류, ViT의 효시가 된 연구.
VisionBigDatasetGAN: Synthesizing ImageNet with Pixel-wise AnnotationsYoutubeGAN-based Data Synthesis, Pixel-wise Annotation대규모 ImageNet 스타일 이미지를 픽셀 단위 주석까지 합성, 데이터 증강에 활용.
VisionHigh-Resolution Image Synthesis with Latent Diffusion Models (Stable Diffusion)YoutubeDiffusion Models, High-Resolution Image Generation잠재 공간에서 확산 모델을 적용해 고해상도 이미지를 생성, Stable Diffusion 아이디어의 핵심.
VisionProper Reuse of Image Classification Features Improves Object DetectionYoutubeFeature Reuse, Object Detection분류용으로 학습된 특징을 적절히 재사용하면 검출 성능을 크게 향상시킬 수 있음을 입증.
VisionVoxel Field Fusion for 3D Object DetectionYoutube3D Object Detection, Voxel Fusion다중 뷰(voxel field) 정보를 융합해 점구름 기반 3D 검출 정확도 향상.
VisionMedSefDiff: Medical Image Segmentation with Diffusion Probabilistic ModelYoutubeMedical Image Segmentation, Diffusion Models확산(디퓨전) 확률 모델을 의료 영상 세그멘테이션에 적용해 정밀도 높임.
VisionPix2SeqYoutubeUnified Generation Approach, Object Detection객체 검출을 시퀀스 생성 문제로 전환하여 단일 프레임워크에서 처리.
VisionSelf-Supervised Learning based on Heat EquationYoutubeSelf-Supervised Representation, Heat Equation열 방정식 기반 자가 지도 접근으로 안정적인 특징 학습을 구현.
VisionCliff Diving : Exploring Reward Surfaces in Reinforcement Learning EnvironmentsYoutubeReinforcement Learning, Reward SurfacesCliff Diving 환경에서 보상 지형(Reward Surface)을 분석해 RL 동작 특성 파악.
VisionWHAT DO VISION TRANSFORMERS LEARN?A VISUAL EXPLORATIONYoutubeVision Transformer, InterpretabilityViT 내부에서 어떤 시각 패턴을 학습하는지 시각화·해석.
VisionInternImage: Exploring Large-Scale Vision Foundation Models with Deformable ConvolutionsYoutubeFoundation Models, Deformable Convolution대규모 비전 기본 모델에 변형가능 컨볼루션을 적용해 정확도·효율 동시 개선.
VisionCut and Learn for Unsupervised Object Detection and Instance SegmentationYoutubeUnsupervised Detection, Instance Segmentation라벨 없이 객체를 잘라내(cut) 학습하며 동시에 객체 감지와 인스턴스 세그멘테이션을 달성.
VisionThe Forward-Forward Algorithm: Some Preliminary InvestigationsYoutubeForward-Forward Training, Alternative Backprop역전파 없이 전방(Forward) 단계만 반복해 학습하는 대안적 기법 초기 연구.
VisionVisual Prompt TuningYoutubePrompt Tuning, Vision Transformers기존 비전 모델에 프롬프트(시각 템플릿)를 추가해 특정 태스크로 효율적 전이.
VisionDataset Distillation by Matching Training TrajectoriesYoutubeDataset Distillation, Efficient Retraining모델 학습 과정을 모사·압축한 데이터셋으로 빠른 재학습·전이 가능.
VisionYOLO v6YoutubeOne-Stage Object Detection, YOLO SeriesYOLO 계열 최신 버전으로, 경량화·정확도 모두 개선한 객체 검출 프레임워크.
VisionInstructBLIP: Towards General-purpose Vision-Language Models with Instruction TuningYoutubeVision-Language, Instruction Tuning시각+언어 모델에 지시문(Instruction)을 학습해 다목적 태스크 수행 능력 강화.
VisionImageBind One Embedding Space To Bind Them AllYoutubeMulti-modal Embedding, Universal Representation텍스트·오디오·이미지 등 여러 모달을 단일 임베딩 공간으로 통합해 범용 표현.
VisionLearning to Generate Text grounded Mask for Open world Semantic Segmentation from Only Image-Text PairsYoutubeOpen-world Segmentation, Vision-Language이미지-텍스트 쌍만으로 세그멘테이션 마스크를 생성, 오픈월드 환경에 적용 가능.
VisionDrag Your GAN: Interactive Point-based Manipulation on the Generative Image ManifoldYoutubeGAN-based Image Editing, Interactive ManipulationGAN 잠재공간에서 포인트 드래그 방식으로 직관적 이미지 편집·변형.
VisionSegment Anything in High QualityYoutubeHigh-Quality Segmentation, SAMSegment Anything 모델을 개선해 고화질·정확도 높은 세분화 제공.
VisionMulti Domain Learning for Motion MagnificationYoutubeMotion Magnification, Multi-Domain Learning다양한 도메인에서 미세한 움직임을 증폭해 관찰하도록 학습, 의료·산업 등 활용 가능.
Vision3D Gaussian Splatting for Real Time Radiance Field RenderingYoutubeNeRF Rendering, Real-time3D 점 클라우드에 가우시안 스플랫을 적용, 실시간 방사장(NeRF) 렌더링 구현.
VisionVoxelNet End-to-End Learning for Point Cloud Based 3D Object DetectionYoutube3D Object Detection, Voxel-based NetworksVoxelNet 구조로 점구름(포인트 클라우드) 입력을 직접 학습, 3D 검출 정확도 개선.
VisionDreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven GenerationYoutubeText-to-Image Diffusion, Subject-driven Generation텍스트→이미지 확산 모델을 특정 주제나 스타일에 맞춰 파인튜닝, 맞춤형 이미지 생성 가능.
VisionMIC Masked Image Consistency for Context Enhanced Domain AdaptationYoutubeDomain Adaptation, Masked Consistency마스킹된 이미지를 활용해 도메인 적응 시 맥락 정보 일관성을 유지, 성능 강화.
Vision / RoboticsVGGT: Visual Geometry Grounded TransformerYoutube3D Reconstruction, Visual Geometry, Foundation Model별도의 복잡한 최적화 없이 이미지 기반 3D 구조 이해를 수행하는 비전 지오메트리 모델로, 3D 인식·재구성의 실용성을 높임.
Vision / RoboticsLAPA: Learning Action Priors without Action LabelsYoutubeRobot Learning, Action Prior, Vision-Language-Action명시적인 로봇 액션 라벨 없이도 행동 prior를 학습하여 로봇 제어 데이터 구축 비용을 낮추는 접근.
Vision / RoboticsNVIDIA GR00T N1YoutubeHumanoid Robot, Vision-Language-Action, Robotics Foundation Model휴머노이드 로봇을 위한 범용 파운데이션 모델 방향성을 제시하며, 언어·시각·행동을 통합한 로봇 지능 구현을 목표로 함.
Vision / RoboticsSmolVLA: A Vision Language Action Model for Affordable and Efficient RoboticsYoutubeVision-Language-Action, Robotics, Efficient Model저비용·고효율 로봇 제어를 위해 경량 VLA 모델을 제안, 실제 로봇 적용 가능성을 높임.
Vision / RoboticsRDT-1B: A Diffusion Foundation Model for Bimanual ManipulationYoutubeDiffusion Policy, Bimanual Manipulation, Robotics양팔 로봇 조작을 위한 대규모 디퓨전 기반 파운데이션 모델로, 복잡한 조작 행동을 생성적으로 학습.
Vision / RoboticsAnyGrasp: Robust and Efficient Grasp Perception in Spatial and Temporal DomainsYoutubeGrasp Detection, 3D Perception, Robotics공간적·시간적 정보를 함께 활용해 다양한 환경에서 안정적인 로봇 grasp perception을 수행.
Vision-LanguageInternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic TasksYoutubeVision Foundation Model, VLM, Multimodal Alignment대규모 비전 파운데이션 모델을 확장하고 언어 모델과 정렬하여 범용 시각-언어 태스크 성능을 강화.
Vision-LanguageYour Large Vision-Language Model Only Needs A Few Attention Heads For Visual GroundingYoutubeVisual Grounding, Attention Head Analysis, LVLM대형 VLM의 시각적 위치 이해가 소수의 attention head에 집중된다는 점을 분석해 모델 해석성과 효율화 가능성을 제시.
VisionBoosting Cross-Spectral Unsupervised Domain Adaptation for Thermal Semantic SegmentationYoutubeThermal Segmentation, UDA, Cross-Spectral LearningRGB와 열화상 간 도메인 차이를 줄여 열화상 세그멘테이션 성능을 높이는 비지도 도메인 적응 연구.
Recommend SystemMatrix Factorization Technique for Recommender SystemYoutube
paper
Recommendation system사용자-아이템 행렬 분해 기법으로 대규모 협업필터링 구현, 넷플릭스 등에서 성능 입증.
Recommend SystemCollaborative Filtering for Implicit Feedback DatasetYoutuberecommender systems, Collaborative Filtering묵시적 피드백(조회·클릭) 기반 사용자 취향 예측을 협업필터링으로 처리하는 방법론.
SpeechA comparison of S2S models for speech recognitionYoutube
paper
Speech Recognition음성인식에서 여러 S2S(seq2seq) 모델을 비교·분석하여 장단점 파악 및 성능 비교.
FundamentalRAdamYoutube
blog
paper
Regularization, Stochastic OptimizationAdam의 변동성 문제를 레디언스(RA) 항으로 보정해 안정적 훈련 가능.
FundamentalStacked Auto Encoder for the P300 Component DetectionYoutubebrain-computer interfaces뇌-컴퓨터 인터페이스에서 P300 신호 검출을 쌓은 오토인코더로 수행, 정확도 상승.
FundamentalA survey on Image Data Augmentation for DLYoutube
paper
Data augmentation, 3D Human Pose Estimation이미지 증강 기법을 종합적으로 정리, 3D 포즈 추정 등 다양한 태스크 성능 향상에 활용.
FundamentalTraining Confidence-calibrated classifiers for detecting out of distribution samplesYoutubeclassifiers분류 모델이 OOD(분포외) 샘플을 탐지하도록 신뢰도 보정(Confidence Calibration) 훈련 기법.
FundamentalAdamWYoutube
blog
stochastic optimizationAdam + Weight Decay 분리로 일반화 성능 향상을 꾀한 최적화 기법.
FundamentalStarganYoutubeImage-to-Image Translation, Translation다중 도메인 간 이미지 변환을 하나의 모델로 통합, 얼굴 표정·헤어스타일 등 변경 가능.
FundamentalDrop-outYoutubeDropout, Data augmentation뉴런 일부를 무작위로 비활성화해 과적합 억제, 일반화 성능 향상.
FundamentalBLEU: a Method for Automatic Evaluation of Machine TranslationYoutubeevaluation기계 번역 결과 품질을 n-그램 중복도로 측정하는 BLEU 지표 제안, 이후 표준 평가척도로 활용.
Fundamentalt-SNEYoutubeDimensionality Reduction고차원 데이터(임베딩 등)를 2D·3D로 시각화해 구조 파악에 유용.
FundamentalGpipeYoutubeSynchronous Pipeline Parallel, Model Parallel Methods대형 모델 병렬화를 파이프라인 단위로 분할해 메모리 사용 효율 및 학습 속도 향상.
Fundamentalexplainable aiYoutubeinterpretability, sensitivity analysis모델의 결정 과정을 해석·민감도 분석해 신뢰도·투명성 향상.
FundamentalTAPASYoutubeDeep Tabular Learning, Table Question Answering Models테이블 QA에 특화된 변형 BERT 모델로, 행·열 정보를 활용해 정교한 질의응답 수행.
FundamentalLearning both Weights and Connections for Efficient Neural NetworksYoutubeNeural networks가중치와 연결(pruning)을 동시에 학습, 신경망 경량화와 정확도 유지 추구.
FundamentalReVACNNYoutubeVisualization, Convolutional Neural NetworkCNN 내부 특징 맵을 시각화·분석하는 기법으로 모델 해석력을 높임.
FundamentalThe Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural NetworksYoutubeNetwork Pruning일부 가중치만 남겨도 초기화 시드가 동일하면 원래 수준 성능 달성 가능, 소위 ‘승리 티켓’ 가설 제시.
FundamentalALPHAGO : Mastering the game of Go with Deep Neural Networks and Tree SearchYoutubedeep neural networks, tree search정책망·가치망+몬테카를로 트리 탐색으로 바둑에서 프로기사 수준 초월, AI 역사적 성과.
FundamentalA Baseline for Few-Shot Image ClassificationYoutubeFEW-SHOT IMAGE CLASSIFICATION소량 샘플로 분류하는 경우에 대한 베이스라인 접근을 정립, 후속 연구 지표로 활용.
FundamentalSharp Minima Can Generalize For Deep NetsYoutubedeep learning architectures날카로운(Sharp) 최소점이 실제 일반화에 불리하다는 통념에 반대되는 실험 결과 제시.
FundamentalPediatric Sleep Stage Classification Using Multi-Domain Hybrid Neural NetworksYoutubeMulti-Domain Hybrid Neural Networks여러 도메인(EEG 등) 특징을 융합한 하이브리드 모델로 소아 수면 단계 분류 성능 향상.
FundamentalPruning from ScratchYoutubeNetwork Pruning처음부터 가지치기 구조로 학습을 시도, 기존 프루닝+재학습 절차 대비 효율적 가능성 탐색.
FundamentalDo We Need Zero Training Loss After Achieving Zero Training Error?YoutubeTraining Loss학습 오류가 0이 된 뒤에도 로스를 계속 낮출 필요가 있는지, 모델 일반화 관점에서 분석.
FundamentalDeep Recurrent Q-Learning for Partially Observable MDPsYoutubeAtari Games, OpenAI Gym부분 관측 MDP 환경에서 RNN+DQN으로 에이전트가 향상된 정책 학습 가능.
FundamentalLarge Margin Deep Networks for ClassificationYoutubeClassification, Data Augmentation마진 극대화 개념을 심층 신경망에 적용, 이미지 분류 등에서 일반화 성능 향상.
Fundamentalgenerating wikipedia by summarizing long sequencesYoutubeDocument Summarization, Extractive Summarization긴 시퀀스를 요약해 위키백과 페이지를 자동으로 생성·편집하는 접근.
FundamentalPlug and Play Language Models: A Simple Approach to Controlled Text GenerationYoutubeLanguage Modelling, Text Generation사전학습된 LM에 제약(컨트롤) 모듈만 추가해 원하는 스타일·주제의 텍스트 생성 가능.
FundamentalWhat Uncertainties Do We Need in Bayesian Deep Learning for Computer Vision?YoutubeDepth Estimation, Semantic Segmentation컴퓨터 비전에서 필요한 불확실성(에피스테믹·알레이터릭) 유형을 구분해 모델 신뢰성 높임.
FundamentalKREDYoutubeEntity Embeddings, News Recommendation뉴스 추천에서 개체(entity) 임베딩을 도입해 사용자 맞춤형 기사 배치를 정교화.
FundamentalDIFUSCO: Graph based Diffusion Solvers for Combinatorial OptimizationYoutubeDiffusion, solver그래프 기반 확산(diffusion) 기법으로 조합 최적화 문제(경로찾기 등)를 효과적으로 푸는 접근.
FundamentalEarly Stopping as nonparametric VariationalYoutubeVariational Inference조기 종료(Early Stopping)를 비모수적 변분 추론 관점으로 해석, 과적합 방지 설명 제공.
FundamentalSharpness Aware Minimization for efficeintly improving generalizationYoutubeGENERALIZATION손실 지형의 샤프니스(Sharpness)를 낮춰 일반화 성능을 높이는 SAM(Sharpness-Aware Minimization).
FundamentalNeural Graph Collaborative FilteringYoutubeCollaborative Filtering, Link Prediction그래프 기반 협업필터링 모델로, 사용자-아이템 링크를 예측·추천.
FundamentalRestricting the Flow: Information Bottlenecks for AttributionYoutubeDecision Making정보 병목(Bottleneck)을 활용해 모델 결정 경로를 추적·공헌도 측정(Attribution).
FundamentalReal world Anomaly Detection in Surveillance VideosYoutubeActivity Recognition, Anomaly Detection In Surveillance Videos실제 감시 영상에서의 이상 행동 감지를 위한 효율적인 딥러닝 접근.
FundamentalBRECQ: Pushing the Limit of Post-Training Quantization by Block ReconstructionYoutubeImage Classification Object Detection블록 단위 재구성을 통한 정밀한 후처리 양자화 기법, 분류·검출 모두 높은 성능 유지.
FundamentalDeep sets (2017 NIPS)Youtubedesigning models집합 입력을 순서와 무관하게 처리하는 딥셋(DeepSets) 아이디어 제시, 대칭 함수 기반 학습.
FundamentalStyleGAN2YoutubeGenerative Adversarial Networks, Generative Models업그레이드된 아키텍처로, 더욱 사실적이고 다채로운 이미지를 생성할 수 있는 GAN 모델.
FundamentalBeyond Synthetic Noise: Deep Learning on Controlled Noisy LabelsYoutubeImage Classification인위적으로 제어된 노이즈 라벨 환경에서의 딥러닝 성능 분석, 노이즈 강인성 연구.
FundamentalDeep Reinforcement Learning for Online Advertising Impression in Recommender SystemsYoutubeRecommendation Systems온라인 광고 노출(Impression)을 강화학습으로 최적화, 추천 시스템 수익 극대화 시도.
FundamentalLongformer: The Long-Document TransformerYoutubeLanguage Modelling, Question Answering희소 어텐션(sparse attention)으로 긴 문서(최대 수천~수만 토큰) 처리 가능, QA·분류 성능 향상.
Fundamentalsoft actor criticYoutubePolicy Gradient Methods액터-크리틱에 엔트로피 보상을 추가해 탐색 다양성·학습 안정성을 높이는 강화학습 기법.
FundamentalLoss Function Discovery for Object Detection via Convergence-Simulation Driven SearchYoutubeObject Detection, Loss Function Search시뮬레이션 기반 탐색으로 최적의 손실 함수를 자동으로 찾는 기법을 객체 검출에 적용.
FundamentalThe Deep Bootstrap Framework: Good Online Learners are Good Offline GeneralizersYoutubeOnline Learning, Bootstrap Framework온라인에서 잘 학습하는 부트스트랩 기법이 오프라인 일반화에도 유리함을 보임.
FundamentalMeta HINYoutubeHeterogeneous Info Networks, Graph Representation이기종 정보 네트워크(heterogeneous graph) 상에서 메타 러닝 기법을 적용해 구조적 표현을 학습.
FundamentalWhen Vision Transformers Outperform ResNets without Pretraining or Strong Data AugmentationsYoutubeDomain Generalization, Fine-Grained Classification별도 사전학습이나 강력한 증강 없이도 비전 트랜스포머가 레스넷보다 우수한 결과를 보이는 케이스 분석.
FundamentalSelf similarity Student for Partial Label Histopathology Image SegmentationYoutubePartial-Label, Histopathology Segmentation부분 라벨(Partial Label) 환경의 조직 이미지(병리) 세그멘테이션에서 자가 유사도 방식 활용.
FundamentalANALYSING MATHEMATICAL REASONING ABILITIES OF NEURAL MODELSYoutubeMath Reasoning, Word Problem Solving신경망의 수학 추론(문제 풀이) 능력을 평가하고 한계를 분석한 연구.
FundamentalSelf-training Improves Pre-training for Natural Language UnderstandingYoutubeSelf-training, Few-Shot Learning셀프 트레이닝을 통해 NLU 사전학습 모델의 적은 데이터 환경 성능을 향상.
FundamentalPreference Amplification in Recommender SystemsYoutubeRecommender Systems, Preference Amplification추천 시스템에서 사용자 취향이 극단적으로 증폭되는 현상을 분석·완화하는 연구.
FundamentalDo We Really Need to Access the Source Data? Source Hypothesis Transfer for Unsupervised Domain AdaptationYoutubeSource Hypothesis Transfer, Unsupervised Domain Adaptation소스 데이터를 직접 접근하지 않고도 가설(모델 파라미터)만으로 도메인 적응을 수행하는 기법 제안.
FundamentalLearning to Learn at Test Time RNNsYoutubeMeta-Learning, Test-Time Adaptation테스트 단계에서도 순환신경망(RNN)이 자체 학습(메타 러닝)을 수행해 예측 성능 개선.
FundamentalDouble Gumbel Q-LearningYoutubeRL, Double Q-Learning, Gumbel Noise이중 Q-Learning에 Gumbel 분포 노이즈를 사용해 탐색성과 안정성을 높인 강화학습 기법.
FundamentalConfidence Estimation Using Unlabeled DataYoutubeConfidence Estimation, Semi-supervised Learning라벨이 없는 데이터를 활용해 분류 모델의 신뢰도(Confidence)를 추정·보정.
FundamentalEvaluating Classifiers by Means of Test Data with Noisy LabelsYoutubeClassifier Evaluation, Noisy Labels라벨 노이즈가 있는 테스트 데이터에서 분류기를 평가하는 방법 제안.
FundamentalProgressive Identification of True Labels for Partial-Label LearningYoutubePPartial Label Learning, Progressive Label Refinement부분 라벨 환경에서 점진적으로 진짜 라벨을 식별해 학습 정밀도를 높이는 접근.
FundamentalFine-grained Interest Matching For Neural News RecommendationYoutubeNews Recommendation, Fine-grained Matching뉴스 추천에서 세분화된 사용자 관심사(interest) 매칭을 통해 추천 품질 향상.
FundamentalAdversarial Reinforced Learning for Unsupervised Domain AdaptationYoutubeTransfer Learning, RL-based Domain Adaptation강화학습과 적대적(Adversarial) 방식을 결합해 도메인 적응 시 라벨 없는 데이터 활용도 개선.
FundamentalNeural Tangent Kernel - Convergence and Generalization in neural NetworkYoutubeNeural Tangent Kernel, Gaussian Process NTK관점에서 신경망의 수렴·일반화 특성을 분석, 가우시안 프로세스와의 유사점 탐구.
FundamentalIntriguing Properties of Contrastive LossesYoutubeContrastive Learning, Data Augmentation대조학습 손실 함수들의 숨은 특성·데이터 증강 전략이 모델 임베딩에 미치는 영향 탐색.
FundamentalGrokking: Generalization Beyond Overfitting on Small Algorithmic DatasetsYoutubeAlgorithmic Generalization, Overfitting작은 알고리즘 데이터셋에서 한참 오버피팅 후 갑작스런 일반화(grokking) 현상을 분석한 연구.
FundamentalTransformer Interpretability Beyond Attention VisualizationYoutubeTransformer Explanation, Interpretation트랜스포머 해석 시 어텐션 시각화만으로는 부족, 추가 기법으로 내부 작동 원리 파악 시도.
FundamentalHow does unlabeled data improve generalization in self-training?YoutubeSelf-training, Semi-supervised Learning라벨 없는 데이터가 셀프 트레이닝에서 일반화 성능 향상에 기여하는 원리를 분석.
FundamentalRainbow: Combining Improvements in Deep Reinforcement LearningYoutubeRainbow DQN, Montezuma's Revenge DQN계열 기법(우선순위 리플레이·NoisyNet 등)을 결합한 Rainbow가 고난이도 게임을 잘 해결.
FundamentalOnce-for-All: Train One Network and Specialize it for Efficient DeploymentYoutubeNeural Architecture Search, Model Specialization단 한 번의 거대 네트워크 학습 후, 기기별 요구사항에 맞춰 하위 네트워크를 추출·사용.
FundamentalEffective Diversity in Population Based Reinforce LearningYoutubePopulation-based RL, Diversity Optimization개체군(인구) 기반 RL에서 다양성 유지를 통해 탐색 성능과 수렴성을 향상.
FundamentalFine-Tuning can Distort Pretrained Features and Under perform Out-of-DistributionYoutubeFine-tuning Instability, OOD Generalization파인튜닝 과정이 사전학습된 특징을 망가뜨려 OOD 일반화 성능이 떨어지는 문제 고찰.
FundamentalGCN-LRP explanationexploring latent attention of graph convolutional networksYoutubeGraph Interpretability, GCN Explanation그래프 합성곱 네트워크(GCN)의 예측 근거를 LRP(Layer-wise Relevance Propagation) 방식으로 해석.
FundamentalGQA : Training Generalized Multi Query Transformer Models from Multi Head CheckpointYoutubeMulti-Query Transformer, Checkpoint Merging멀티 헤드 체크포인트를 합쳐 다목적 질의(Q) 트랜스포머 모델로 훈련.
FundamentalTowards Safe Online Reinforced Learning in Computer SystemsYoutubeSafe Online RL, Computer Systems실제 컴퓨터 시스템 환경에서 안전(safety) 제약을 고려한 온라인 RL 연구.
FundamentalConflict-Averse Gradient Descent for Multi-task LearningYoutubeMulti-task Learning, Gradient-based Optimization여러 태스크 간 충돌을 줄이는 경사하강 기법으로 멀티태스크 학습 효율 향상.
FundamentalExplainability Methods for Graph Convolutional Neural NetworksYoutubeGraph Explainability, GCNGCN 모델을 해석하기 위한 다양한 방법론(서브그래프 추출 등) 정리.
FundamentalBayesian Action Decoder for Deep Multi-Agent Reinforcement LearningYoutubeMulti-Agent RL, Bayesian Inference다중 에이전트 강화학습에서 액션 디코더를 베이지안 방식으로 설계해 불확실성·상호작용 처리.
FundamentalEfficiently Identifying Task Grouping for Multi-Task LearningYoutubeMulti-Task Learning, Task Grouping 여러 태스크를 효과적으로 묶어 학습 비용·성능을 최적화하는 방법론.
FundamentalDeepFM: A Factorization-Machine based Neural Network for CTR PredictionYoutubeCTR Prediction, Recommendation팩터라이제이션 머신(FM)과 딥러닝을 결합해 클릭확률 예측(CTR) 정확도 향상.
FundamentalDeep Neural Networks for YouTube RecommendationsYoutubeYouTube Recommendation, Ranking유튜브 대규모 추천 시스템에 특화된 딥러닝 구조로 실시간 사용자 맞춤 추천 구현.
FundamentalGenome wide prediction of disease variant effects with a deep protein langYoutubeProtein LM, Disease Variant Prediction단백질 언어모델을 활용해 질병 관련 유전자 변이의 영향을 전장(Genome-wide) 예측.
reinforcement learningReinforcement Learning for Optimizing RAG for Domain ChatbotsYoutubeRAG Optimization, Chatbot RL도메인 챗봇에서 RAG(Retrieval-Augmented Generation)을 강화학습으로 최적화.
reinforcement learningDeep reinforcement learning from human preferencesYoutubeHuman-in-the-Loop RL, Preference Learning인간의 선호도 신호를 이용해 RL 에이전트를 학습, 보상 함수 추정 없이 정책 최적화.
reinforcement learningDistributional Reinforcement Learning via Moment MatchingYoutubeDistributional RL, Moment Matching Q함수를 분포로 다루는 Distributional RL 기법에서 모멘트 매칭으로 학습 안정화.
reinforcement learningOnline Continual Learning on class Incremental Blurry Task Configuration with anytime inferenceYoutubeContinual RL, Class-Incremental순차적·증분적 태스크 환경에서 RL 에이전트가 지속적으로 학습·추론하는 방법 제안.
reinforcement learningDream To Control : Learning Behaviors by Latent ImaginationYoutubeModel-Based RL, Dreamer Approach잠재공간에서 ‘꿈(rollout)’을 만들어 행동 정책을 학습하는 Dreamer 방식 확장.
reinforcement learningProximal Policy Optimization AlgorithmsYoutubePolicy Gradient, PPO KL발산을 이용해 정책 갱신 폭을 제한, 샘플 효율성과 안정성을 높인 RL 기법.
reinforcement learningReinforced Genetic Algorithm Learning for Optimizing Computation GraphsYoutubeGenetic Algorithm, RL for Computation Graph GA와 RL을 결합해 연산 그래프 최적화(컴파일러 최적화 등)에 적용.
reinforcement learningVariBAD: A Very Good Method for Bayes-Adaptive Deep RL via Meta-LearningYoutubeBayes-Adaptive RL, Meta-Learning환경 불확실성을 베이지안으로 다루고, 메타학습을 통해 빠른 적응을 구현하는 RL 기법.
reinforcement learningmPLUG: Effective and Efficient Vision-Language Learning byCross-modal Skip-connectionsYoutubeVision-Language Model, Cross-Modal Learning스킵 연결로 멀티모달(이미지+텍스트) 학습 효율을 높이는 mPLUG 아키텍처. (RL과 직접 관련은 미미하지만, 섹션상 RL로 분류됨)
reinforcement learningMOReL: Model-Based OfflineReinforcement LearningYoutubeOffline RL, Model-Based실제 환경 데이터 없이 모델(환경 시뮬레이션)로 학습하는 오프라인 강화학습 기법.
reinforcement learningRL upside downYoutubeReverse RL, Goal-Conditioned보상 대신 목표 상태부터 행동을 추론하는 역발상 RL 접근, 목표 지향 문제에 적용.
reinforcement learningTrans DreamerYoutubeTransformer-based Dreamer, Model-Based RL Dreamer모델을 트랜스포머 구조로 확장해 장기 시퀀스 행동 계획 정확도 개선.
reinforcement learningDirect Preference Optimization Your Language Model is Secretly a Reward ModelYoutubeLLM as Reward Model, Preference Optimization언어모델(LLM)을 보상 모델로 간주해 직접 선호 최적화(Direct Preference Optimization) 수행.
reinforcement learningTrajectory TransformerYoutubeDecision Transformer, Sequence Modeling행동 궤적(trajectory)을 트랜스포머로 모델링해 RL 문제를 시퀀스 예측으로 접근.
reinforcement learningAddressing Optimism Bias in Sequence Modeling for RLYoutubeSequence Modeling RL, Optimism Bias시퀀스 모델 기반 RL에서 과도한 낙관 편향(optimism bias)을 완화하는 방법 연구.
reinforcement learningOnline Decision TransformerYoutubeOnline RL, Decision Transformer의사결정 트랜스포머(Decision Transformer)를 온라인 학습 시나리오로 확장한 기법.
reinforcement learningRLPROMP: Optimizing Discrete Text Prompts with Reinforcement LearningYoutubePrompt Optimization, RL for NLP NLP프롬프트를 RL로 최적화해, 원하는 응답·출력 양식을 유도하는 기법 (Discrete Prompt).
Vision-LanguageQPrompt: Quantized Prompt for Efficient Generalization of Vision Language ModelYoutubeQuantized Prompt, VLM Generalization, Efficient Adaptation비전-언어 모델의 일반화 성능을 높이기 위해 프롬프트를 양자화하여 효율적인 적응을 수행.
Reinforcement LearningVCRL: Variance Based Curriculum Reinforcement Learning for Large Language ModelYoutubeCurriculum RL, LLM Alignment, Variance-based Learning분산 기반 커리큘럼을 활용해 LLM 강화학습의 안정성과 학습 효율을 높이는 접근.
Vision / Generative ModelDiffusion LMMs Can Do Faster-Than-AR Inference via Discrete Diffusion ForcingYoutubeDiffusion LMM, Faster-than-AR, Generative Modeling이산 디퓨전 포싱을 통해 자동회귀 방식보다 빠른 멀티모달 생성 가능성을 제시.
Person Re-IDFrom Poses to Identity: Training-Free Person Re-Identification via Feature CentralizationYoutubePerson Re-ID, Training-Free Method, Feature Centralization별도 학습 없이 포즈와 특징 중심화를 활용해 사람 재식별 성능을 확보하는 방법.
Vision-Language / PreferenceOViP: Online Vision-Language Preference LearningYoutubePreference Learning, Vision-Language Model, Online Learning온라인 선호 학습을 통해 VLM이 사용자 의도와 시각적 판단 기준에 더 잘 맞도록 조정.

Latest uploads & scheduled releases (2026–2027)

The 19 reviews below were restored from the meeting archive with custom thumbnails, paper-based descriptions, and SRT captions. Videos are released every Monday at 20:00 KST in presentation-date order.

Release (KST)TaskPaperLinksHighlights
2026-08-31Vision / MultimodalC-MPDRYouTube · Paper정합과 융합을 한 단계에서 수행해 멀티모달 영상의 고스트와 왜곡을 줄입니다.
2026-09-07Video GenerationLTX-VideoYouTube · PaperVideo-VAE와 latent diffusion으로 5초 영상을 실시간보다 빠르게 생성합니다.
2026-09-14Vision / DetectionYOLO-WorldYouTube · Paper텍스트 프롬프트로 처음 보는 클래스까지 실시간 탐지하는 open-vocabulary detector입니다.
2026-09-21Generative ModelSimple Guidance Mechanisms for Discrete Diffusion ModelsYouTube · Paper연속 확산의 guidance를 이산 공간으로 확장해 생성 결과를 조건에 맞게 제어합니다.
2026-09-28LLM / ReasoningDon't Overthink ItYouTube · Paper짧은 추론 경로 선호가 정확도와 토큰 효율을 함께 높일 수 있음을 분석합니다.
2026-10-05Autonomous DrivingAdaRIPYouTube · Paper분포 이동을 감지하고 안전하게 회복하며 전문가 피드백으로 온라인 적응합니다.
2026-10-12LLM / ReasoningDeepConfYouTube · Paper내부 confidence로 낮은 품질의 추론 경로를 걸러 test-time reasoning을 효율화합니다.
2026-10-19Robotics / VLASmolVLAYouTube · Paper약 450M 파라미터로 소비자용 하드웨어에서도 동작하는 경량 VLA 모델입니다.
2026-10-26NLP / RAGREFRAGYouTube · Paper검색 문맥을 압축·선별해 긴 컨텍스트와 빠른 첫 토큰 생성을 함께 달성합니다.
2026-11-02LLM / Fine-TuningAnalyzing the Effects of Supervised Fine-Tuning on Model KnowledgeYouTube · PaperSFT 데이터 증가가 항상 지식 향상으로 이어지지 않는 현상을 분석합니다.
2026-11-09NLP / Diffusion LMScaling Up Masked Diffusion Models on TextYouTube · Papermasked diffusion LM의 스케일링 특성과 양방향·비자동회귀 생성 가능성을 보입니다.
2026-11-16Speech / MultimodalFreeze-OmniYouTube · PaperLLM을 고정한 채 음성 모듈만 학습해 저지연 speech-to-speech 대화를 구현합니다.
2026-11-23Vision / Generative ModelScalable Diffusion Models with Transformers (DiT)YouTube · PaperU-Net 대신 Transformer를 사용하고 모델 규모에 따른 확산 모델의 성능 향상을 보입니다.
2026-11-30Vision / Generative ModelScaling Rectified Flow Transformers for High-Resolution Image SynthesisYouTube · Paperrectified flow와 멀티모달 Transformer를 결합한 고해상도 이미지 생성 방법입니다.
2026-12-07NLP / RAGMiniRAGYouTube · Paper작은 언어 모델에서도 동작하는 단순하고 저장 효율적인 graph-based RAG를 제안합니다.
2026-12-14Vision / State Space ModelVMambaYouTube · Paper2D selective scan으로 전역 시각 문맥을 선형 시간에 모델링합니다.
2026-12-21Robotics / VLAπ0: A Vision-Language-Action Flow Model for General Robot ControlYouTube · PaperVLM과 flow-matching action expert를 결합해 여러 로봇의 연속 동작을 생성합니다.
2026-12-28Reinforcement LearningEvolution Strategies at the Hyperscale (EGGROLL)YouTube · Paper저랭크 perturbation으로 역전파 없이 대규모 모델의 진화 전략 학습을 확장합니다.
2027-01-04Vision / Self-Supervised LearningWhat Do Self-Supervised Vision Transformers Learn?YouTube · Paper대조학습과 masked image modeling이 ViT에서 학습하는 표현의 차이를 분석합니다.
deeplearning
deep-learning-tutorial

Contributors

diversity12

25 commits

Lilcob

24 commits

Lilcob/-DL_PaperReadingMeeting

Deep Learning Paper Reading Meeting-Archive

HTML

248

49 commits

updated Sep 1, 2026

See the code

README

Deep learning Paper Reading Meeting Archive

Last updated: 2026-09-01 (KST) · YouTube channel This page is an archive of the Deep Learning Paper Reading Meeting. you would like to attend the meeting or have any questions, Write in the GitHub issue table or email us at 'tfkeras@kakao.com'

TasksPaperLinkPerformance IndexHighlights
NLPAttention is all you needYoutube
Paper
Abstractive Text Summarization, Constituency Parsing완전한 어텐션 기반(Transformer) 모델을 제안하여, RNN/CNN을 사용하지 않고도 SOTA 달성.
NLPBERTYoutube
paper
Autoencoding Transformers, Transformers, Language Models마스크드 LM과 NSP 기법을 통해 범용적인 언어 이해 성능을 혁신적으로 향상.
NLPERNIEYoutube
paper
Chinese Named Entity Recognition, Chinese Sentence Pair Classification지식 그래프를 통합하여 중국어에 특화된 언어 모델 성능을 높임.
NLPRoBERTaYoutube
paper
Autoencoding Transformers, Transformers더 많은 데이터와 긴 학습, 대규모 배치를 활용해 BERT보다 높은 성능 달성.
NLPXLNETYoutube
paper
Autoregressive Transformers, Transformers순열 기반 언어 모델링으로 BERT의 NSP 한계를 극복하고 성능을 개선.
NLPSentenceBertYoutubeLinear-Probe Classification, Semantic SimilarityBERT를 문장 임베딩에 최적화하여 문장 간 유사도 계산을 간단하면서도 효과적으로 수행.
NLPDefending Against neural fake newsYoutubeFake News Detection, Text GenerationGPT류 모델이 생성한 텍스트와 실제 뉴스 텍스트를 구분하기 위한 방법론 제안 및 실험.
NLPTransformer-XLYoutube
blog
Language Modelling긴 시퀀스 처리를 위해 세그먼트 메모리를 순환적으로 연결하는 새로운 구조 제안.
NLPUnderstanding back translation at scaleYoutube
blog
Machine Translation, Translation대규모 역번역(back-translation) 실험을 통해 번역 품질 향상을 체계적으로 분석.
NLPDeep Contextualized Word RepresentationsYoutubeCitation Intent Classification , Conversational Response Selection문맥에 따라 단어 임베딩이 동적으로 변하는 ELMo를 통해 다양한 NLP 태스크 성능 향상.
NLPUniviersal LM Fine-tuning for text classificationYoutubeClassification, General Classification범용 언어 모델 사전학습 후 파인튜닝 방식을 제안해 소규모 데이터에서도 뛰어난 성능 달성.
NLPSubword-level Word Vector Representations for KoreanYoutubeDocument Classification, Language Modelling한국어 형태론에 맞춰 서브워드 단위 임베딩을 제안하여 분절 문제를 효과적으로 해결.
NLPA Decomposable Attention Model for Natural Language InferenceYoutubeNatural Language Inference간단한 어텐션 구조만으로도 NLI 태스크에서 준수한 성능을 달성한 모델 제안.
NLPReformerYoutubeTransformersLSH 기반 어텐션으로 긴 시퀀스 처리 시 메모리와 연산량을 크게 절감.
NLPNeural Machine Translation by Jointly Learning to Align and TranslateYoutubeDialogue Generation, Machine Translation기념비적인 연구로, NMT에서의 어텐션(align) 메커니즘을 처음 제안.
NLPELECTRAYoutubeAutoencoding Transformers, Transformers제너레이터-디스크리미네이터 구조로 적은 연산으로 효율적인 사전학습 구현.
NLPSBERT-WKYoutubeSemantic Textual Similarity, Sentence EmbeddingBERT 내부 레이어 가중치(Weighted-KMeans) 조합으로 문장 임베딩 생성.
NLPRevealing the Dark Secrets of BERTYoutubeBERTBERT 내부 표현 구조와 잠재적 취약점을 심층 분석한 연구.
NLPPEGASUSYoutubeAbstractive Text Summarization문장 누락(gap-sentence) 기반 사전학습 기법으로 요약 태스크에 특화된 성능 제시.
NLPDocument-level Neural Machine Translation with Inter-Sentence AttentionYoutubeMachine Translation, Translation문서 단위 전체 문맥(문단 간 관계)을 고려해 번역 품질을 높임.
NLPPhrase-Based & Neural Unsupervised MachineYoutubeTranslation, Unsupervised Machine Translation무감독 기법으로 평행 데이터 없이 양방향 번역을 학습하는 모델 제안.
NLPBARTYoutubeSequence To Sequence Models, Transformers디노이징 오토인코더 방식의 사전학습으로 요약·생성 분야에서 강력한 성능 발휘.
NLPBAEYoutubeAdversarial Attack, Adversarial Text토큰 치환 방식으로 텍스트를 교란해 분류 모델을 공격·취약점 연구.
NLPA Generative Model for Joint Natural Language Understanding and GenerationYoutubeNatural Language Understanding, Task-Oriented Dialogue Systems언어 이해(NLU)와 생성(NLG)을 단일 모델에서 통합적으로 수행하는 대화 시스템 제안.
NLPLearning Contextual Representations for Semantic Parsing with Generation-Augmented Pre-TrainingYoutubeLanguage Modelling, self-Supervised Learning생성 기반 사전학습을 활용하여 의미파싱(semantic parsing) 정확도를 향상.
NLPGraph Attention NetworksYoutubeDocument Classification, Graph Attention그래프에서 어텐션 기법을 적용해 노드·문서 분류 성능을 개선한 모델.
NLPSwitch TransformersYoutubeLanguage Modelling, Question Answering초대규모 파라미터 모델에 전문가 혼합(MoE)을 적용해 효율적 스케일링 구현.
NLPDeText: A Deep Text Ranking Framework with BERTYoutubeRanking검색 및 추천 시스템에서 BERT 스타일 랭킹 모델을 적용해 정확도 향상.
NLPFace book Chat bot , Blender botYoutubeChatbot지식, 인격 등 여러 스킬을 혼합한 오픈도메인 챗봇으로 대화 맥락을 풍부하게 유지.
NLPExtracting Training Data from Large Language ModelsYoutubeLanguage Modelling대형 언어 모델이 학습 데이터를 “기억” 및 유출할 수 있는 프라이버시 이슈 연구.
NLPLongformer: The Long-Document TransformerYoutubeLanguage Modelling, Question Answering희소 어텐션(sparse attention)을 적용해 긴 문서를 효율적으로 처리.
NLPVisualizing and Measuring the Geometry of BERTYoutubeWord EmbeddingsBERT 임베딩 공간의 기하학적 특성과 분포를 시각화 및 정량 분석.
NLPEncode, Tag, Realize High Precision Text EditingYoutubeAbstractive Text Summarization, Sentence Fusion단계별(인코드→태깅→실현) 접근으로 정밀한 텍스트 편집 및 요약 방안 제안.
NLPmultimodal transformer for unaligned multimodal language sequencesYoutubeMultimodal Sentiment Analysis, Time Series서로 정렬되지 않은 멀티모달 입력(음성·영상 등) 처리를 Transformer로 수행하여 감정분석·시계열 분석.
NLPSCGPT : Few-shot Natural Language Generation for Task-Oriented DialogYoutubeData-to-Text Generation, Few-Shot Learning대화 시스템에서 소량의 데이터로 텍스트 생성(task-oriented)을 수행하는 GPT 기반 프레임워크.
NLPColBERT: Efficient and Effective Passage Search viaContextualized Late Interaction over BERTYoutubeDocument Ranking, Information RetrievalBERT 임베딩을 기반으로 후반부(Late) 상호작용을 적용해 효율적인 패시지 검색을 구현.
NLPRestoring and Mining the Records of the Joseon Dynasty via Neural LanguageModeling and Machine TranslationYoutubeLanguage Modelling, Machine Translation조선왕조실록 등 옛 문서를 복원하고 번역하기 위해 NLM·MT 기술을 활용.
NLPImproving Factual Completeness and Consistency of Image to Text Radiology Report GenerationYoutubeNatural Language Inference, Text Generation영상→텍스트 변환 시 사실성(팩추얼)과 일관성을 높여 의료 보고서 품질 향상.
NLPFinBERTYoutubeLanguage Modelling, Pretrained Language Models금융 도메인(감성 분석 등)에 특화된 BERT 변형 모델로 높은 성능 달성.
NLPLayoutLM: Pre-training of Text and Layout for Document Image UnderstandingYoutubeDocument Image Classification, Document Layout Analysis문서 이미지에서 텍스트와 레이아웃 정보를 동시에 학습해 인식 정확도 향상.
NLPQuery Suggestions as Summarization in Exploratory SearchYoutubeQuery suggestions쿼리 제안을 요약(summarization) 방식으로 접근해 탐색적 검색을 지원.
NLPH-Transformer-1D Paper: Fast One Dimensional Hierarchical Attention For SequencesYoutubeLanguage Modelling계층적(hierarchical) 어텐션을 적용해 1D 시퀀스 처리 속도를 높인 모델.
NLPEnd-to-End Progressive Multi-Task Learning Framework for Medical Named Entity Recognition and NormalizationYoutubeKnowledge Graphs, Medical Named Entity Recognition의료 개체 인식과 정규화를 점진적 멀티태스크 학습으로 통합 수행.
NLPDISEASES : Text mining and data integration of disease–gene associationsYoutubeText mining, Data integration, Information extraction생물의학 텍스트를 활용해 질병–유전자 연관성을 통합적으로 발굴·구현.
NLPRoFormer: Enhanced Transformer with Rotary Position EmbeddingYoutubeSemantic Text MatchingRotary Position Embedding 기법으로 위치 인코딩을 개선해 매칭 성능 향상.
NLPA Multiscale Visualization of Attention in the Transformer ModelYoutubeTransformer멀티스케일 어텐션 시각화로 Transformer 동작과 메커니즘 파악에 도움.
NLPCAST: Enhancing Code Summarization with Hierarchical Splitting and Reconstruction of Abstract Syntax TreesYoutubeSoftware Engineering코드 요약 시 AST를 계층적으로 분할·재구성하여 더 간결하고 정확한 요약 제공.
NLPMERL: Multimodal Event Representation Learning in Heterogeneous Embedding SpacesYoutubeLanguage Grounding, Multi-modal NLP서로 다른 모달(텍스트, 이미지 등)을 동일 임베딩 공간에서 이벤트로 학습.
NLPBig Bird - Transformers for Longer SequencesYoutubeLinguistic Acceptability, Natural Language Inference희소 어텐션으로 4k 토큰 이상의 긴 입력을 처리 가능하게 만든 모델.
NLPDecoding-Enhanced BERT with Disentangled AttentionYoutubeCommon Sense Reasoning, Coreference Resolution디코딩 모듈과 분리 어텐션을 결합해 상식 추론과 코리퍼런스 해결 성능을 높임.
NLPSentiPrompt: Sentiment Knowledge Enhanced Prompt-Tuning for Aspect-Based Sentiment AnalysisYoutubeAspect-Based Sentiment Analysis, Language Modelling감성 지식을 프롬프트 튜닝에 접목해 ABSA(Aspect 기반 감성분석) 성능 향상.
NLPIMPROVING BERT FINE-TUNING VIA SELF-ENSEMBLE AND SELF-DISTILLATIONYoutubeNatural Language Inference, Text Classification여러 BERT 체크포인트를 앙상블 후 셀프 디스틸로 성능 및 안정성 개선.
NLPACHIEVING HUMAN PARITY ON VISUAL QUESTION ANSWERINGYoutubequestion-answering,Question Answering시각적 질의응답(VQA) 분야에서 인간 수준에 근접하거나 달성한 모델.
NLPDeep Encoder, Shallow Decoder: Reevaluating non- autoregressive machine translationYoutubeKnowledge Distillation, Machine Translation인코더를 깊게, 디코더를 얕게 설계하여 비자동회귀 MT(non-AR MT) 성능 향상 제시.
NLPLaMDA : Language Models for Dialog ApplicationsYoutubeInformation Retrieval다중 턴 대화를 위한 대규모 언어모델, 풍부한 대화 능력(오픈엔드).
NLPCompetition-Level Code Generation with AlphaCodeYoutubeCode Generation프로그래밍 경진대회 수준의 코드 솔루션을 생성하는 모델.
NLPRetrieval-Augmented Generation for Knowledge-Intensive NLP TasksYoutubeKnowledge-Intensive NLP외부 지식을 검색(Retrieval) 후 생성(Generation)에 활용해 복잡한 질의 해결.
NLPSimCLS: A Simple Framework for Contrastive Learning of Abstractive SummarizationYoutubeAbstractive Summarization요약 결과를 대조학습으로 평가·개선해 더 높은 품질의 추상적 요약 가능.
NLPGraph-Bert: Only Attention is Needed for Learning Graph RepresentationsYoutubeGraph Representations그래프 구조에 직접 어텐션만으로 임베딩을 학습, GNN 없이도 성능 확보.
NLPSimCSE:Simple Contrastive Learning of Sentence EmbeddingYoutubeSentence Embedding최소한의 데이터 증강과 대조학습만으로 문장 임베딩 품질을 대폭 향상.
NLPTypical decoding for Natural LanguageYoutubeText Generation생성 과정에서 “typical decoding”을 도입해 다양성과 품질의 균형을 꾀함.
NLPPerceiver IO : A GENERAL ARCHITECTURE FOR STRUCTURED INPUTS & OUTPUTSYoutubeMultimodal Processing다양한 형태의 입·출력을 일관된 Transformer 구조로 처리할 수 있는 범용 프레임워크.
NLPExploiting Cloze Questions for Few Shot Text Classification and Natural Language InferenceYoutubeText Classification, Natural Language Inference클로즈(cloze) 스타일의 질문을 이용해 소량의 데이터로 분류·추론 태스크를 수행
NLPLearning to Generalize to More:Continuous Semantic Augmentation for Neural Machine TranslationYoutubeMachine Translation연속적 의미 증강(continuous semantic augmentation)을 통해 번역 모델의 일반화 성능 제고.
NLPMultitask Prompted Training Enables Zero-Shot TaskYoutubeZero-Shot Learning멀티태스크 프롬프트 학습으로, 새로운 태스크에 대한 제로샷 성능을 높임.
NLPEfficient Passage Retrieval with Hashing for Open-domain Question Answering(BPR)YoutubeOpen-domain QA해싱을 활용한 효율적 패시지 검색으로 오픈도메인 QA 시스템 성능 향상.
NLPLORA: LOW-RANK ADAPTATION OF LARGE LANGUAGE MODELSYoutubeLanguage Modelling, LLM finetuning대형 언어 모델에 저순위 행렬(LoRA)을 추가해 파인튜닝 비용을 절감하는 기법.
NLPWeakly-supervised Text Classification Based on Keyword GraphYoutubeText Classification키워드 그래프를 이용한 약지도(weakly-supervised) 텍스트 분류 기법.
NLPImproving the Quality Trade-Off for Neural Machine Translation Multi-Domain AdaptationYoutubeMachine Translation다중 도메인 번역 적응 시 품질과 비용 간 균형을 개선하는 접근 제안.
NLPAEDA: An Easier Data Augmentation Technique for Text ClassificationYoutubeText Classification문장부호(punctuation) 삽입만으로 간단히 데이터 증강을 수행하는 기법 제안.
NLPGTRANS-Grouping and Fusing Transformer Layers for Neural Machine TranslationYoutubeMachine TranslationTransformer 레이어를 그룹화·융합해 번역 성능 및 효율을 동시에 추구.
NLPSPLADE : Sparse Lexical and Expansion Model for First Stage RankingYoutubeInformation Retrieval문서 랭킹의 첫 단계에서 희소 레키컬 확장을 활용해 성능을 높인 모델.
NLPDebiased Contrastive learning of Unsupervised Sentence RepresentationYoutubeSentence Representation비지도 문장 임베딩에서 대조학습을 통해 편향(spurious correlation)을 완화.
NLPCalibrating Sequence Likelihood Improves Conditional Language GenerationYoutubeConditional Language Generation시퀀스 확률 보정을 통해 조건부 텍스트 생성 결과의 일관성과 품질 개선.
NLPCHAIN-OF-THOUGHT PROMPTING ELICITS REASONING IN LARGE LANGUAGE MODELSYoutubeReasoning단계별 추론(Chain-of-Thought)을 유도해 대형 언어모델의 논리적 사고력 강화.
NLPA Quantitative Analysis of Statistical and Graph-Based Term Weighting Schemes for Keyword ExtractionYoutubeKeyword Extraction통계·그래프 기반 가중치 스킴을 비교하여 키워드 추출 효율을 정량 분석.
NLPImproving Neural Machine Translation with Soft Template PredictionYoutubeMachine Translation소프트 템플릿 예측으로 번역 과정에서 더 자연스러운 구조와 유창성 확보.
NLPMinerva - Solving Quantitative Reasoning Problems with Language ModelsYoutubeQuestion Answering대형 언어 모델로 수학·정량적 추론 문제를 해결해 높은 정확도 달성.
NLPPaLM: Scaling Language Modeling with PathwaysYoutubeLanguage ModelingPathways 아키텍처로 대규모 언어 모델을 스케일링해 다양한 태스크 성능 향상.
NLPUnsupervised Neural Machine Translation for Low-Resource Domains via Meta-LearningYoutubeUnsupervised Machine Translation메타학습을 도입해 저자원 도메인에서 무감독 번역 모델의 성능을 향상.
NLPCausal Inference in Natural Language Processing: Estimation, Prediction, Interpretation and BeyondYoutubeCausal InferenceNLP 태스크에 인과 추론 기법을 적용해 예측과 해석력을 높이는 연구.
NLPBRIO: Bringing Order to Abstractive SummarizationSYoutubeAbstractive Summarization요약 결과물의 구조 및 일관성을 개선해 더 읽기 쉬운 추상적 요약 생성.
NLPTowards Robust and Reproducible Active Learning using Neural NetworksYoutubeActive Learning재현 가능하며 안정적인 능동학습 전략을 제안해 실제 적용성을 높인 연구.
NLPScaling Instruction-Finetuned Language ModelsYoutubeInstruction Tuning지시(instruction) 기반 데이터로 파인튜닝 시 모델 스케일업 효과를 분석.
NLPPacked Levitated Marker for Entity and Relation ExtractionYoutubeEntity and Relation Extraction마커(marker) 기법을 활용해 엔티티 및 관계를 통합적으로 추출하는 방법 제시.
NLPLLaMA Review!YoutubeLarge Language ModelsMeta AI에서 공개한 LLM 시리즈로, 상대적으로 적은 파라미터로도 높은 성능 발휘.
NLPP-Tuning v2: Prompt Tuning Can Be Comparable to Fine-tuning Universally Across Scales and TasksYoutubePrompt Tuning다양한 크기의 모델에서 프롬프트 튜닝이 풀 파인튜닝에 맞먹는 성능을 보여줌.
NLPMCSE:Multimodal Contrastive Learning of Sentence EmbeddingsYoutubeMultimodal Sentence Embedding문장 임베딩을 멀티모달 대조학습으로 확장해 텍스트+이미지 등 통합 표현 학습.
NLPHyperbolic Image EmbeddingsYoutubeImage Embeddings이미지 임베딩을 쌍곡공간(hyperbolic space)에 매핑해 계층적·트리 구조 표현 향상.
NLPLIMA Less Is More for AlignmentYoutubeAlignment소량 데이터로도 효율적 정렬(alignment) 가능성을 보인 모델 연구.
NLPInstruct GPT : Training language models to follow instructions with human feedbackYoutubeInstruction Tuning인간 피드백을 활용한 RL 기법으로 GPT가 지시사항을 잘 따르도록 학습.
NLPIter-RetGen : Enhancing Retrieval augmented Large Language Models with Iterative RetrievalYoutubeRetrieval-Augmented Generation반복(iterative) 검색 전략으로 지식 기반 텍스트 생성 품질을 단계적으로 향상.
NLPTextbooks Are All You needYoutubeLanguage Modeling, Instruction Tuning교과서 수준의 간단한 텍스트만으로도 대형 언어 모델을 효율적으로 학습할 수 있음을 시사.
NLPEmbedding Text in Hyperbolic spaceYoutubeHyperbolic Embeddings, Representation Learning쌍곡공간 임베딩으로 텍스트 간 계층적·트리 관계를 효과적으로 학습.
NLPOpineSum : Entailment based self training for abstractive opinion summarizationYoutubeOpinion Summarization, Entailment엔테일먼트 기반 셀프 트레이닝으로 사용자 의견 요약 품질을 높이는 기법.
NLPDo Androids Laugh at Electric Sheep Humor “Understanding” Benchmarks from The New Yorker CaptionYoutubeHumor Detection, Benchmarking만화 캡션 등 유머 이해 능력을 평가하는 벤치마크를 제시, AI의 ‘유머 인식’ 성능을 검증.
NLPPUNICA: Multi-Tenant LoRA ServingYoutubeParameter Efficient Tuning, LoRA ServingLoRA(저순위 어댑터) 기반 모델을 다중 사용자 환경에서 효율적으로 서비스하는 플랫폼.
NLPFrom Pretraining Data to Language Models to Downstream TasksYoutubeLanguage Models, Transfer Learning사전학습 데이터 선정부터 다운스트림 태스크 적용까지 일관된 언어 모델 학습·분석 파이프라인 제안.
NLPEfficient Memory Management for Large Language Model Serving with pagedAttentionYoutubeMemory Optimization, Large Language ModelspagedAttention 기법을 통해 LLM 추론 시 메모리 사용을 효율적으로 관리하는 방법.
NLPNatural Posterior Network Deep Bayesian Uncertainty for Exponential Family DistYoutubeBayesian Learning, Uncertainty Estimation지수 가족 분포 기반 심층 베이지안 접근으로 모델 불확실성을 더 정확히 추정.
NLPMamba: Linear Time Sequence Modeling with Selective State SpacesYoutubeSequence Modeling, State Space Models상태 공간을 선택적으로 활용해 선형 시간 복잡도로 시퀀스 모델링 성능 유지.
NLPChatGPT for Robotics Design Principles and Model AbilitiesYoutubeHuman-Robot Interaction, Language ModelsChatGPT를 로보틱스 설계에 적용해 모델 능력과 디자인 원칙을 점검·분석.
NLPMeta in context Learning In large Language ModelsYoutubeMeta-learning, In-Context Learning대형 언어 모델에서 인컨텍스트 학습을 메타학습 관점으로 해석, 능력을 향상시키는 방법 분석.
NLPLarge Language Models Understand and Can be Enhanced by Emotional StimuliYoutubeEmotion-Aware LLM, Sentiment Analysis감정 자극(Emotional Stimuli)이 대형 언어 모델 이해력 및 성능 향상에 기여함을 제시.
NLPIgnore This Title and HackaPromptYoutubePrompt Engineering, Adversarial Prompts‘무시해야 할 제목’ 같은 어드버서리얼 프롬프트를 통해 모델을 교묘히 우회·오류 유발.
NLPAlpacaFarm : A Simulation Framework for Methods that Learn from Human FeedbackYoutubeRLHF Simulation, LLM Fine-Tuning인간 피드백 기반 학습(RLHF)을 시뮬레이션할 수 있는 AlpacaFarm 프레임워크 제안.
NLPWhy Can GPT Learn In Context Language Models Secretly Perform Gradient DesceYoutubeIn-Context Learning, Gradient DescentGPT가 내부적으로 그래디언트 디센트를 모사해 인컨텍스트 학습을 수행한다는 가설.
NLPSmoothQuant : Accurate and Efficient Post Training Quantization for Large LanguageYoutubeQuantization, Model Compression대형 언어 모델을 후처리 단계에서 양자화(SmoothQuant)하여 정확도·효율 동시 확보.
NLPGenerative Representational Instruction TuningYoutubeInstruction Tuning, Representation Learning생성적 표현(Representational)과 지시 기반 튜닝을 결합해 모델 표현력 개선.
NLPGraph of Thought : Solving Elaborate Problems with Large Language ModelsYoutubeComplex Reasoning, Graph-based Thinking그래프 사고(Graph of Thought) 기법으로 복잡 문제를 대형 언어 모델이 단계적으로 해결.
NLPHallucination of Multimodal Large Language modelsYoutubeMultimodal LLM, Hallucination이미지·텍스트 등 멀티모달을 처리하는 LLM에서 발생하는 할루시네이션과 그 완화 방안 연구.
NLPRAPTOR : Recursive Abstractive Processing For Tree Organized RetrievalYoutubeAbstractive Summarization, Tree Retrieval트리 구조 데이터를 재귀적으로 요약해 복잡한 문서 검색 성능을 향상하는 기법.
NLPChain of Thought Reasoning Without PromptingYoutubeChain of Thought, Zero-Prompt Reasoning별도 프롬프트 없이도 모델이 단계적 사고 과정을 학습·활용(Chain of Thought) 가능.
NLPLet the Flows Tell: Solving Graph Combinatorial Optimization Problems with GFlowNetsYoutubeGFlowNet, Graph OptimizationGFlowNets를 활용해 그래프 조합 최적화 문제에서 해 공간을 효율적으로 탐색·해결
NLPMoRA: High-Rank Updating for Parameter-Efficient Fine-TuningYoutubeParameter Efficient Tuning, High-Rank Update저순위 LoRA와 반대로 고순위(MoRA) 업데이트 방식으로 미세조정 효율과 성능을 동시 개선.
NLPAdapting Visual Language Models for Generalizable Anomaly Detection in MedicalYoutubeMedical Anomaly Detection, Vision-Language Models비전-언어 모델을 의료 이상 탐지에 활용, 다양한 환경에서 일반화 성능을 높이는 접근.
NLPGradient Boosting Reinforcement Learning (GBRL)YoutubeReinforcement Learning, Gradient Boosting그래디언트 부스팅 개념을 RL에 접목해 학습 효율 및 정책 품질을 개선한 기법.
NLPDesigning a Dashboard for Transparency and Control of Conversational AIYoutubeConversational AI, Transparency대화형 AI 작동을 투명하게 모니터·제어 가능한 대시보드를 설계해 사용자 신뢰도 향상.
NLPHow Johnny Can Persuade LLMs to Jailbreak ThemYoutubeAdversarial Prompting, Model Security사용자 프롬프트를 통해 모델 정책을 우회(jailbreak)시키는 기법과 방어 시나리오 연구.
NLPLongRoPE : Extending LLM Context Window Beyond 2 Million TokensYoutubeExtended Context, Rotary Positional EmbeddingRoPE를 확장해 최대 수백만 토큰 이상의 장문을 처리할 수 있는 LLM 구조 제안.
NLPCoVe : Chain of Verification Reduces Hallucination in LLMYoutubeHallucination Reduction, Verification모델 출력의 사실성을 검증(Verification)하는 체인을 추가해 할루시네이션 완화.
LLM InferenceREFLEG: Rethinking RAG-based Decoding for LLM EfficiencyYoutubeRAG Decoding, LLM Efficiency, Retrieval-Augmented GenerationRAG 기반 디코딩 방식을 재설계해 검색 기반 생성의 효율성과 응답 품질을 함께 개선하려는 접근.
LLM InferenceSpecEE: Accelerating Large Language Model Inference with Speculative Early ExitingYoutubeSpeculative Decoding, Early Exit, LLM InferenceSpeculative decoding과 early exiting을 결합해 LLM 추론 속도를 높이는 효율화 기법.
LLM ReasoningDeepConf: Deep Think With ConfidenceYoutubeConfidence Estimation, Reasoning, LLM모델의 추론 과정에서 confidence를 활용해 더 신뢰도 높은 답변과 사고 경로를 유도하는 방법.
VisionControlNet : Adding Conditional Control to Text to Image Diffusion ModelYoutubeText-to-Image, Conditional DiffusionDiffusion 기반 텍스트→이미지 생성에 조건부 제어를 추가해 생성 결과를 세밀하게 통제.
VisionInterpreting CLIP’s Image Representation via Text Based DecompositionYoutubeVision-Language Models, Representation AnalysisCLIP 임베딩을 텍스트 기반으로 분해·해석해 시각 표현 구조 이해를 개선.
VisionOpen-World Semantic Segmentation Including Class SimilarityYoutubeOpen-World Segmentation, Class Similarity클래스를 모르는 오픈월드 세그멘테이션 상황에서 클래스 유사도 등을 고려해 분할 정확도 향상.
VisionDynamic Sparse Voxel Transformer with Rotated Sets (DSVT)Youtube3D Object Detection, Sparse Transformer3D 점구름(voxel)에서 회전된 셋을 활용, 희소성·동적성을 겸비한 Transformer로 물체 탐지.
VisionIs ImageNet Worth 1 Video?YoutubeVideo Pretraining, ImageNet Alternative단 하나의 긴 동영상이 ImageNet에 상응하는 사전학습 효과를 낼 수 있는지 실험적으로 검증.
VisionSAM2YoutubeSemantic Segmentation, SAMSegment Anything Model(SAM)을 확장 혹은 개선하여 세분화 정확도 향상 모색. 심지어 동영상
VisionSparK : DESIGNING BERT FOR CONVOLUTIONAL NETWORKSYoutubeConvNets, BERT-like ArchitectureCNN에 BERT 구조를 접목해 시각 특징 학습을 강화하는 SparK 모델 제안.
VisionDiffusion-based Semantic-Discrepant Outlier Generation for Out-of-Distribution DetectionYoutubeOOD Detection, Diffusion Models정상 데이터와 다른(semantic discrepancy) 샘플을 생성해 OOD 탐지 성능 강화.
VisionTri Perspective View for Vision Based 3D Semantic Occupancy PredictionYoutube3D Occupancy, Semantic Prediction세 가지 관점(Tri Perspective)으로 3D 공간의 점유 및 의미 정보를 예측하는 접근.
VisionUniCLIP Unified Framework for Contrastive Language Image Pre trainingYoutubeCLIP, Contrastive Pretraining언어–이미지 대조학습을 하나로 통합한 프레임워크로 범용 비전-언어 표현 학습 지원.
VisionBEVFusion: Multi-Task Multi-Sensor Fusion with Unified Bird's-Eye View RepresentationYoutubeSensor Fusion, 3D Detection라이다·카메라 등 센서 정보를 Bird’s-Eye View로 융합해 다중 태스크를 동시 처리.
VisionSemiVL: Semi-Supervised Semantic Segmentation with Vision-Language GuidanceYoutubeSemi-Supervised Segmentation, Vision-Language비전-언어 정보를 활용해 반지도(세미 슈퍼바이즈) 세그멘테이션 성능을 높임.
VisionYDTR Infrared and Visible Image Fusion via Y Shape Dynamic TransformerYoutubemage Fusion, Transformer적외선·가시광 이미지를 Y자형 동적 Transformer로 융합해 시각적 품질 향상.
VisionSTABLEREP : Synthetic Images from Text-to-Image Models Make Strong Visual Representation LearnersYoutubeSynthetic Data, Representation Learning텍스트→이미지 합성 데이터를 활용해도 강력한 시각 표현 학습을 달성할 수 있음.
VisionDiffusion models Beat GANs on Image SynthesisYoutubeImage Synthesis, Diffusion vs. GAN확산(diffusion) 모델이 이미지 생성 품질 면에서 GAN을 능가한다는 연구 결과.
VisionDOMINO Discovering Systematic Errors with Cross Modal EmbeddingsYoutubeError Analysis, Cross-Modal Embeddings모델의 체계적 에러를 멀티모달 임베딩을 통해 탐색·분류해 개선 여지 확인.
VisionEmergent Complexity and Zero shot Transfer via Unsupervised Environment DesignYoutubeUnsupervised Environment Design, Zero-Shot Transfer학습 환경을 자동 설계해 에이전트가 예측 못한 태스크로 제로샷 전이 가능하게 만듦.
VisionRT-DETR : DETRs Beat YOLOs On Real time Object DetectionYoutubeObject Detection, Transformer-based DETRDETR 계열 모델이 실시간 객체 검출(throughput)에서 YOLO와 경쟁·상회하는 결과 보고.
VisionMasked Auto encoders Are Scalable Vision LearnersYoutubeMAE, Self-Supervised Learning이미지 일부를 마스킹 후 복원하는 MAE 기법으로 대규모 시각 표현 학습의 효과를 입증.
VisionLLM-grounded DiffusionYoutubeVision-Language Models, Diffusion대형 언어 모델(LLM)을 접목해 텍스트 이해력을 강화한 이미지 생성.
VisionDepth Anything Unleashing the Power of Large Scale Unlabeled DataYoutubeDepth Estimation, Unlabeled Data대규모 비라벨 데이터에서 깊이(depth) 정보를 학습해 다양한 비전 태스크로 확장 가능.
VisionObject LabYoutubeObject Discovery, 3D Reconstruction객체 탐지·3D 재구성을 결합한 ‘Object Lab’ 환경을 통해 직관적 오브젝트 연구.
VisionYOLOYoutube
paper
Object detectionObject detection
VisionYOLO-v2YoutubeObject detectionObject detection
VisionResnetYoutube
paper
Image classificationImage classification
VisionGANYoutubeGenerative Adversarial Networks, Generative ModelsGenerative Adversarial Networks, Generative Models
VisionImage Style Transfer Using CNNYoutubeConvolutional Neu- ral NetworkCNN을 활용해 콘텐츠 이미지는 유지하고, 스타일 이미지를 결합하여 새로운 스타일 이미지 생성.
VisionSINGANYoutubeImage Generation, Image Manipulation단일 이미지만으로 멀티 스케일 GAN을 학습해 다양한 이미지 변환·조작 수행 가능.
VisionFCNYoutubeSemantic Segmentation Models완전 합성곱 네트워크(FCN)로 픽셀 단위 세그멘테이션 수행, 보다 정확한 분할 실현.
VisionDeepLabV3YoutubeSemantic Segmentation Models팽창(a trous) 컨볼루션과 ASPP로 객체 크기 변화에 대응하며 세밀한 분할 가능.
VisionUnetYoutube
paper
Cell Segmentation, Multi-tissue Nucleus Segmentation인코더-디코더 구조로 의료영상과 같은 소량 데이터 환경에서도 높은 분할 정확도.
VisionCyCADAYoutubeDomain Adaptation, Semantic Segmentation생성적 적대 학습을 통해 소스·타겟 도메인 차이를 줄여 세그멘테이션 성능 향상.
VisionD-SNEYoutubeDomain Adaptationt-SNE 시각화를 기반으로 도메인 불일치를 줄여 분류·세그멘테이션 성능 개선.
VisionFaster-RCNNYoutubeReal-Time Object Detection, Region ProposalR-CNN 계열을 개선해 영역 제안(Region Proposal) 과정을 통합, 속도·정확도 동시 향상.
VisionWeakly Supervised Object Detection With Segmentation CollaborationYoutubeGeneral Classification, Image Classification이미지 레벨 라벨만으로 객체를 검출하고, 분할 협업으로 정확도 보완하는 약지도 방식.
VisionDon't Judge an Object by Its Context: Learning to Overcome Contextual BiasYoutubeobject classification주변 문맥에 의존하는 편향을 줄이고 객체 자체 특징으로 분류 정확도를 높이는 연구.
Visiondata efficient image recognition with contrastive predictive codingYoutubeGeneral Classification, Object Detection적은 데이터 상황에서 대조 예측 부호화(CPC)로 효율적인 시각 특성 학습 달성.
VisionDeep Feature Consistent Variational AutoencoderYoutubeStyle TransferVAE에 딥 특징 일관성 조건을 추가해 스타일 전이 품질·다양성 개선.
VisionAttention Branch Network: Learning of Attention Mechanism for Visual ExplanationYoutubeDecision Making, Image Classification분기된 어텐션 브랜치로 시각적 중요 영역을 강조, 해석 가능성과 분류 정확도 동시 향상.
VisionRELATION-SHAPE CONVOLUTIONAL NEURAL NETWORK FOR POINT CLOUD ANALYSISYoutubepoint cloud점구름 데이터에서 물체 형태·상호 관계를 학습하기 위한 CNN 기반 구조 제안.
VisionEfficientNetYoutubeCNN너비·깊이·해상도를 동시에 확장해 효율적으로 정확도 향상(Scaling)을 달성한 CNN 모델.
VisionDeep Clustering for Unsupervised Learning of Visual FeaturesYoutubeDeep Clustering, Image Clustering비지도 클러스터링과 이미지 특징 학습을 결합해 시각 표현 학습 정확도 향상.
VisionBoosting Few-shot visual learning with self-supervisionYoutubeFew-Shot Learning, Self-Supervised Learning자가 지도 방식으로 특성 품질을 향상, 극소량(Few-shot) 샘플에서도 높은 정확도 가능.
VisionRethinking Pre-training and Self-trainingYoutubeData Augmentation, Object Detection사전학습 + 셀프 트레이닝 전략 재검토로 객체 검출 등에서 데이터 효율성 향상.
VisionBYOL : Bootstrap Your Own LatentYoutubeRepresentation Learning, Self-Supervised Image Classification서로 다른 네트워크 간 상호 학습(교사·학생)으로 점진적 표현 학습 향상.
VisionDeep Image PriorYoutubeImage Denoising, Image Inpainting네트워크 구조 자체로 이미지를 자연스럽게 복원하도록 유도, 별도 사전학습 불필요.
VisionObject-Centric Learning with Slot AttentionYoutubeObject Discovery슬롯 어텐션 기법으로 이미지 내 객체들을 분리·학습해 객체 중심 표현을 확보.
VisionYolo V4YoutubeData Augmentation, Real-Time Object DetectionMosaic, IoU-aware 등 다양한 기법을 결합해 실시간 검출 성능을 대폭 향상한 YOLO 후속.
VisionDynamic Routing Between CapsulesYoutubeImage Classification캡슐 간 동적 라우팅(Dynamic Routing)으로 시각적 계층 구조를 보존하며 분류 정확도 향상.
VisionSemi-Supervised Classification with Graph Convolutional NetworkYoutubeClassification, Document Classification그래프로 연결된 노드 관계를 활용해 반지도 분류·문서 분류 정확도 향상.
VisionGenerative Pretraining from PixelsYoutubeRepresentation Learning, Self-Supervised Image Classification픽셀 단위에서 생성적 사전학습 후, 다양한 시각 태스크로 전이 가능.
VisionMaskFlownetYoutubeFeature MatchingOptical Flow 예측과 마스킹을 결합해 정교한 특징 매칭을 수행하는 네트워크.
VisionAdversarial Robustness through Local LinearizationYoutubeAdversarial Defense, Adversarial Robustness적대적 공격 주변에서 모델을 국소 선형화하여 내재적 강건성을 확보.
VisionLocating Objects Without Bounding BoxesYoutubeObject Localization바운딩 박스 라벨 없이 객체 위치를 추론해 라벨 비용 절감 및 유연성 확보.
VisionTraining data-efficient image transformers & distillation through attentionYoutubeDocument Image Classification, Document Layout Analysis트랜스포머와 어텐션 기반 지식 증류를 통해 데이터 효율적으로 문서 인식 성능 향상.
VisionWhat Makes Training Multi-modal Classification Networks Hard?YoutubeAction Classification, Action Recognition멀티모달 분류 네트워크 학습 시 발생하는 편향·난관을 분석해 해법 모색.
VisionMeta-Transfer Learning for Zero-Shot Super-ResolutionYoutubeImage Super-Resolution, Meta-Learning메타 전이학습을 통해 초해상도(SSR) 문제에서 제로샷 환경도 효과적으로 대응.
VisionPatch SVDD: Patch-level SVDD for Anomaly Detection and SegmentationYoutubeAnomaly Detection, Self-Supervised Learning국소(패치) 단위 SVDD 적용으로 미세한 이상 탐지·세그멘테이션 가능.
VisionStyle GANYoutubeDisentanglement, Image Generation스타일 공간을 제어해 이미지 생성의 다채로운 변형·속성 조절 가능.
VisionHigh-Performance Large-Scale Image Recognition Without NormalizationYoutubeImage Classification정규화 없이도 대규모 이미지 분류에서 높은 성능을 내는 학습 기법 제안.
VisionFocal Loss for Dense Object DetectionYoutubeObject Detection클래스 불균형 심한 객체 검출 상황에서 포컬 로스로 성능 극대화.
VisionEditing in Style : Uncovering the Local Semantics of GANsYoutubeDense Object Detection, Long-tail LearningGAN 내부 로컬 스타일 코드를 편집해 이미지 수정·생성 자유도를 확보.
VisionEfficientNet 2YoutubeConvolutional Neural Networks, Image ModelsEfficientNet를 확장한 모델로, 크기·성능 균형을 한층 향상.
VisionStyle ClipYoutubeImage Manipulation텍스트 프롬프트와 GAN을 결합해 직관적으로 이미지 스타일 조절 가능.
VisionSwin TransformerYoutubeImage Models, Vision Transformers스윈(Window) 어텐션으로 고해상도 이미지를 효율적으로 처리하는 비전 트랜스포머.
VisionNBDT: Neural-backed Decision TreeYoutubeNeural-Backed Decision Trees신경망으로 학습한 계층적 트리 구조로 결정 과정을 시각적으로 해석 가능.
VisionEfficientDetYoutubeSemantic Segmentation Models, One-Stage Object Detection Models, Object Detection ModelsBiFPN과 EfficientNet 백본으로 높은 정확도와 빠른 속도를 동시에 달성한 검출 모델.
VisionMLP - MIXER: An all-MLP Architecture for VisionYoutubeImage Classification어텐션 없이도 채널·공간 MLP만으로 이미지 분류를 수행, 단순 구조로도 준수한 성능 달성.
VisionYou Only Look at One Sequence: Rethinking Transformer in Vision through Object DetectionYoutubeObject Detection비전 트랜스포머를 한 번의 시퀀스 처리로 객체 검출에 적용, 효율적 구조 제안.
VisionHierarchical Long-term Video Frame Prediction without SupervisionYoutubeVideo Prediction비지도 학습으로 장기 비디오 프레임을 계층적으로 예측·생성.
VisionClosed-Form Factorization of Latent Semantics in GANsYoutubeImage Generation, Image ManipulationGAN 잠재공간을 닫힌 형태로 분해해 특정 속성만 선택적으로 수정·생성 가능.
VisionYou Only Learn One Representation: Unified Network for Multiple TasksYoutubeMulti-Task Learning, Real-Time Object Detection여러 비전 태스크를 단일 표현(Representation)으로 처리하는 통합 네트워크 제안, 실시간 객체 검출 등 동시 수행.
VisionStyleSpace AnalysisYoutubeImage Generation스타일 공간(StyleSpace)을 분석해 이미지를 세부적으로 조작·생성하는 방법론 연구.
VisionRepresentative graph neural networkYoutubeRepresentative Graph, Dynamic Sampling, Semantic Segmentation그래프 신경망에 대표성(Representative) 개념을 도입해 동적 샘플링·의미론적 세그멘테이션 성능 개선.
VisionYOLOXYoutubeOne-Stage Object Detection ModelsYOLO 계열을 확장·개선한 원스테이지 검출 모델로 앵커 프리(anchor-free) 구조가 특징.
VisionJoint Contrastive Learning with Infinite PossibilitiesYoutubeContrastive Learning대조학습을 확장해 ‘무한’한 양상의 표현 학습 가능성을 모색, 다양한 뷰·도메인 통합 학습.
VisionAuto-DeepLab: Hierarchical Neural Architecture Search for Semantic Image SegmentationYoutubeImage Classification, Neural Architecture Search자동화된 계층형 아키텍처 탐색을 통해 세그멘테이션 모델을 최적 설계, 이미지 분류 등에도 적용 가능.
VisionExplaining in style training a gan to explain a classifier in stylespaceYoutubeImage ClassificationStyleSpace 기반으로 분류기의 결정 경로를 GAN으로 시각화·설명하는 접근.
VisionEnd-to-End Semi-Supervised Object Detection with Soft TeacherYoutubeInstance Segmentation, Object Detection반지도 학습에서 Teacher 모델을 소프트하게 결합해 물체 검출·인스턴스 분할 성능 향상.
VisionUnderstanding Dimensional Collapse in Contrastive Self Supervised LearningYoutubeContrastive Learning, Learning Theory대조학습 시 발생하는 표현 차원의 붕괴 현상을 이론적으로 분석하고, 이를 완화하는 방안 제시.
VisionEncoding in Style: a Style Encoder for Image-to-Image TranslationYoutubeConditional Image Generation, Face Generation스타일 인코더를 도입해 얼굴·이미지 변환 시 개별 스타일 요소를 보다 정확히 제어.
VisionDetection in Crowded Scenes: One Proposal, Multiple PredictionsYoutubeObject Detection, Pedestrian Detection혼잡한 장면에서 하나의 영역 제안으로 여러 객체(보행자 등)를 예측해 검출 정확도 높임.
VisionA Normalized Gaussian Wasserstein Distance for Tiny Object DetectionYoutubeObject Detection작은 물체 검출을 위해 정규화된 가우시안 Wasserstein 거리를 활용, 좌표 회귀를 안정화.
VisionSiamese Neural network for one-shot image recognitionYoutubeOne-Shot Learning쌍둥이(Siamese) 네트워크로 극소량 샘플(1샷)만으로 이미지 인식 가능.
VisionGrounded Language-Image Pre-trainingYoutubeObject Detection Phrase Grounding이미지와 언어를 연결해 사물 검출·어구(phrase) 정합을 사전학습으로 습득, 다양한 멀티모달 태스크에 적용.
VisionTransfer Learning for Pose Estimation of Illustrated CharactersYoutubeActivity Recognition, Pose Estimation일러스트(만화) 캐릭터 포즈 추정에 기존 인체 포즈 모델을 전이학습, 동작 인식 정확도 개선.
VisionSparse R-CNN: End-to-End Object Detection with Learnable ProposalsYoutubeObject Detection, Object Recognition사전에 학습된(proposal) 박스를 직접 예측·조정하는 방식으로, RCNN 단계를 간소화·속도↑
VisionNeRF: Representing Scenes as Neural Radiance Fields for View SynthesisYoutubeNeural Rendering, Novel View Synthesis신(scene)을 연속적 방사장(Radiance Field)으로 표현해 다양한 시점 뷰 합성(3D 렌더링) 가능.
VisionHRnet: Deep High-Resolution Representation Learning for Human Pose EstimationYoutubePose Estimation, Human Pose고해상도 특징 맵 유지 구조로 인체 포즈 추정 등에서 높은 정밀도 발휘.
VisionMobileViT : Light-weight, general-purpose, and Mobile-friendly Vision TransformerYoutubeMobile Vision Transformer, Lightweight Architecture모바일 환경에서도 효율적으로 동작하도록 설계된 경량 비전 트랜스포머 구조 제안.
VisionEffectively Leveraging Attributes for Visual SimilarityYoutubeAttribute-based Image Retrieval, Visual Similarity시각적 유사도 계산 시 속성(attributes)을 적극 활용해 검색·추천 품질 향상.
VisionHard Negative Mixing for Contrastive learningYoutubeContrastive Learning, Hard Negative Mining어려운 음성 샘플(하드 네거티브)을 혼합함으로써 대조학습 임베딩을 더욱 견고하게 학습.
VisionHOTR : Human-Object Interaction Detection with TransformerYoutubeHuman-Object Interaction Detection, Transformer사람과 사물의 상호작용(HOI)을 Transformer로 검출하여 행동 이해·분석에 활용.
VisionSSD: A UNIFIED FRAMEWORK FOR SELF-SUPERVISED OUTLIER DETECTIONYoutubeSelf-Supervised Outlier Detection자가 지도 방식으로 이상치(outlier) 검출을 수행하는 통합 프레임워크.
VisionStyleHEAT : One-Shot High-Resolution Editable Talking Face Generation via Pre-trained StyleGANYoutubeTalking Face, One-Shot Generation스타일GAN을 활용해 단일 얼굴 이미지만으로도 고해상도·편집 가능한 페이스 영상 생성 가능.
VisionSelf-Supervised Transformers for Unsupervised Object Discovery using Normalized CutYoutubeUnsupervised Object Discovery, Self-Supervised Transformers정규화 컷(NCut)과 트랜스포머 결합으로 라벨 없이 객체 분할 정확도 향상.
VisionTransfusion: Understanding Transfer Learning for Medical ImagingYoutubeMedical Imaging, Transfer Learning의료 영상에 특화된 전이학습 전략을 분석, 기존 대비 정확도·효율 개선.
VisionUCTransNetYoutubeMedical Segmentation, U-Net + TransformeU-Net과 트랜스포머를 결합해 의료 영상 분할에서 높은 정확도 달성.
VisionA Simple Baseline for Semi-supervised Semantic Segmentation with Strong Data AugmentationYoutubeSemi-supervised Semantic Segmentation, Data Augmentation강력한 증강 기법을 적용해 반지도 세그멘테이션의 기본 성능을 크게 끌어올린 방법론.
VisionVision Transformer with Deformable AttentionYoutubeDeformable Attention, Vision Transformer비정형(Deformable) 어텐션으로 스케일 변화가 큰 물체 인식 성능 개선.
VisionMore ConvNets in the 2020s: Scaling up Kernels Beyond 51x51 using SparsityYoutubeSparse Large-Kernel Conv, Scalable CNN51×51을 넘는 초대형 커널을 희소 기법으로 처리해 CNN의 확장성과 정확도 높임.
VisionPseCo: Pseudo Labeling and Consistency Training for Semi-Supervised Object DetectionYoutubeSemi-Supervised Object Detection, Consistency Regularization반지도 학습에서 의사 라벨링과 일관성 훈련을 결합, 적은 라벨로도 객체 검출 성능 향상.
VisionMetaFormer is Actually What You Need for VisionYoutubeTransformer Variation, MetaFormer“어텐션”보다 중요한 건 메타포머 구조라 주장, 다양한 비전 태스크에 적용 가능.
VisionAn Image is Worth 16x16 Words:Transformers for Image Recognition at ScaleYoutubeVision Transformer (ViT), Large-Scale Recognition이미지 패치를 토큰화한 대규모 트랜스포머로 분류, ViT의 효시가 된 연구.
VisionBigDatasetGAN: Synthesizing ImageNet with Pixel-wise AnnotationsYoutubeGAN-based Data Synthesis, Pixel-wise Annotation대규모 ImageNet 스타일 이미지를 픽셀 단위 주석까지 합성, 데이터 증강에 활용.
VisionHigh-Resolution Image Synthesis with Latent Diffusion Models (Stable Diffusion)YoutubeDiffusion Models, High-Resolution Image Generation잠재 공간에서 확산 모델을 적용해 고해상도 이미지를 생성, Stable Diffusion 아이디어의 핵심.
VisionProper Reuse of Image Classification Features Improves Object DetectionYoutubeFeature Reuse, Object Detection분류용으로 학습된 특징을 적절히 재사용하면 검출 성능을 크게 향상시킬 수 있음을 입증.
VisionVoxel Field Fusion for 3D Object DetectionYoutube3D Object Detection, Voxel Fusion다중 뷰(voxel field) 정보를 융합해 점구름 기반 3D 검출 정확도 향상.
VisionMedSefDiff: Medical Image Segmentation with Diffusion Probabilistic ModelYoutubeMedical Image Segmentation, Diffusion Models확산(디퓨전) 확률 모델을 의료 영상 세그멘테이션에 적용해 정밀도 높임.
VisionPix2SeqYoutubeUnified Generation Approach, Object Detection객체 검출을 시퀀스 생성 문제로 전환하여 단일 프레임워크에서 처리.
VisionSelf-Supervised Learning based on Heat EquationYoutubeSelf-Supervised Representation, Heat Equation열 방정식 기반 자가 지도 접근으로 안정적인 특징 학습을 구현.
VisionCliff Diving : Exploring Reward Surfaces in Reinforcement Learning EnvironmentsYoutubeReinforcement Learning, Reward SurfacesCliff Diving 환경에서 보상 지형(Reward Surface)을 분석해 RL 동작 특성 파악.
VisionWHAT DO VISION TRANSFORMERS LEARN?A VISUAL EXPLORATIONYoutubeVision Transformer, InterpretabilityViT 내부에서 어떤 시각 패턴을 학습하는지 시각화·해석.
VisionInternImage: Exploring Large-Scale Vision Foundation Models with Deformable ConvolutionsYoutubeFoundation Models, Deformable Convolution대규모 비전 기본 모델에 변형가능 컨볼루션을 적용해 정확도·효율 동시 개선.
VisionCut and Learn for Unsupervised Object Detection and Instance SegmentationYoutubeUnsupervised Detection, Instance Segmentation라벨 없이 객체를 잘라내(cut) 학습하며 동시에 객체 감지와 인스턴스 세그멘테이션을 달성.
VisionThe Forward-Forward Algorithm: Some Preliminary InvestigationsYoutubeForward-Forward Training, Alternative Backprop역전파 없이 전방(Forward) 단계만 반복해 학습하는 대안적 기법 초기 연구.
VisionVisual Prompt TuningYoutubePrompt Tuning, Vision Transformers기존 비전 모델에 프롬프트(시각 템플릿)를 추가해 특정 태스크로 효율적 전이.
VisionDataset Distillation by Matching Training TrajectoriesYoutubeDataset Distillation, Efficient Retraining모델 학습 과정을 모사·압축한 데이터셋으로 빠른 재학습·전이 가능.
VisionYOLO v6YoutubeOne-Stage Object Detection, YOLO SeriesYOLO 계열 최신 버전으로, 경량화·정확도 모두 개선한 객체 검출 프레임워크.
VisionInstructBLIP: Towards General-purpose Vision-Language Models with Instruction TuningYoutubeVision-Language, Instruction Tuning시각+언어 모델에 지시문(Instruction)을 학습해 다목적 태스크 수행 능력 강화.
VisionImageBind One Embedding Space To Bind Them AllYoutubeMulti-modal Embedding, Universal Representation텍스트·오디오·이미지 등 여러 모달을 단일 임베딩 공간으로 통합해 범용 표현.
VisionLearning to Generate Text grounded Mask for Open world Semantic Segmentation from Only Image-Text PairsYoutubeOpen-world Segmentation, Vision-Language이미지-텍스트 쌍만으로 세그멘테이션 마스크를 생성, 오픈월드 환경에 적용 가능.
VisionDrag Your GAN: Interactive Point-based Manipulation on the Generative Image ManifoldYoutubeGAN-based Image Editing, Interactive ManipulationGAN 잠재공간에서 포인트 드래그 방식으로 직관적 이미지 편집·변형.
VisionSegment Anything in High QualityYoutubeHigh-Quality Segmentation, SAMSegment Anything 모델을 개선해 고화질·정확도 높은 세분화 제공.
VisionMulti Domain Learning for Motion MagnificationYoutubeMotion Magnification, Multi-Domain Learning다양한 도메인에서 미세한 움직임을 증폭해 관찰하도록 학습, 의료·산업 등 활용 가능.
Vision3D Gaussian Splatting for Real Time Radiance Field RenderingYoutubeNeRF Rendering, Real-time3D 점 클라우드에 가우시안 스플랫을 적용, 실시간 방사장(NeRF) 렌더링 구현.
VisionVoxelNet End-to-End Learning for Point Cloud Based 3D Object DetectionYoutube3D Object Detection, Voxel-based NetworksVoxelNet 구조로 점구름(포인트 클라우드) 입력을 직접 학습, 3D 검출 정확도 개선.
VisionDreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven GenerationYoutubeText-to-Image Diffusion, Subject-driven Generation텍스트→이미지 확산 모델을 특정 주제나 스타일에 맞춰 파인튜닝, 맞춤형 이미지 생성 가능.
VisionMIC Masked Image Consistency for Context Enhanced Domain AdaptationYoutubeDomain Adaptation, Masked Consistency마스킹된 이미지를 활용해 도메인 적응 시 맥락 정보 일관성을 유지, 성능 강화.
Vision / RoboticsVGGT: Visual Geometry Grounded TransformerYoutube3D Reconstruction, Visual Geometry, Foundation Model별도의 복잡한 최적화 없이 이미지 기반 3D 구조 이해를 수행하는 비전 지오메트리 모델로, 3D 인식·재구성의 실용성을 높임.
Vision / RoboticsLAPA: Learning Action Priors without Action LabelsYoutubeRobot Learning, Action Prior, Vision-Language-Action명시적인 로봇 액션 라벨 없이도 행동 prior를 학습하여 로봇 제어 데이터 구축 비용을 낮추는 접근.
Vision / RoboticsNVIDIA GR00T N1YoutubeHumanoid Robot, Vision-Language-Action, Robotics Foundation Model휴머노이드 로봇을 위한 범용 파운데이션 모델 방향성을 제시하며, 언어·시각·행동을 통합한 로봇 지능 구현을 목표로 함.
Vision / RoboticsSmolVLA: A Vision Language Action Model for Affordable and Efficient RoboticsYoutubeVision-Language-Action, Robotics, Efficient Model저비용·고효율 로봇 제어를 위해 경량 VLA 모델을 제안, 실제 로봇 적용 가능성을 높임.
Vision / RoboticsRDT-1B: A Diffusion Foundation Model for Bimanual ManipulationYoutubeDiffusion Policy, Bimanual Manipulation, Robotics양팔 로봇 조작을 위한 대규모 디퓨전 기반 파운데이션 모델로, 복잡한 조작 행동을 생성적으로 학습.
Vision / RoboticsAnyGrasp: Robust and Efficient Grasp Perception in Spatial and Temporal DomainsYoutubeGrasp Detection, 3D Perception, Robotics공간적·시간적 정보를 함께 활용해 다양한 환경에서 안정적인 로봇 grasp perception을 수행.
Vision-LanguageInternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic TasksYoutubeVision Foundation Model, VLM, Multimodal Alignment대규모 비전 파운데이션 모델을 확장하고 언어 모델과 정렬하여 범용 시각-언어 태스크 성능을 강화.
Vision-LanguageYour Large Vision-Language Model Only Needs A Few Attention Heads For Visual GroundingYoutubeVisual Grounding, Attention Head Analysis, LVLM대형 VLM의 시각적 위치 이해가 소수의 attention head에 집중된다는 점을 분석해 모델 해석성과 효율화 가능성을 제시.
VisionBoosting Cross-Spectral Unsupervised Domain Adaptation for Thermal Semantic SegmentationYoutubeThermal Segmentation, UDA, Cross-Spectral LearningRGB와 열화상 간 도메인 차이를 줄여 열화상 세그멘테이션 성능을 높이는 비지도 도메인 적응 연구.
Recommend SystemMatrix Factorization Technique for Recommender SystemYoutube
paper
Recommendation system사용자-아이템 행렬 분해 기법으로 대규모 협업필터링 구현, 넷플릭스 등에서 성능 입증.
Recommend SystemCollaborative Filtering for Implicit Feedback DatasetYoutuberecommender systems, Collaborative Filtering묵시적 피드백(조회·클릭) 기반 사용자 취향 예측을 협업필터링으로 처리하는 방법론.
SpeechA comparison of S2S models for speech recognitionYoutube
paper
Speech Recognition음성인식에서 여러 S2S(seq2seq) 모델을 비교·분석하여 장단점 파악 및 성능 비교.
FundamentalRAdamYoutube
blog
paper
Regularization, Stochastic OptimizationAdam의 변동성 문제를 레디언스(RA) 항으로 보정해 안정적 훈련 가능.
FundamentalStacked Auto Encoder for the P300 Component DetectionYoutubebrain-computer interfaces뇌-컴퓨터 인터페이스에서 P300 신호 검출을 쌓은 오토인코더로 수행, 정확도 상승.
FundamentalA survey on Image Data Augmentation for DLYoutube
paper
Data augmentation, 3D Human Pose Estimation이미지 증강 기법을 종합적으로 정리, 3D 포즈 추정 등 다양한 태스크 성능 향상에 활용.
FundamentalTraining Confidence-calibrated classifiers for detecting out of distribution samplesYoutubeclassifiers분류 모델이 OOD(분포외) 샘플을 탐지하도록 신뢰도 보정(Confidence Calibration) 훈련 기법.
FundamentalAdamWYoutube
blog
stochastic optimizationAdam + Weight Decay 분리로 일반화 성능 향상을 꾀한 최적화 기법.
FundamentalStarganYoutubeImage-to-Image Translation, Translation다중 도메인 간 이미지 변환을 하나의 모델로 통합, 얼굴 표정·헤어스타일 등 변경 가능.
FundamentalDrop-outYoutubeDropout, Data augmentation뉴런 일부를 무작위로 비활성화해 과적합 억제, 일반화 성능 향상.
FundamentalBLEU: a Method for Automatic Evaluation of Machine TranslationYoutubeevaluation기계 번역 결과 품질을 n-그램 중복도로 측정하는 BLEU 지표 제안, 이후 표준 평가척도로 활용.
Fundamentalt-SNEYoutubeDimensionality Reduction고차원 데이터(임베딩 등)를 2D·3D로 시각화해 구조 파악에 유용.
FundamentalGpipeYoutubeSynchronous Pipeline Parallel, Model Parallel Methods대형 모델 병렬화를 파이프라인 단위로 분할해 메모리 사용 효율 및 학습 속도 향상.
Fundamentalexplainable aiYoutubeinterpretability, sensitivity analysis모델의 결정 과정을 해석·민감도 분석해 신뢰도·투명성 향상.
FundamentalTAPASYoutubeDeep Tabular Learning, Table Question Answering Models테이블 QA에 특화된 변형 BERT 모델로, 행·열 정보를 활용해 정교한 질의응답 수행.
FundamentalLearning both Weights and Connections for Efficient Neural NetworksYoutubeNeural networks가중치와 연결(pruning)을 동시에 학습, 신경망 경량화와 정확도 유지 추구.
FundamentalReVACNNYoutubeVisualization, Convolutional Neural NetworkCNN 내부 특징 맵을 시각화·분석하는 기법으로 모델 해석력을 높임.
FundamentalThe Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural NetworksYoutubeNetwork Pruning일부 가중치만 남겨도 초기화 시드가 동일하면 원래 수준 성능 달성 가능, 소위 ‘승리 티켓’ 가설 제시.
FundamentalALPHAGO : Mastering the game of Go with Deep Neural Networks and Tree SearchYoutubedeep neural networks, tree search정책망·가치망+몬테카를로 트리 탐색으로 바둑에서 프로기사 수준 초월, AI 역사적 성과.
FundamentalA Baseline for Few-Shot Image ClassificationYoutubeFEW-SHOT IMAGE CLASSIFICATION소량 샘플로 분류하는 경우에 대한 베이스라인 접근을 정립, 후속 연구 지표로 활용.
FundamentalSharp Minima Can Generalize For Deep NetsYoutubedeep learning architectures날카로운(Sharp) 최소점이 실제 일반화에 불리하다는 통념에 반대되는 실험 결과 제시.
FundamentalPediatric Sleep Stage Classification Using Multi-Domain Hybrid Neural NetworksYoutubeMulti-Domain Hybrid Neural Networks여러 도메인(EEG 등) 특징을 융합한 하이브리드 모델로 소아 수면 단계 분류 성능 향상.
FundamentalPruning from ScratchYoutubeNetwork Pruning처음부터 가지치기 구조로 학습을 시도, 기존 프루닝+재학습 절차 대비 효율적 가능성 탐색.
FundamentalDo We Need Zero Training Loss After Achieving Zero Training Error?YoutubeTraining Loss학습 오류가 0이 된 뒤에도 로스를 계속 낮출 필요가 있는지, 모델 일반화 관점에서 분석.
FundamentalDeep Recurrent Q-Learning for Partially Observable MDPsYoutubeAtari Games, OpenAI Gym부분 관측 MDP 환경에서 RNN+DQN으로 에이전트가 향상된 정책 학습 가능.
FundamentalLarge Margin Deep Networks for ClassificationYoutubeClassification, Data Augmentation마진 극대화 개념을 심층 신경망에 적용, 이미지 분류 등에서 일반화 성능 향상.
Fundamentalgenerating wikipedia by summarizing long sequencesYoutubeDocument Summarization, Extractive Summarization긴 시퀀스를 요약해 위키백과 페이지를 자동으로 생성·편집하는 접근.
FundamentalPlug and Play Language Models: A Simple Approach to Controlled Text GenerationYoutubeLanguage Modelling, Text Generation사전학습된 LM에 제약(컨트롤) 모듈만 추가해 원하는 스타일·주제의 텍스트 생성 가능.
FundamentalWhat Uncertainties Do We Need in Bayesian Deep Learning for Computer Vision?YoutubeDepth Estimation, Semantic Segmentation컴퓨터 비전에서 필요한 불확실성(에피스테믹·알레이터릭) 유형을 구분해 모델 신뢰성 높임.
FundamentalKREDYoutubeEntity Embeddings, News Recommendation뉴스 추천에서 개체(entity) 임베딩을 도입해 사용자 맞춤형 기사 배치를 정교화.
FundamentalDIFUSCO: Graph based Diffusion Solvers for Combinatorial OptimizationYoutubeDiffusion, solver그래프 기반 확산(diffusion) 기법으로 조합 최적화 문제(경로찾기 등)를 효과적으로 푸는 접근.
FundamentalEarly Stopping as nonparametric VariationalYoutubeVariational Inference조기 종료(Early Stopping)를 비모수적 변분 추론 관점으로 해석, 과적합 방지 설명 제공.
FundamentalSharpness Aware Minimization for efficeintly improving generalizationYoutubeGENERALIZATION손실 지형의 샤프니스(Sharpness)를 낮춰 일반화 성능을 높이는 SAM(Sharpness-Aware Minimization).
FundamentalNeural Graph Collaborative FilteringYoutubeCollaborative Filtering, Link Prediction그래프 기반 협업필터링 모델로, 사용자-아이템 링크를 예측·추천.
FundamentalRestricting the Flow: Information Bottlenecks for AttributionYoutubeDecision Making정보 병목(Bottleneck)을 활용해 모델 결정 경로를 추적·공헌도 측정(Attribution).
FundamentalReal world Anomaly Detection in Surveillance VideosYoutubeActivity Recognition, Anomaly Detection In Surveillance Videos실제 감시 영상에서의 이상 행동 감지를 위한 효율적인 딥러닝 접근.
FundamentalBRECQ: Pushing the Limit of Post-Training Quantization by Block ReconstructionYoutubeImage Classification Object Detection블록 단위 재구성을 통한 정밀한 후처리 양자화 기법, 분류·검출 모두 높은 성능 유지.
FundamentalDeep sets (2017 NIPS)Youtubedesigning models집합 입력을 순서와 무관하게 처리하는 딥셋(DeepSets) 아이디어 제시, 대칭 함수 기반 학습.
FundamentalStyleGAN2YoutubeGenerative Adversarial Networks, Generative Models업그레이드된 아키텍처로, 더욱 사실적이고 다채로운 이미지를 생성할 수 있는 GAN 모델.
FundamentalBeyond Synthetic Noise: Deep Learning on Controlled Noisy LabelsYoutubeImage Classification인위적으로 제어된 노이즈 라벨 환경에서의 딥러닝 성능 분석, 노이즈 강인성 연구.
FundamentalDeep Reinforcement Learning for Online Advertising Impression in Recommender SystemsYoutubeRecommendation Systems온라인 광고 노출(Impression)을 강화학습으로 최적화, 추천 시스템 수익 극대화 시도.
FundamentalLongformer: The Long-Document TransformerYoutubeLanguage Modelling, Question Answering희소 어텐션(sparse attention)으로 긴 문서(최대 수천~수만 토큰) 처리 가능, QA·분류 성능 향상.
Fundamentalsoft actor criticYoutubePolicy Gradient Methods액터-크리틱에 엔트로피 보상을 추가해 탐색 다양성·학습 안정성을 높이는 강화학습 기법.
FundamentalLoss Function Discovery for Object Detection via Convergence-Simulation Driven SearchYoutubeObject Detection, Loss Function Search시뮬레이션 기반 탐색으로 최적의 손실 함수를 자동으로 찾는 기법을 객체 검출에 적용.
FundamentalThe Deep Bootstrap Framework: Good Online Learners are Good Offline GeneralizersYoutubeOnline Learning, Bootstrap Framework온라인에서 잘 학습하는 부트스트랩 기법이 오프라인 일반화에도 유리함을 보임.
FundamentalMeta HINYoutubeHeterogeneous Info Networks, Graph Representation이기종 정보 네트워크(heterogeneous graph) 상에서 메타 러닝 기법을 적용해 구조적 표현을 학습.
FundamentalWhen Vision Transformers Outperform ResNets without Pretraining or Strong Data AugmentationsYoutubeDomain Generalization, Fine-Grained Classification별도 사전학습이나 강력한 증강 없이도 비전 트랜스포머가 레스넷보다 우수한 결과를 보이는 케이스 분석.
FundamentalSelf similarity Student for Partial Label Histopathology Image SegmentationYoutubePartial-Label, Histopathology Segmentation부분 라벨(Partial Label) 환경의 조직 이미지(병리) 세그멘테이션에서 자가 유사도 방식 활용.
FundamentalANALYSING MATHEMATICAL REASONING ABILITIES OF NEURAL MODELSYoutubeMath Reasoning, Word Problem Solving신경망의 수학 추론(문제 풀이) 능력을 평가하고 한계를 분석한 연구.
FundamentalSelf-training Improves Pre-training for Natural Language UnderstandingYoutubeSelf-training, Few-Shot Learning셀프 트레이닝을 통해 NLU 사전학습 모델의 적은 데이터 환경 성능을 향상.
FundamentalPreference Amplification in Recommender SystemsYoutubeRecommender Systems, Preference Amplification추천 시스템에서 사용자 취향이 극단적으로 증폭되는 현상을 분석·완화하는 연구.
FundamentalDo We Really Need to Access the Source Data? Source Hypothesis Transfer for Unsupervised Domain AdaptationYoutubeSource Hypothesis Transfer, Unsupervised Domain Adaptation소스 데이터를 직접 접근하지 않고도 가설(모델 파라미터)만으로 도메인 적응을 수행하는 기법 제안.
FundamentalLearning to Learn at Test Time RNNsYoutubeMeta-Learning, Test-Time Adaptation테스트 단계에서도 순환신경망(RNN)이 자체 학습(메타 러닝)을 수행해 예측 성능 개선.
FundamentalDouble Gumbel Q-LearningYoutubeRL, Double Q-Learning, Gumbel Noise이중 Q-Learning에 Gumbel 분포 노이즈를 사용해 탐색성과 안정성을 높인 강화학습 기법.
FundamentalConfidence Estimation Using Unlabeled DataYoutubeConfidence Estimation, Semi-supervised Learning라벨이 없는 데이터를 활용해 분류 모델의 신뢰도(Confidence)를 추정·보정.
FundamentalEvaluating Classifiers by Means of Test Data with Noisy LabelsYoutubeClassifier Evaluation, Noisy Labels라벨 노이즈가 있는 테스트 데이터에서 분류기를 평가하는 방법 제안.
FundamentalProgressive Identification of True Labels for Partial-Label LearningYoutubePPartial Label Learning, Progressive Label Refinement부분 라벨 환경에서 점진적으로 진짜 라벨을 식별해 학습 정밀도를 높이는 접근.
FundamentalFine-grained Interest Matching For Neural News RecommendationYoutubeNews Recommendation, Fine-grained Matching뉴스 추천에서 세분화된 사용자 관심사(interest) 매칭을 통해 추천 품질 향상.
FundamentalAdversarial Reinforced Learning for Unsupervised Domain AdaptationYoutubeTransfer Learning, RL-based Domain Adaptation강화학습과 적대적(Adversarial) 방식을 결합해 도메인 적응 시 라벨 없는 데이터 활용도 개선.
FundamentalNeural Tangent Kernel - Convergence and Generalization in neural NetworkYoutubeNeural Tangent Kernel, Gaussian Process NTK관점에서 신경망의 수렴·일반화 특성을 분석, 가우시안 프로세스와의 유사점 탐구.
FundamentalIntriguing Properties of Contrastive LossesYoutubeContrastive Learning, Data Augmentation대조학습 손실 함수들의 숨은 특성·데이터 증강 전략이 모델 임베딩에 미치는 영향 탐색.
FundamentalGrokking: Generalization Beyond Overfitting on Small Algorithmic DatasetsYoutubeAlgorithmic Generalization, Overfitting작은 알고리즘 데이터셋에서 한참 오버피팅 후 갑작스런 일반화(grokking) 현상을 분석한 연구.
FundamentalTransformer Interpretability Beyond Attention VisualizationYoutubeTransformer Explanation, Interpretation트랜스포머 해석 시 어텐션 시각화만으로는 부족, 추가 기법으로 내부 작동 원리 파악 시도.
FundamentalHow does unlabeled data improve generalization in self-training?YoutubeSelf-training, Semi-supervised Learning라벨 없는 데이터가 셀프 트레이닝에서 일반화 성능 향상에 기여하는 원리를 분석.
FundamentalRainbow: Combining Improvements in Deep Reinforcement LearningYoutubeRainbow DQN, Montezuma's Revenge DQN계열 기법(우선순위 리플레이·NoisyNet 등)을 결합한 Rainbow가 고난이도 게임을 잘 해결.
FundamentalOnce-for-All: Train One Network and Specialize it for Efficient DeploymentYoutubeNeural Architecture Search, Model Specialization단 한 번의 거대 네트워크 학습 후, 기기별 요구사항에 맞춰 하위 네트워크를 추출·사용.
FundamentalEffective Diversity in Population Based Reinforce LearningYoutubePopulation-based RL, Diversity Optimization개체군(인구) 기반 RL에서 다양성 유지를 통해 탐색 성능과 수렴성을 향상.
FundamentalFine-Tuning can Distort Pretrained Features and Under perform Out-of-DistributionYoutubeFine-tuning Instability, OOD Generalization파인튜닝 과정이 사전학습된 특징을 망가뜨려 OOD 일반화 성능이 떨어지는 문제 고찰.
FundamentalGCN-LRP explanationexploring latent attention of graph convolutional networksYoutubeGraph Interpretability, GCN Explanation그래프 합성곱 네트워크(GCN)의 예측 근거를 LRP(Layer-wise Relevance Propagation) 방식으로 해석.
FundamentalGQA : Training Generalized Multi Query Transformer Models from Multi Head CheckpointYoutubeMulti-Query Transformer, Checkpoint Merging멀티 헤드 체크포인트를 합쳐 다목적 질의(Q) 트랜스포머 모델로 훈련.
FundamentalTowards Safe Online Reinforced Learning in Computer SystemsYoutubeSafe Online RL, Computer Systems실제 컴퓨터 시스템 환경에서 안전(safety) 제약을 고려한 온라인 RL 연구.
FundamentalConflict-Averse Gradient Descent for Multi-task LearningYoutubeMulti-task Learning, Gradient-based Optimization여러 태스크 간 충돌을 줄이는 경사하강 기법으로 멀티태스크 학습 효율 향상.
FundamentalExplainability Methods for Graph Convolutional Neural NetworksYoutubeGraph Explainability, GCNGCN 모델을 해석하기 위한 다양한 방법론(서브그래프 추출 등) 정리.
FundamentalBayesian Action Decoder for Deep Multi-Agent Reinforcement LearningYoutubeMulti-Agent RL, Bayesian Inference다중 에이전트 강화학습에서 액션 디코더를 베이지안 방식으로 설계해 불확실성·상호작용 처리.
FundamentalEfficiently Identifying Task Grouping for Multi-Task LearningYoutubeMulti-Task Learning, Task Grouping 여러 태스크를 효과적으로 묶어 학습 비용·성능을 최적화하는 방법론.
FundamentalDeepFM: A Factorization-Machine based Neural Network for CTR PredictionYoutubeCTR Prediction, Recommendation팩터라이제이션 머신(FM)과 딥러닝을 결합해 클릭확률 예측(CTR) 정확도 향상.
FundamentalDeep Neural Networks for YouTube RecommendationsYoutubeYouTube Recommendation, Ranking유튜브 대규모 추천 시스템에 특화된 딥러닝 구조로 실시간 사용자 맞춤 추천 구현.
FundamentalGenome wide prediction of disease variant effects with a deep protein langYoutubeProtein LM, Disease Variant Prediction단백질 언어모델을 활용해 질병 관련 유전자 변이의 영향을 전장(Genome-wide) 예측.
reinforcement learningReinforcement Learning for Optimizing RAG for Domain ChatbotsYoutubeRAG Optimization, Chatbot RL도메인 챗봇에서 RAG(Retrieval-Augmented Generation)을 강화학습으로 최적화.
reinforcement learningDeep reinforcement learning from human preferencesYoutubeHuman-in-the-Loop RL, Preference Learning인간의 선호도 신호를 이용해 RL 에이전트를 학습, 보상 함수 추정 없이 정책 최적화.
reinforcement learningDistributional Reinforcement Learning via Moment MatchingYoutubeDistributional RL, Moment Matching Q함수를 분포로 다루는 Distributional RL 기법에서 모멘트 매칭으로 학습 안정화.
reinforcement learningOnline Continual Learning on class Incremental Blurry Task Configuration with anytime inferenceYoutubeContinual RL, Class-Incremental순차적·증분적 태스크 환경에서 RL 에이전트가 지속적으로 학습·추론하는 방법 제안.
reinforcement learningDream To Control : Learning Behaviors by Latent ImaginationYoutubeModel-Based RL, Dreamer Approach잠재공간에서 ‘꿈(rollout)’을 만들어 행동 정책을 학습하는 Dreamer 방식 확장.
reinforcement learningProximal Policy Optimization AlgorithmsYoutubePolicy Gradient, PPO KL발산을 이용해 정책 갱신 폭을 제한, 샘플 효율성과 안정성을 높인 RL 기법.
reinforcement learningReinforced Genetic Algorithm Learning for Optimizing Computation GraphsYoutubeGenetic Algorithm, RL for Computation Graph GA와 RL을 결합해 연산 그래프 최적화(컴파일러 최적화 등)에 적용.
reinforcement learningVariBAD: A Very Good Method for Bayes-Adaptive Deep RL via Meta-LearningYoutubeBayes-Adaptive RL, Meta-Learning환경 불확실성을 베이지안으로 다루고, 메타학습을 통해 빠른 적응을 구현하는 RL 기법.
reinforcement learningmPLUG: Effective and Efficient Vision-Language Learning byCross-modal Skip-connectionsYoutubeVision-Language Model, Cross-Modal Learning스킵 연결로 멀티모달(이미지+텍스트) 학습 효율을 높이는 mPLUG 아키텍처. (RL과 직접 관련은 미미하지만, 섹션상 RL로 분류됨)
reinforcement learningMOReL: Model-Based OfflineReinforcement LearningYoutubeOffline RL, Model-Based실제 환경 데이터 없이 모델(환경 시뮬레이션)로 학습하는 오프라인 강화학습 기법.
reinforcement learningRL upside downYoutubeReverse RL, Goal-Conditioned보상 대신 목표 상태부터 행동을 추론하는 역발상 RL 접근, 목표 지향 문제에 적용.
reinforcement learningTrans DreamerYoutubeTransformer-based Dreamer, Model-Based RL Dreamer모델을 트랜스포머 구조로 확장해 장기 시퀀스 행동 계획 정확도 개선.
reinforcement learningDirect Preference Optimization Your Language Model is Secretly a Reward ModelYoutubeLLM as Reward Model, Preference Optimization언어모델(LLM)을 보상 모델로 간주해 직접 선호 최적화(Direct Preference Optimization) 수행.
reinforcement learningTrajectory TransformerYoutubeDecision Transformer, Sequence Modeling행동 궤적(trajectory)을 트랜스포머로 모델링해 RL 문제를 시퀀스 예측으로 접근.
reinforcement learningAddressing Optimism Bias in Sequence Modeling for RLYoutubeSequence Modeling RL, Optimism Bias시퀀스 모델 기반 RL에서 과도한 낙관 편향(optimism bias)을 완화하는 방법 연구.
reinforcement learningOnline Decision TransformerYoutubeOnline RL, Decision Transformer의사결정 트랜스포머(Decision Transformer)를 온라인 학습 시나리오로 확장한 기법.
reinforcement learningRLPROMP: Optimizing Discrete Text Prompts with Reinforcement LearningYoutubePrompt Optimization, RL for NLP NLP프롬프트를 RL로 최적화해, 원하는 응답·출력 양식을 유도하는 기법 (Discrete Prompt).
Vision-LanguageQPrompt: Quantized Prompt for Efficient Generalization of Vision Language ModelYoutubeQuantized Prompt, VLM Generalization, Efficient Adaptation비전-언어 모델의 일반화 성능을 높이기 위해 프롬프트를 양자화하여 효율적인 적응을 수행.
Reinforcement LearningVCRL: Variance Based Curriculum Reinforcement Learning for Large Language ModelYoutubeCurriculum RL, LLM Alignment, Variance-based Learning분산 기반 커리큘럼을 활용해 LLM 강화학습의 안정성과 학습 효율을 높이는 접근.
Vision / Generative ModelDiffusion LMMs Can Do Faster-Than-AR Inference via Discrete Diffusion ForcingYoutubeDiffusion LMM, Faster-than-AR, Generative Modeling이산 디퓨전 포싱을 통해 자동회귀 방식보다 빠른 멀티모달 생성 가능성을 제시.
Person Re-IDFrom Poses to Identity: Training-Free Person Re-Identification via Feature CentralizationYoutubePerson Re-ID, Training-Free Method, Feature Centralization별도 학습 없이 포즈와 특징 중심화를 활용해 사람 재식별 성능을 확보하는 방법.
Vision-Language / PreferenceOViP: Online Vision-Language Preference LearningYoutubePreference Learning, Vision-Language Model, Online Learning온라인 선호 학습을 통해 VLM이 사용자 의도와 시각적 판단 기준에 더 잘 맞도록 조정.

Latest uploads & scheduled releases (2026–2027)

The 19 reviews below were restored from the meeting archive with custom thumbnails, paper-based descriptions, and SRT captions. Videos are released every Monday at 20:00 KST in presentation-date order.

Release (KST)TaskPaperLinksHighlights
2026-08-31Vision / MultimodalC-MPDRYouTube · Paper정합과 융합을 한 단계에서 수행해 멀티모달 영상의 고스트와 왜곡을 줄입니다.
2026-09-07Video GenerationLTX-VideoYouTube · PaperVideo-VAE와 latent diffusion으로 5초 영상을 실시간보다 빠르게 생성합니다.
2026-09-14Vision / DetectionYOLO-WorldYouTube · Paper텍스트 프롬프트로 처음 보는 클래스까지 실시간 탐지하는 open-vocabulary detector입니다.
2026-09-21Generative ModelSimple Guidance Mechanisms for Discrete Diffusion ModelsYouTube · Paper연속 확산의 guidance를 이산 공간으로 확장해 생성 결과를 조건에 맞게 제어합니다.
2026-09-28LLM / ReasoningDon't Overthink ItYouTube · Paper짧은 추론 경로 선호가 정확도와 토큰 효율을 함께 높일 수 있음을 분석합니다.
2026-10-05Autonomous DrivingAdaRIPYouTube · Paper분포 이동을 감지하고 안전하게 회복하며 전문가 피드백으로 온라인 적응합니다.
2026-10-12LLM / ReasoningDeepConfYouTube · Paper내부 confidence로 낮은 품질의 추론 경로를 걸러 test-time reasoning을 효율화합니다.
2026-10-19Robotics / VLASmolVLAYouTube · Paper약 450M 파라미터로 소비자용 하드웨어에서도 동작하는 경량 VLA 모델입니다.
2026-10-26NLP / RAGREFRAGYouTube · Paper검색 문맥을 압축·선별해 긴 컨텍스트와 빠른 첫 토큰 생성을 함께 달성합니다.
2026-11-02LLM / Fine-TuningAnalyzing the Effects of Supervised Fine-Tuning on Model KnowledgeYouTube · PaperSFT 데이터 증가가 항상 지식 향상으로 이어지지 않는 현상을 분석합니다.
2026-11-09NLP / Diffusion LMScaling Up Masked Diffusion Models on TextYouTube · Papermasked diffusion LM의 스케일링 특성과 양방향·비자동회귀 생성 가능성을 보입니다.
2026-11-16Speech / MultimodalFreeze-OmniYouTube · PaperLLM을 고정한 채 음성 모듈만 학습해 저지연 speech-to-speech 대화를 구현합니다.
2026-11-23Vision / Generative ModelScalable Diffusion Models with Transformers (DiT)YouTube · PaperU-Net 대신 Transformer를 사용하고 모델 규모에 따른 확산 모델의 성능 향상을 보입니다.
2026-11-30Vision / Generative ModelScaling Rectified Flow Transformers for High-Resolution Image SynthesisYouTube · Paperrectified flow와 멀티모달 Transformer를 결합한 고해상도 이미지 생성 방법입니다.
2026-12-07NLP / RAGMiniRAGYouTube · Paper작은 언어 모델에서도 동작하는 단순하고 저장 효율적인 graph-based RAG를 제안합니다.
2026-12-14Vision / State Space ModelVMambaYouTube · Paper2D selective scan으로 전역 시각 문맥을 선형 시간에 모델링합니다.
2026-12-21Robotics / VLAπ0: A Vision-Language-Action Flow Model for General Robot ControlYouTube · PaperVLM과 flow-matching action expert를 결합해 여러 로봇의 연속 동작을 생성합니다.
2026-12-28Reinforcement LearningEvolution Strategies at the Hyperscale (EGGROLL)YouTube · Paper저랭크 perturbation으로 역전파 없이 대규모 모델의 진화 전략 학습을 확장합니다.
2027-01-04Vision / Self-Supervised LearningWhat Do Self-Supervised Vision Transformers Learn?YouTube · Paper대조학습과 masked image modeling이 ViT에서 학습하는 표현의 차이를 분석합니다.
deeplearning
deep-learning-tutorial

Contributors

diversity12

25 commits

Lilcob

24 commits

Languages

HTML

100.0%