SMALL 전체 글141 LIGRAM 논문 분석 01 · One-liner한 줄 핵심 요약한국어 단문의 "생략된 문맥"을 형태소·품사·개체명 그래프로 복원하고,토픽 분포 기반 대조학습으로 의미 경계를 강화하여레이블이 극소한 환경에서도 정확한 단문 분류를 수행하는 모델이다.02 · Problem왜 한국어 단문 분류는 어려운가영어는 어순이 고정되어 있고 조사가 없어서 짧은 문장도 의미가 명확하다. 그러나 한국어는 교착어(agglutinative language)라는 특성상, 조사·어미가 생략되면 의미가 폭발적으로 불확실해진다."병원 갔다" ← 조사·어미 생략→ 치료받으러 갔다 (환자)→ 문병하러 갔다 (방문자)→ 검진받으러 갔다 (건강검진)→ 일하러 갔다 (의료진)"배터리 갈다" ← 명사 + 동사만 남음→ 배터리를 교체하라 (명령).. 2026. 6. 1. Retrieval-Augmented Generation forKnowledge-Intensive NLP Tasks 1. 한 줄 핵심 요약LLM의 파라메트릭 지식의 한계를 non-parametric 외부 메모리(검색)와 결합하여, 지식 집약적 NLP 태스크를 위한 범용 생성 프레임워크를 제안한다. 2. 문제 정의왜 이 논문이 등장했는가?2020년 당시 BERT, T5, BART 등 대형 사전학습 모델이 NLP 벤치마크를 지배하고 있었다.이 모델들은 파라미터 안에 방대한 factual knowledge를 내재화하지만, 그 지식에 접근하고 정밀하게 활용하는 능력은 근본적으로 제한적이었다.기존 방법의 근본적 한계:Closed-book 모델(T5, BART): 지식이 파라미터에 고정되어 있어 업데이트 불가, hallucination 발생, 어떤 근거로 생성했는지 추적 불가기존 Retrieval 모델(DrQA, DPR+extr.. 2026. 4. 16. 2과목 - 오답노트 정리 [CRISP-DM vs KDD]CRISP-DM : 피드백 가능 구조비즈니스 이해 → 데이터 이해 → 데이터 준비 → 모델링 → 평가 → 배포KDD데이터 선택 → 전처리 → 변환 → 마이닝 → 해석 (전처리, 변환 순서 헷갈리지 않기)[하향식접근법 vs 상향식접근법]하향식 접근법(TOP-DOWN)문제 탐색 → 문제 정의 → 해결방안 탐색 → 타당성 검토상향식 접근법(BOTTOM-UP)데이터 수집 → 탐색적 분석(EDA) → 패턴 발견 → 인사이트 검출[데이터 거버넌스]데이터 거버넌스 : 데이터를 제대로 관리하기 위한 전제규칙 + 체계데이터 표준화 : 기준 만들기(용어통일, 형식통일 등)데이터 관리체계 : 관리 방법 정의(누가, 어떻게/정책,프로세스 등)데이터 저장소 관리 : 실제 데.. 2026. 4. 7. 1과목 - 헷갈리는 약어 및 데이터 단위 정리 [기업/데이터 시스템 약어 정리]ESP : 전사 자원 관리(회사 내부 전체 관리)SCM : 공급망 관리(물류, 유통, 재고)CRM : 고객 관계 관리(고객 데이터)KMS : 지식 관리(노하우, 문서)BI : 의사결정 지원(분석결과 제공)OLAP : 다차원 분석도구(분석 지원)OLTP : 실시간 업무 처리 시스템(빠른 처리)EAI : 시스템 연결(시스템 통합)[추가 중요 약어]RTE : 실시간 기업(REAL-TIME 처리)DW : 데이터 웨어하우스(통합분석데이터)DM : 데이터 마트(부서 분석 데이터)DB : 데이터베이스(업무 데이터)ITS : 지능형 교통 시스템(Intelligent Transport System)[데이터 단위]KB → MB → GB → TB → PB → EB → ZB → YB 2026. 4. 7. Large language models meet NLP: a survey 1. 한 줄 핵심 요약 LLM은 NLP를 task별 모델 학습 문제 → 하나의 generative inference 문제로 전환시켰고, 그 핵심은 prompt 기반 적응(inference-time) vs parameter tuning 기반 적응(training-time)이다.2. 문제 정의 (왜 이 논문이 등장했는가)🔹 기존 NLP 구조적 한계기존 NLP는 다음과 같은 구조였다:Task 정의 → Dataset 구축 → Model 설계 → Training → Inference이 구조의 근본적인 한계는 명확하다.task마다 모델이 필요데이터 수집 비용이 큼새로운 task에 대한 generalization이 약함즉, task마다 다시 배워야 하는 구조🔹 LLM 등장 이후의 변화 LLM은 다음을 가능하게 만.. 2026. 4. 6. 나라장터 연구용역 입찰 일정 정리하는 방법 (신입 실무 정리) 연구소에 입사하고 처음으로 나라장터 입찰 일정 정리 업무를 맡게 되었다. 공고문과 제안요청서를 처음 보면 내용이 길고 연구내용 중심이라실제 일정과 제출 절차를 파악하는 것이 쉽지 않았다. 특히 “입찰 일정”, “제안서 제출”, “공동수급 협정서” 같은 용어는실무 경험이 없으면 구조적으로 이해하기 어렵다. 이번 과제를 정리하면서신입 입장에서 가장 헷갈렸던 부분과실제로 정리한 방법을 공유한다(잊어버리고 또 헤맬 나를 위해). ✔ 연구용역 입찰 절차 전체 흐름 이해하기연구용역(협상에 의한 계약)은 일반 물품 입찰과 절차가 다르다.전체 흐름은 다음과 같다. 1️⃣ 제안서 작성2️⃣ 제안서 먼저 제출3️⃣ 가격입찰서 제출4️⃣ 기술평가 진행5️⃣ 협상 대상자 선정6️⃣ 계약 체결7️⃣ 연구 수행 및 단계별 보고?.. 2026. 3. 26. spaCy 설치 오류 1. 기존 환경과 다른 오류 => conda로 새로운 가상환경 생성 후 activate2. 그래도 오류 -오류 내용 : ImportError: cannot import name 'tarfile' from 'backports'=> backprots라는 패키지가 잘못 설치되었거나 충돌된 상태일때 발생한다고 한다.(원래 tarfile은 파이썬 표준 라이브러리인데, backports 폴더가 덮어씌운 상태) 해결 방법:2.1. 깨진 backports 패키지 삭제pip uninstall backports 2.2. 다시 spaCy 확인python -m spacy info 그래도 안됨.이유 : backports 패키지가 물리적으로 존재하는데 pip uninstall에서는 인식이 안 되는 "손상된 설치" 케이스3. 직접.. 2025. 5. 23. Dynamic Analysis of User-Role andTopic-Influence for Topic Propagationin Social Networks [abstract]소셜 네트워크에서 토픽(이슈)의 확산을 예측하는 것은 루머 대응, 여론 분석, 마케팅 전략 수립 등에 중요한 문제이다.본 연구에서는 사용자 역할(user-role)과 토픽 영향력(topic-influence)의 시간적 변화(dynamics)를 고려한 토픽 확산 예측 모델 TPP-DA를 제안한다. 본 모델은 사용자와 토픽의 변화 속성을 반영하여 예측 정확도를 향상시키며, 기존 모델(TPP) 대비 평균 오차율을 약 33% 줄이는 성과를 보였다.[introduction]소셜 미디어는 오늘날 뉴스, 이슈, 루머 등이 퍼지는 가장 빠른 채널이다. 하지만 이 확산 과정은 매우 복잡하며 다음과 같은 특징이 있다:사용자의 관심은 시시각각 변함토픽의 인기(heat)도 지속적으로 변함소셜 관계는 확산에 .. 2025. 4. 22. 3. 코딩과 디버깅에 대하여 "코딩의 중요성을 간과하지 말라"▶ 좋은 코드를 짜기 위한 원칙1. 간결한 코드를 작성하기코드가 짧으면 짧을수록 오타나 단순한 버그가 생길 우려가 줄어들고, 디버깅도 쉬워진다. 2. 적극적으로 코드 재사용하기코드 모듈화가 가장 직접적인 방법.같은 코드가 반복된다면 이들을 함수나 클래스로 분리해 재사용하자. 3. 표준 라이브러리 공부하기간결한 코드를 작성하기 위한 중요한 원칙 중 하나. 공부를 잘 해두자. 4. 항상 같은 형태로 프로그램을 작성하기자주 작성하는 알고리즘이나 코드 등에 대해서는 한 번 검증된 코드를 작성하고 이것만을 꾸준히 사용하자. 5. 일관적이고 명료한 명명법 사용하기모호하지 않은 변수명과 함수명을 사용하는 버릇을 들이고, 사용하는 언어의 표준 라이브러리에서 사용하는 명명 규약을 익히자... 2025. 3. 2. 이전 1 2 3 4 ··· 16 다음