제약 회사는 임상 시험 현장 문서(텍스트)를 감사하고 감사관이 검토 우선순위를 정할 수 있도록 코퍼스 전체에서 상위 10개 토픽을 찾아야 합니다. 부작용을 언급하는 문서는 우선순위를 지정해야 합니다. 데이터 과학자는 통계적 토픽 모델링을 사용하여 추상적인 토픽을 찾고 토픽별 상위 단어를 나열할 것입니다. 어떤 알고리즘이 가장 적합할까요? (두 가지 선택)
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: Latent Dirichlet Allocation (LDA), Neural topic modeling (NTM).
이것이 정답인 이유
잠재 디리클레 할당(LDA)은 문서 컬렉션에서 추상적인 "주제"를 발견하는 데 사용되는 통계적 토픽 모델링 알고리즘입니다. 이는 각 문서가 주제의 혼합으로 구성되고 각 주제는 단어의 혼합으로 구성된다는 가정에 기반합니다. 신경망 토픽 모델링(NTM)은 텍스트 데이터의 잠재적 토픽을 식별하기 위해 신경망을 활용하는 최신 접근 방식입니다. 이 두 가지 방법 모두 임상 시험 문서에서 상위 토픽을 식별하고 부작용과 관련된 문서를 우선순위화하는 데 적합합니다. 랜덤 포레스트 분류기, 선형 서포트 벡터 머신 및 선형 회귀는 분류 또는 회귀 작업에 사용되는 지도 학습 알고리즘이며, 이 시나리오에서와 같이 레이블이 지정되지 않은 텍스트 데이터에서 토픽을 발견하는 데는 적합하지 않습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음