LinkedIn이 다중 교수 증류를 통해 AI 구직을 8배 더 빠르게 교육하는 방법

LinkedIn이 다중 교수 증류를 통해 AI 구직을 8배 더 빠르게 교육하는 방법


LinkedIn은 대규모 교사 모델의 지식을 소형 0.6B 매개변수 분류 모델로 압축하는 다중 교사 증류 파이프라인을 설명하는 AI 기반 구직 뒤에 있는 교육 인프라에 대한 세부 정보를 공개했습니다. 주요 기여는 증류 기술뿐만이 아닙니다. 반복을 위해 충분히 빠르게 만드는 것은 시스템 작업입니다. 여기에는 교육 주기에 직접 교사 모델을 제공하는 SGLang 기반 사용자 정의 프레임워크가 포함됩니다.

클릭수, 앱 등 관련성 및 참여 목표를 개선하기 위해 소규모 언어 모델(SLM)을 교육하려면 각 교육 사례에 대해 하나 이상의 대형 교사 모델을 쿼리해야 합니다. 해당 교사에게 참석하면 프로세스가 느려질 수 있습니다. 이는 LinkedIn 규모에서 초당 수십만 개의 쿼리를 처리해야 하는 순위 시스템에 병목 현상이 됩니다. 많은 검색 및 추천 팀이 공통적인 문제에 직면해 있습니다. 키워드 기반 시스템에서 LLM이 감독하는 통합 분류자로 이동하는 데 어려움을 겪습니다.

LinkedIn은 SGLang을 사용하여 여러 교사를 위한 증류 프레임워크를 만들었습니다. 이 시스템은 다양한 크기의 교사 모델을 로드하고 제공합니다. 또한 텐서 병렬 및 데이터 병렬 구성을 처리합니다. 비동기 클라이언트는 교육 중에 교사에게 질문합니다. 출력을 처리하고 이를 증류 손실에 추가합니다. 팀에서는 이 방법을 온라인 다중 교사 증류라고 부릅니다. 로컬 교사 복제본을 사용하여 여러 노드에 걸쳐 이를 확장하면 증류 프로세스 속도가 3배 빨라졌습니다. 또한 대기 시간을 낮게 유지하여 빠른 반복이 가능했습니다. 서비스 오버헤드를 줄이고 반복 계산을 피하기 위해 LinkedIn은 오프라인 다중 교수 증류를 도입했습니다. 이 모드에서 시스템은 교사 출력을 미리 계산하여 HDFS 또는 NFS에 저장합니다. 그런 다음 실시간으로 쿼리되는 대신 교육에 직접 사용됩니다.

교사/학생 연수비 전액

이러한 온라인/오프라인 분할은 메모리 사용량을 줄이고 2배 더 큰 배치 크기를 지원하기 위해 LiGer를 채택하고, 최대 3.5배의 추가 속도 향상을 위한 다중 노드 교육, 추가 20% 이득을 위한 FSDP2, 최대 30% 더 많은 H200 다중 노드 클러스터와 같은 광범위한 교육 수준 최적화 스택과 함께 배치됩니다. 팀은 FP8의 혼합 정확도를 평가했지만 실행 오버헤드가 계산 절감보다 크기 때문에 8B 매개변수가 있는 모델에서는 이점을 발견하지 못했다고 지적합니다. 이러한 최적화를 통해 게시물 제목에 언급된 훈련 속도가 대략 8배 향상되었습니다.

모델링 측면에서 LinkedIn 연구에 따르면 0.6B 학생 모델이 구직 결과를 향상시키는 것으로 나타났습니다. 이 모델은 8B 관련성 오라클과 1.7B 헌신 교사로부터 나옵니다. 취업 NDCG@10은 0.7583에서 0.9432로 24.48% 상승했다. 동일한 조사에서 추론 측 작업에는 구조화된 가지치기 및 컨텍스트 압축이 포함되었습니다. 이러한 방법을 사용하면 GPU당 분류 성능이 초당 약 290개 항목에서 2,000개 이상으로 향상되었습니다.

이 시스템은 실시간으로 제작되어 미국 LinkedIn 사용자를 위한 자연어 구직 검색을 지원합니다. 이는 독점 서비스 스택이 아닌 사전 분류 작업 부하를 위해 LinkedIn이 투자한 오픈 소스 LLM 서비스 엔진인 SGLang을 기반으로 구축되었습니다. LinkedIn은 이 작업을 팀을 위한 가이드로 제시합니다. 이는 실시간 대기 시간 요구 사항을 충족하면서 크로스 인코더 품질 등급을 달성하는 데 도움이 됩니다. 또한 각 요청에 대해 frontier-LLM 추론을 사용하여 높은 비용을 방지합니다.

LLM이 감독하는 유사한 채점 시스템을 만드는 팀은 온라인 및 오프라인 교사 서비스 부서를 사용할 수 있습니다. 교사 옵션이 변경되면 초기 단계에서 온라인으로 문의할 수 있습니다. 그런 다음 교사가 안정화되고 쿼리 볼륨이 증가하면 오프라인 캐싱으로 전환할 수 있습니다. 실적 악화는 단순한 기믹이 아니다. LiGer, 다중 노드 데이터 병렬 처리, FSDP2 및 차세대 GPU는 각각 적당한 향상을 추가합니다. 또한 8B 미만 모델 크기에는 FP8이 필요하지 않았습니다. 이 세부 사항은 낮은 정확도를 기본값으로 간주하는 팀에 중요합니다.

2026년 6월, Pinterest는 Achieving Near-Linear Training Scalability for Pinterest’s Foundation Models라는 관련 계정을 출시했습니다. 이 기사에서는 다중 노드 훈련이 더 큰 교사 모델을 만드는 데 어떻게 도움이 되었는지 설명했습니다. 이러한 모델에 대한 지식은 홈피드 및 관련 핀 분류를 ​​위한 보다 효율적인 학생 모델로 개발되었습니다. 이 프로세스를 통해 실험 주기가 몇 주에서 단 몇 시간으로 단축되었습니다. LinkedIn의 역할은 맞춤형 SGLang 프레임워크를 만들어 교육 중에 교사가 실시간으로 상담할 수 있도록 하는 것입니다.

Pinterest는 교육 프레임워크를 확장하는 데 중점을 두고 다중 노드 교사 교육을 가능하게 하는 분산 체크포인트로 마이그레이션하고 있습니다. 최근 설문조사인 2026년 증류(지금까지): 어떤 프론티어 모델이 이를 사용하고 어떻게 사용하는지에서는 다중 교사 증류의 발전을 강조합니다. 여기에는 토큰 밀도 모니터링을 위해 10명 이상의 전문 교사를 사용하는 NVIDIA의 Nemotoron 3 Ultra, MiMo-V2-Flash 및 DeepSeek-V4가 포함되어 있습니다. 교사 풀의 이러한 복잡성은 업무별 교사 수가 적은 LinkedIn 및 Pinterest와 같은 업계 순위 시스템의 요구 사항을 초과합니다.





Source link

Leave a Reply

Your email address will not be published. Required fields are marked *

벤 셸턴 알카라스 대 셸턴 셸턴 대 알카라스 벤 셸턴 대 카를로스 알카라스 셸턴 셸턴 알카라스 US 오픈 카를로스 알카라스 알카라스 알카라스 셸턴 2026 US 오픈 테니스 US 오픈 대진표 US 오픈 테니스 알카라스 US 오픈 US 오픈 점수 US 오픈 결과 테니스 벤 셸턴 자매 테니스 US 오픈 2026 US 오픈 카를로스 알카라스 대 벤 셸턴 US 오픈 벤 셸턴 US 오픈 셸턴 테니스 US 오픈 테니스 셸턴 알카라스 경기 US 오픈 실시간 중계 브라이언 셸턴 US 오픈 시청 방법 벤 셸턴 자산 US 오픈 테니스 챔피언십 US 오픈 테니스 결과 오늘의 US 오픈 일정 알카라스 셸턴 경기 2026 US 오픈 테니스 US 오픈 라이브 스트리밍 시너 US 오픈 US 오픈 테니스