
Liquid AI는 두 개의 새로운 소형 인코더 모델인 LFM2.5-Encoder-230M과 LFM2.5-Encoder-350M을 Hugging Face에 공개하며, 더 큰 GPU 중심 배포를 요구하지 않고 CPU에서 문서 규모 작업을 처리할 수 있는 장문 컨텍스트 NLP 모델로 포지셔닝했다. 회사의 Hugging Face Blog 발표에 따르면, 새 모델은 8,192 토큰 입력을 지원하며 분류, 정책 점검, 라우팅, PII 탐지 같은 프로덕션 작업을 위해 설계됐다.
이번 출시는 많은 기업용 NLP 작업이 아직 현재의 대형 언어 모델 주목 밖에서 돌아가고 있기 때문에 중요하다. 안전 필터, 인입 분류기, 의도 라우터, 컴플라이언스 도구는 종종 긴 문서를 지속적으로 낮은 마진으로 처리하므로, 챗봇식 생성 품질보다 하드웨어 비용과 지연 시간이 더 중요해진다. Liquid AI의 주장은 이러한 인코더 작업을 기존 CPU 인프라로 옮기면서도 ModernBERT 같은 더 크거나 더 잘 알려진 대안과 경쟁력을 유지할 수 있다는 것이다.
이번 공개에는 LFM2.5-Encoder-230M과 LFM2.5-Encoder-350M 두 모델이 포함된다. Liquid AI는 이를 좁은 검색 전용 모델이 아닌 범용 인코더라고 설명하지만, 이전의 LFM2.5-Retrievers와 같은 계열에서 나온 것이다. 회사는 새 모델이 마스크드 언어 목적함수로 사전학습되어 텍스트 분류, 토큰 라벨링, 검색 등 더 넓은 범위의 작업에 미세 조정될 수 있다고 밝혔다.
이 구분은 임베딩, 리트리버, 인코더 사이에서 선택해야 하는 제품 팀에게 중요하다. 검색 모델은 다국어 검색에는 충분할 수 있지만, 기업 워크플로는 전체 문서나 토큰 수준에서의 판단이 필요한 경우가 많다. 예를 들어 지원 티켓 라우팅, 정책 위반 확인, 개인정보 식별 등이 그렇다. Liquid AI의 예시는 이런 사용 사례에 강하게 맞춰져 있다. 발표에서 회사는 제로샷 프롬프트 라우팅, 제로샷 정책 linting, 다국어 PII 탐지, 심지어 마스크드 디퓨전 텍스트 생성 실험까지 모두 CPU 전용 Hugging Face Spaces에서 실행되는 데모를 강조했다.
이 모델들은 Liquid AI의 LFM2 아키텍처에서 파생됐다. 회사에 따르면 인코더는 LFM2.5-230M과 LFM2.5-350M 디코더 백본에서 초기화되었고, 이후 attention mask를 바꾸고 짧은 convolution을 비인과적으로 만들며 마스크드 언어 모델링으로 훈련해 해당 causal decoder를 양방향 인코더로 변환했다. Liquid AI는 먼저 1,024 토큰에서 짧은 컨텍스트 언어 역량을 훈련한 뒤, 더 넓은 데이터 믹스를 사용해 8,192 토큰 컨텍스트로 적응시켜 사실성, 법률, 다국어 성능을 강화했다고 말했다.
헤드라인급 주장에는 벤치마크 품질뿐 아니라 긴 시퀀스에서의 처리량도 포함된다. Liquid AI는 자사 인코더가 CPU에서 특히 강하다고 말하는데, 장문 컨텍스트의 지연 시간이 배포 비용을 좌우하는 경우가 많기 때문이다. 회사 자체 비교에서 LFM2.5-Encoder-230M은 테스트한 모든 시퀀스 길이에서 ModernBERT-base보다 빠랐고, 8,192 토큰에서는 약 3.7배 더 빨랐다.
Hugging Face Blog의 구체적 예시는 벤치마크 속도를 운영 메시지로 바꿔 보여준다는 점에서 주목할 만하다. 전체 계약서, 녹취록, 긴 지원 스레드가 같은 컨텍스트 길이에서 ModernBERT-base라면 1분 30초 이상 걸리는 반면, 노트북 CPU에서는 30초 미만에 처리될 수 있다는 것이다. 많은 기업 팀에게 이는 긴 문서 분류를 일상적으로 돌릴 만큼 저렴한지 여부를 바꾼다.
GPU에서는 Liquid AI가 더 좁은 우위를 보고한다. 회사에 따르면 Apple GPU에서는 대략 1,000 토큰 미만에서 ModernBERT-base가 여전히 앞서지만, LFM2.5-Encoder 모델은 약 2,000 토큰 이상에서 우위를 점한다. 이 패턴은 의도된 시장 포지션을 강화한다. 즉, 모든 짧은 입력 워크플로에 대해 반드시 가장 빠른 선택지는 아니지만, CPU 경제성이 중요한 장문 컨텍스트 상시 추론용으로 마케팅되고 있다.
이러한 포지셔닝은 AI 인프라의 더 넓은 분할도 반영한다. 생성 모델이 여전히 대부분의 관심을 차지하지만, 많은 프로덕션 시스템은 대형 모델 호출 전후로 텍스트를 점수화, 분류, 필터링, 라우팅하는 더 작은 모델에 의존한다. 이런 모델이 로컬이나 범용 CPU에서 실행될 수 있다면, 개발자는 비용을 낮추고 데이터 거주성 옵션을 개선하며 GPU 가용성 의존도를 줄일 수 있다.
Liquid AI의 발표는 인코더 모델에 초점을 맞추고 있지만, 이 묶음의 두 번째 출처인 NVIDIA Developer Blog의 장문 컨텍스트 attention 설계 글은 왜 지금 이 출시가 나왔는지 설명하는 데 도움을 준다. NVIDIA는 에이전트형 및 장문 컨텍스트 워크로드가 더 보편화될수록 attention이 추론 비용을 점점 더 지배하게 되며, 모델 아키텍처 선택이 성능의 핵심 결정 요인이 된다고 주장한다.
NVIDIA의 글은 Liquid AI에 관한 내용이 아니며, CPU 우선 배포가 아니라 GPU 추론에 초점을 맞춘다. 그럼에도 핵심은 직접 관련이 있다. 장문 컨텍스트 성능은 커널 엔지니어링뿐 아니라 그룹 크기, 헤드 차원, KV 상태 관리 같은 아키텍처 결정에 의해 좌우된다. 이 글은 디코드 효율을 위한 더 큰 그룹 크기, GPU 메모리와 타일 크기에 맞는 헤드 차원, 압축이나 sparse 및 하이브리드 attention 접근을 통한 유효 KV 상태 감소 등 하드웨어를 고려한 attention 설계를 권장한다. NVIDIA는 TensorRT-LLM과 NVIDIA Nemotron 3 같은 아키텍처를 이런 공동 설계 접근의 예로 든다.
이 더 넓은 맥락은 Liquid AI의 출시를 단순한 모델 업로드 이상으로 만든다. 회사는 사실상 GPU 공동 설계를 이끄는 attention 효율 논리가 CPU 기반 인코더 작업에도 실질적 이득을 줄 수 있다고 주장하고 있다. Liquid AI는 LFM2.5-Encoders가 LFM2.5 백본의 ‘입력 길이가 늘어도 비용이 천천히 증가한다’는 특성을 계승한다고 말한다. 기업 AI 시스템을 평가하는 사용자에게 이는 짧은 합성 작업에서의 최고 성능보다 더 가치 있는 경우가 많다.
이 이야기에서 가장 강한 성능 주장은 벤더 보고다. 품질 결과와 속도 비교는 독립 벤치마크 연구소나 제3자 기업 배포 연구가 아니라 Liquid AI의 Hugging Face Blog 게시물에서 나온 것이다. Liquid AI는 각 모델을 모든 작업에 완전히 파인튜닝했고, GLUE, SuperGLUE, 다국어 분류의 17개 작업에 걸쳐 14개 모델을 평가했으며, 5개의 보류된 시드 평균을 보고했다고 말한다. 또한 전체 평가 프레임워크와 원시 결과를 오픈소스로 공개했다고 한다.
그 결과에 따르면 LFM2.5-Encoder-350M은 테스트한 14개 모델 중 4위를 차지했으며, 그보다 앞선 것은 3.5B 모델을 포함한 더 큰 모델뿐이었다. Liquid AI는 또한 LFM2.5-Encoder-230M이 보고한 설정에서 ModernBERT-base와 모든 EuroBERT 모델을 능가했으며, 크기는 대부분보다 작다고 주장한다. 이는 의미 있는 주장들이지만, 외부 재현이 나오기 전까지는 회사 보고로 받아들여야 한다.
NVIDIA Developer Blog는 Liquid AI 모델의 독립 검증이 아니라 기술적 맥락을 제공한다. 이 분석 역시 벤더 작성이며 FP8 attention compute와 KV 캐시를 사용한 측정된 커널 동작 같은 NVIDIA 하드웨어 가정에 기반한다. 이는 장문 컨텍스트 attention 설계가 왜 중요한지 이해하는 데 유용하지만, Liquid AI의 CPU 벤치마크 우위를 제3자가 확인한 것으로 읽어서는 안 된다.
실무적 미지수도 있다. 소스 자료는 세부적인 기업 가격, 지원 조건, 프로덕션 사례를 제공하지 않는다. 또한 실제 문서 노이즈, 멀티테넌트 지연 제약, 도메인 이동이 있는 법률 및 컴플라이언스 데이터셋에서의 동작도 보여주지 않는다. 배포에 관심 있는 빌더라면 LFM2.5-Encoder-230M과 LFM2.5-Encoder-350M을 자체 코퍼스와 서비스 수준 목표에 맞춰 테스트해야 할 가능성이 높다.
AI 빌더에게 즉각적인 매력은 워크플로 설계다. CPU에서 8,192 토큰까지 쓸 수 있는 더 작은 인코더는 그렇지 않으면 자르기, 청크 분할, 또는 비싼 GPU 추론이 필요했을 시스템에 들어갈 수 있다. 이는 계약 검토 파이프라인, 고객 지원 트리아지, 신뢰 및 안전 스크리닝, 다국어 인입, 정책 집행에 중요하다. 또한 더 큰 모델을 호출하기 전에 작은 모델이 요청을 필터링하거나 라우팅하는 하이브리드 스택에도 중요하다.
기업 AI 팀에게는 비용 이야기가 리더보드 순위보다 더 중요할 수 있다. CPU 친화적 추론은 규제되거나 예산 제약이 있는 환경, 특히 GPU 용량이 부족하거나 데이터가 기존 온프레미스 인프라 안에 머물러야 하는 환경에서 배포를 단순화할 수 있다. 장문 컨텍스트 인코더는 문서를 많은 청크로 나누고 결과를 다시 합칠 필요를 없애면 엔지니어링 복잡성도 줄일 수 있다.
모델 개발자에게 이번 출시는 시장이 프론티어 챗 모델을 넘어 특화된 추론 프리미티브로 확장되고 있다는 또 하나의 신호다. ModernBERT는 여전히 중요한 비교 기준이지만, Liquid AI는 더 구체적인 약속으로 경쟁하려 한다. 즉, 작은 모델 크기에서 더 나은 장문 컨텍스트 경제성이다. 이 주장이 실제로 성립한다면, 빌더는 인코더를 단순한 범용 유틸리티가 아니라 지연 예산과 시스템 비용에 직접적인 영향을 주는 아키텍처 결정으로 보게 될 수 있다.
다음 중요한 신호는 독립 재현이다. 외부 개발자가, 특히 범용 CPU와 실제 문서 워크로드에서, Liquid AI가 보고한 ModernBERT-base 대비 격차를 확인한다면 이번 출시는 저비용 기업 NLP 시스템을 어떻게 설계할지에 영향을 줄 수 있다.
또 하나의 신호는 Hugging Face 생태계 내 채택이다. LFM2.5-Encoder-230M과 LFM2.5-Encoder-350M이 프로덕션 데모, 파인튜닝된 분류기, 기업 평가 스택에 등장하기 시작한다면, 이는 모델이 단지 강한 내부 벤치마크를 내세우는 것이 아니라 실제 운영 문제를 해결하고 있음을 시사한다.
Liquid AI가 LFM2 계열을 더 확장할지도 지켜볼 만하다. LFM2.5-Retrievers와 새 인코더 사이의 관계는 검색, 라우팅, 라벨링, 필터링 같은 서로 다른 워크플로 계층을 위한 작고 효율적인 장문 컨텍스트 모델에 대한 더 넓은 전략을 시사한다. 인프라 측면에서는 NVIDIA가 제시하고 TensorRT-LLM에 구현된 원칙이 더 긴 컨텍스트 창에서 어떤 아키텍처가 실용적인지를 계속 좌우할 것이다.
이번 출시는 가장 큰 모델을 이기려 하기 때문이 아니라, 스택에서 간과된 부분인 장문 문서 이해를 겨냥했다는 점에서 흥미롭다. 이 계층은 많은 실제 시스템에서 비싼 모델 호출이 아예 발생하는지 여부를 결정한다. Liquid AI의 CPU 주장이 입증된다면, LFM2.5-Encoders는 장문 컨텍스트 커버리지를 포기하지 않으면서 추론 비용을 통제하려는 기업 AI 팀에게 유용한 구성 요소가 될 수 있다.
더 큰 교훈은 아키텍처적이다. 시장은 단순한 “더 큰 모델 = 더 나은 제품” 서사를 넘어가고 있다. LFM2.5-Encoder-230M을 CPU에서 쓰든, NVIDIA의 공동 설계 가이드에 따라 구성된 GPU 스택에서 쓰든, 성능은 점점 더 모델 구조를 워크로드와 하드웨어에 맞추는 데 달려 있다. 빌더에게 이는 경쟁 우위가 파운데이션 모델을 보유하는 데서보다 올바른 위치에 올바른 소형 모델을 선택하는 데서 더 많이 나올 수 있음을 뜻한다.
Liquid AI는 Hugging Face에 LFM2.5-Encoder 모델을 공개하며, 더 큰 하드웨어 없이 문서 규모 NLP를 위한 더 빠른 장문 컨텍스트 CPU 추론을 내세웠다.