BidirLM: From Text to Omnimodal Bidirectional Encoders by Adapting and Composing Causal LLMs Review
0. Introduction
한 줄 요약: BidirLM은 pretrained causal LLM을 bidirectional attention, masked next-token prediction, contrastive learning으로 encoder에 적응시키고, original causal checkpoint와 weight merge해 forgetting을 줄이며, vision and audio specialist causal models까지 compose해 하나의 omnimodal embedding encoder를 만드는 recipe다.
이 논문을 지금 볼 가치가 있는 이유는 다음과 같음.
- Causal LLM을 encoder로 바꾸는 과정에서 attention mask 변경, masked objective, contrastive objective의 역할을 controlled ablation으로 분리한다.
- Bidirectional adaptation이 multilingual, math, code capability를 잃는 문제를 original base model과의 weight merging으로 복구한다.
- Text encoder recipe를 vision, audio causal model composition으로 확장해 shared embedding space를 만든다.
- Encoder-only model을 새로 pretrain하지 않고 existing causal ecosystem을 재사용한다.
- Text, image, audio benchmark를 한 model에서 평가해 omnimodal encoder의 practical trade-off를 보여준다.
Modern LLM ecosystem의 중심은 causal decoder다. Pretraining, instruction tuning, multimodal extension, safety adaptation, code specialization이 대부분 next-token prediction backbone 위에서 진행된다.
반면 retrieval, clustering, classification, reranking, semantic matching은 bidirectional encoder가 유리하다. Query token이 document의 future token까지 모두 볼 수 있고, sequence 전체를 하나의 representation으로 압축하기 쉽기 때문이다.
두 ecosystem은 오랫동안 분리되어 왔다.
- Causal LLM: Rich generation capability, large-scale pretraining, multimodal specialists
- Bidirectional encoder: Efficient embedding, dense retrieval, classification, pair matching
BidirLM은 causal model family를 encoder ecosystem으로 전환하려 한다. 단순히 causal mask를 제거하는 것만으로는 부족하다는 점에서 출발한다.
논문은 다섯 variant를 비교한다.
- Base causal model
- Bi+Base: Bidirectional attention만 적용
- Bi+MNTP: Bidirectional attention과 masked next-token prediction
- Bi+Contrastive: Bidirectional attention과 contrastive training
- Bi+MNTP+Contrastive: MNTP 후 contrastive learning
Controlled experiment는 Gemma3 270M and 1B, Qwen3 0.6B and 1.7B를 사용한다. Masked adaptation은 최대 10B tokens, contrastive stage는 English data로 시작한다.
결과는 다음 message를 준다.
- Attention mask만 바꾸면 capability가 자동으로 encoder에 맞춰지지 않는다.
- MNTP는 full fine-tuning capability를 보존하는 데 중요하다.
- Contrastive training은 embedding benchmark를 크게 올리지만 generation-pretrained knowledge 일부를 희생할 수 있다.
- MNTP -> contrastive 순서가 두 objective를 가장 잘 절충한다.
- Long adaptation은 multilingual, math, code forgetting을 만들 수 있다.
- Original causal model과 50% 정도 weight merge하면 forgetting을 상당 부분 복구한다.
- 여러 causal specialist를 merge한 뒤 contrastive training하면 text, image, audio를 같은 embedding model로 만들 수 있다.
따라서 BidirLM은 단순 embedding model paper라기보다 model reuse and composition paper에 가깝다.
1. Problem Setting
1-1. Problem definition
Causal LLM의 self-attention mask는 token $i$가 prefix $1,\ldots,i$만 보게 한다.
\[M_{ij}^{\mathrm{causal}} = \begin{cases} 0 & j \leq i \\ -\infty & j > i \end{cases}\]Bidirectional encoder는 모든 non-padding token을 볼 수 있다.
\[M_{ij}^{\mathrm{bi}} = \begin{cases} 0 & j \text{ is valid} \\ -\infty & j \text{ is padding} \end{cases}\]Mask를 바꾸면 architecture는 bidirectional해진다. 하지만 parameter는 causal next-token prediction에 맞춰져 있다.
다음 문제가 남는다.
- Early token representation이 future context를 사용하는 법을 배우지 않았다.
- Final hidden state만 sentence embedding으로 쓰기 어렵다.
- Causal pretraining의 multilingual, math, code knowledge를 얼마나 보존하는지 불명확하다.
- Contrastive training은 embedding space를 만들지만 task-specific over-adaptation을 일으킬 수 있다.
- Multimodal causal specialist는 modality head와 backbone이 다르다.
- Separate encoder를 modality마다 운영하면 parameter and serving cost가 커진다.
BidirLM의 목표는 다음과 같다.
| Goal | Requirement |
|---|---|
| Text encoder adaptation | Causal LM을 bidirectional representation model로 변환 |
| Capability retention | Language, math, code, multilingual knowledge 보존 |
| Embedding quality | MTEB and multilingual transfer |
| Composability | Base, safety, vision, audio specialist weight를 merge |
| Omnimodal space | Text, image, audio pair를 같은 embedding objective로 정렬 |
| Efficiency | New pretraining from scratch보다 적은 compute |
| Modularity | Existing modality encoder and head를 최대한 재사용 |
1-2. Why previous approaches are insufficient
1) Attention mask 변경만으로는 objective mismatch가 남는다
Bi+Base는 causal checkpoint에 bidirectional mask만 적용한다. Model은 future context를 볼 수 있지만 이를 useful representation으로 쓰도록 학습되지 않았다.
Controlled ablation에서 bidirectional attention alone은 mixed result를 보인다. 일부 task는 좋아지지만 robust encoder로 충분하지 않다.
2) Contrastive-only adaptation은 representation task에 과적합될 수 있다
Contrastive objective는 query-positive pair를 가까이 두고 negative를 멀리 보낸다. MTEB에는 직접적이다.
하지만 narrow English contrastive corpus로 바로 adaptation하면 original language modeling capability가 바뀐다. Full fine-tuning benchmark나 multilingual transfer가 약해질 수 있다.
3) Masked language modeling을 그대로 쓰면 causal LM head와 alignment가 어긋난다
BERT-style MLM은 masked position의 hidden state에서 original token을 직접 예측한다. Causal LLM은 position $i$ hidden state로 next token $i+1$을 예측하도록 trained되어 있다.
MNTP는 causal head alignment를 활용하면서 bidirectional context를 학습하도록 target을 shift한다.
4) Long adaptation은 catastrophic forgetting을 만든다
English-only masked and contrastive data를 오래 사용하면 multilingual, math, code specialization이 약해질 수 있다.
논문에서 10B에서 30B adaptation으로 늘릴 때 Gemma의 Arabic MIRACL과 XNLI, Qwen의 math와 CodeSearchNet이 떨어지는 example이 나타난다.
5) Multimodal encoder를 from scratch로 만들면 specialist ecosystem을 버린다
Vision-language and audio-language causal model은 이미 modality front-end, alignment, tokenizer를 가진다. Separate encoder를 새로 pretrain하면 이 investment를 반복한다.
BidirLM은 causal specialists의 shared textual backbone을 merge하고 existing modality component를 attach한다.
2. Core Idea
2-1. Main contribution
1) MNTP: Masked Next-Token Prediction
Input token sequence에서 subset을 mask한다. Bidirectional attention을 사용하되, causal output head의 next-token alignment를 유지한다.
Original token $x_i$를 mask했다면 prediction은 shifted hidden state에서 이뤄진다. Conceptually 다음 objective를 사용한다.
\[\mathcal{L}_{\mathrm{MNTP}} = -\sum_{i \in \mathcal{M}} \log p_\theta \left( x_i \mid \tilde{x}_{1:n} \right)\]실제 implementation에서는 causal LM head가 position shift와 맞도록 masked token 직전 또는 aligned position의 logits를 사용한다.
MNTP의 역할은 두 가지다.
- Bidirectional context를 활용하도록 backbone을 재적응한다.
- Causal pretraining에서 배운 token prediction head와 lexical knowledge를 유지한다.
2) Contrastive embedding stage
Sequence representation을 pool한 뒤 query $q$, positive $d^+$, negative $d^-$를 contrastive하게 학습한다.
In-batch negatives와 hard negatives를 사용하는 InfoNCE objective는 다음 형태다.
\[\mathcal{L}_{\mathrm{con}} = - \log \frac{ \exp(\mathrm{sim}(q,d^+)/\tau) }{ \exp(\mathrm{sim}(q,d^+)/\tau) + \sum_{j} \exp(\mathrm{sim}(q,d_j^-)/\tau) }\]Temperature는 $0.05$를 사용한다. Sample당 1-7 hard negatives를 포함한다.
Contrastive stage는 retrieval-friendly geometry를 직접 만든다.
3) Sequential MNTP -> contrastive recipe
Ablation에서 MNTP와 contrastive objective를 동시에 단순 합치는 것보다 sequential recipe가 안정적이다.
- MNTP로 bidirectional reading capability를 만든다.
- Contrastive training으로 embedding geometry를 정렬한다.
MNTP는 general capability를 보존하는 bridge이고, contrastive stage는 task-specific representation을 만든다.
4) Base-model weight merging
Adapted encoder weight를 $\theta_{\mathrm{enc}}$, original causal base weight를 $\theta_{\mathrm{base}}$라고 하자.
Linear merge는 다음과 같다.
\[\theta_{\mathrm{merge}} = \alpha \theta_{\mathrm{enc}} + (1-\alpha) \theta_{\mathrm{base}}\]논문은 약 $\alpha=0.5$ 부근에서 strong trade-off를 찾는다.
- $\alpha$가 크면 encoder adaptation이 강하다.
- $\alpha$가 작으면 original capability retention이 강하다.
- Midpoint merge가 multilingual, math, code forgetting을 복구하면서 embedding gain을 많이 유지한다.
5) Multi-domain adaptation data
English-only MNTP를 30B tokens까지 늘리면 forgetting이 커진다. 논문은 training mix에 multilingual, math, code data를 넣는다.
약 20% multi-domain portion에서 plateau를 관찰한다.
Final mix는 다음 domain을 포함한다.
- English FineWeb-Edu
- Multilingual FineWeb2-HQ
- FineMath
- Stack v2 code
이 mix는 base merge와 함께 capability retention을 개선한다.
6) Domain-specialist composition
Safety, vision, audio causal specialist는 shared ancestral backbone에서 파생되었다고 볼 수 있다.
BidirLM은 specialist weight와 bidirectional base를 linear merge한 뒤 short adaptation으로 representation을 복구한다.
- Safety: Qwen3Guard
- Vision: Qwen3-VL
- Audio: Qwen3-ASR
- Text encoder: BidirLM Qwen3
7) Omnimodal encoder
Omni model은 세 textual backbone을 equal ratio로 merge한다.
- Qwen3-VL-2B textual backbone
- Qwen3-ASR-1.7B textual backbone
- Bi+MNTP Qwen3-1.7B textual backbone
Conceptual merge는 다음과 같다.
\[\theta_{\mathrm{omni}} = \frac{1}{3} \left( \theta_{\mathrm{vision}} + \theta_{\mathrm{audio}} + \theta_{\mathrm{text}} \right)\]그 다음 frozen or reused vision and audio front-end를 attach하고, text-text, image-text, audio-text pair에 contrastive learning을 수행한다.
2-2. Design intuition
1) Causal knowledge를 버리지 않고 read representation만 바꾼다
Decoder LLM은 이미 language, code, math knowledge를 가진다. Encoder task를 위해 from-scratch pretraining을 반복할 필요가 없다.
Bidirectional mask and MNTP는 causal model을 reader로 바꾸는 minimal surgery다.
2) Objective order가 representation path를 결정한다
Contrastive objective부터 시작하면 embedding benchmark는 빨리 좋아질 수 있지만 general token representation이 충분히 bidirectional하게 재구성되지 않을 수 있다.
MNTP first는 model이 future context를 읽는 기초를 만들고, contrastive second는 pooled geometry를 정렬한다.
3) Weight merge는 forgetting recovery prior다
Original base checkpoint는 adaptation 전 capability의 anchor다. Adapted model과 merge하면 forgotten direction을 다시 넣을 수 있다.
이는 replay data를 무한히 늘리지 않고 capability retention을 조절하는 cheap operation이다.
4) Specialist composition은 common ancestry를 이용한다
Vision and audio model이 완전히 다른 architecture라면 raw weight merge는 어렵다. 하지만 same Qwen3 backbone에서 파생된 specialist라면 textual layer alignment가 남아 있다.
Common initialization과 architecture compatibility가 composition의 핵심 assumption이다.
5) Omnimodal embedding은 generation보다 matching에 집중한다
BidirLM Omni는 image or audio를 생성하는 model이 아니다. Modality input을 shared vector space에 넣어 retrieval, matching, classification을 수행한다.
3. Architecture / Method
3-1. Overview
| Item | Description |
|---|---|
| Goal | Causal LLM family를 bidirectional text and omnimodal encoder로 전환 |
| Base families | Gemma3, Qwen3 |
| Attention change | Causal mask -> bidirectional mask |
| Adaptation stage 1 | MNTP |
| Adaptation stage 2 | Contrastive learning |
| Retention method | Base checkpoint weight merge |
| Domain retention | Multilingual, math, code data mix |
| Multimodal composition | Vision, audio, text backbone merge |
| Final output | Text, image, audio embeddings |
| Final omni scale | About 2.5B |
3-2. Module breakdown
1) Bidirectional attention conversion
Decoder block architecture는 유지하고 attention mask만 full visibility로 바꾼다.
Position encoding, MLP, normalization, LM head를 그대로 재사용한다. FlashAttention and sequence packing을 bidirectional mask에 맞춰 적용한다.
2) Pooling head
Embedding은 sequence hidden states를 하나의 vector로 pool해야 한다. 논문은 task formatting과 end-of-sequence representation을 활용한다.
Contrastive training은 pooled vector를 L2 normalize한다.
\[z = \frac{h_{\mathrm{pool}}} {\|h_{\mathrm{pool}}\|_2}\]Similarity는 cosine or dot product로 계산한다.
3) Five controlled variants
| Variant | Bidirectional mask | MNTP | Contrastive |
|---|---|---|---|
| Base | No | No | No |
| Bi+Base | Yes | No | No |
| Bi+MNTP | Yes | Yes | No |
| Bi+Contrastive | Yes | No | Yes |
| Bi+MNTP+Contrastive | Yes | Yes | Yes |
이 table이 논문의 main causal evidence다.
- Mask alone의 effect
- MNTP의 effect
- Contrastive의 effect
- Objective ordering의 effect
를 분리한다.
4) Capability retention evaluation
Encoder benchmark만 보면 forgetting을 놓칠 수 있다. 논문은 augmented XTREME, multilingual retrieval, math, code, full fine-tuning task를 함께 본다.
Encoder adaptation 후 original downstream capability가 얼마나 남는지 측정한다.
5) Merge ratio sweep
$\alpha$를 바꾸며 embedding score와 retained capability의 Pareto curve를 만든다.
약 50% merge가 robust default다. 다만 model family와 domain에 따라 optimum이 달라질 수 있다.
6) Specialist merge and recovery
Safety specialist는 base with guard behavior를 merge한 뒤 short recovery training을 한다. 논문은 500-step adaptation을 사용하고, safety score가 early step에서 빠르게 회복되는 것을 보여준다.
Vision and audio merge도 equal mixing 후 short warm-up을 사용한다.
- Vision warm-up: 약 100 steps
- Audio warm-up: 약 175 steps
이 숫자는 merging이 완전히 lossless하지 않고 small alignment recovery가 필요함을 보여준다.
7) Omni composition
Final Omni pipeline은 다음과 같다.
- Text, vision, audio causal specialists의 textual backbone을 align한다.
- Weight를 equal ratio로 merge한다.
- Vision encoder and projector를 attach한다.
- Audio encoder and projector를 attach한다.
- Shared bidirectional textual backbone으로 modality token을 읽는다.
- Contrastive objective로 shared embedding space를 학습한다.
- Modality-specific generation head는 목적이 아니므로 frozen or omitted한다.
4. Training / Data / Recipe
4-1. Controlled text adaptation
Model families:
- Gemma3 270M
- Gemma3 1B
- Qwen3 0.6B
- Qwen3 1.7B
MNTP controlled experiment는 10B tokens를 사용한다. Long adaptation은 30B tokens까지 늘려 forgetting을 관찰한다.
Sequence length는 8192다. MNTP는 one epoch unique token pass를 사용한다.
Training infrastructure:
- 96 GPUs for masked adaptation
- AdamW
- WSD schedule
- Random seed 42
HTML rendering에서 exact learning rate 일부가 누락될 수 있으므로 final publication 전 PDF table을 다시 확인해야 한다.
4-2. Contrastive training
Final contrastive data는 약 10M samples and 89 dataset mixture로 구성된다.
Recipe:
- 4 GPUs
- Effective batch size 512
- Maximum sequence length 512
- Temperature 0.05
- 1-7 hard negatives
- In-batch negatives
- Sequential after MNTP
Controlled initial contrastive experiment는 약 3M English examples를 사용한다.
4-3. Multi-domain mix
Final MNTP data는 English base와 multilingual, math, code를 섞는다.
20-30% multi-domain ratio sweep에서 benefit이 plateau하고, final recipe는 약 20%를 사용한다.
이 결과는 adaptation data가 original pretraining distribution을 완전히 재현할 필요는 없지만, forgotten domain을 small proportion으로 replay해야 함을 시사한다.
4-4. Omnimodal data
Omni contrastive corpus는 약 1.8M pairs다.
| Pair type | Proportion |
|---|---|
| Text-text | 65.0% |
| Audio-text | 17.5% |
| Image-text | 17.5% |
Text pair 비중이 가장 크다. Shared space의 language anchor를 유지하면서 image and audio alignment를 추가한다.
Additional compute는 약 250 MI250X GPU hours로 보고된다. Full multimodal pretraining from scratch에 비해 작지만, data curation and specialist pretraining cost는 이미 존재한다.
4-5. Engineering notes
1) Tokenizer and vocabulary alignment
Weight merge가 가능하려면 embedding matrix와 vocabulary가 호환되어야 한다. Qwen3-derived specialist를 사용하는 이유 중 하나다.
2) Layer numbering and parameter naming
Architecture가 같아도 modality extension이 extra layer or projector를 넣을 수 있다. Shared textual layer만 merge하고 modality-specific parameter는 별도로 유지해야 한다.
3) Normalization statistics after merging
Linear weight interpolation은 activation scale을 바꿀 수 있다. Short warm-up은 LayerNorm and residual distribution을 다시 맞추는 역할을 할 수 있다.
4) Hard negative quality
Contrastive model은 false negative에 민감하다. Semantically equivalent answer를 negative로 넣으면 representation이 왜곡될 수 있다.
5) Encoder serving
Causal KV cache는 필요하지 않지만 bidirectional full attention cost가 sequence length에 따라 커진다. Long document embedding에서는 chunking or efficient attention이 필요하다.
5. Evaluation
5-1. Main results
1) Mask alone is not enough
Bi+Base는 some task improvement를 보이지만 consistent encoder gain이 아니다. Model이 future token을 볼 수 있다는 architectural permission과 실제로 future context를 useful하게 사용하는 ability는 다르다.
2) MNTP preserves full fine-tuning capability
Bi+MNTP는 contrastive-only보다 embedding score가 낮을 수 있지만 broader task adaptation capability를 잘 보존한다.
Masked objective가 lexical and contextual representation을 재구성하는 역할을 한다.
3) Contrastive gives the largest MTEB jump
Bi+Contrastive는 MNTP 대비 MTEB에서 13 points 이상 gain을 보이는 controlled setting이 있다. 그러나 full fine-tuning and domain retention은 약해질 수 있다.
4) Sequential recipe is the best compromise
Bi+MNTP+Contrastive는 embedding benchmark와 full fine-tuning task에서 가장 robust한 trade-off를 보인다.
5) Long English adaptation causes forgetting
Gemma3에서 Arabic MIRACL은 약 7 points, XNLI는 약 2 points 떨어진다. Qwen3에서는 math and CodeSearchNet이 약 1.5 points 하락한다.
Original base merge와 multi-domain replay가 이를 복구한다.
6) Final text encoder results
Final BidirLM text models는 augmented XTREME and MTEB에서 open-source Pareto frontier를 주장한다.
BidirLM Omni는 text MTEB mean-task 기준 63.1, 1.7B text model은 62.9를 보고한다. Omnimodal composition이 text embedding을 크게 희생하지 않는다.
7) Image and audio embedding
Omni model은 MIEB mean-task 58.1을 보고하고 compared baselines 중 높은 ranking을 얻는다. MAEB mean-task는 45.2로 third place를 보고한다.
Authors aggregate에서 Nemotron-Omni-3B 대비 text 약 +17, image 약 +5 improvement를 주장한다. Model size는 2.5B vs 4.8B로 비교한다.
Aggregate construction and benchmark snapshot을 함께 확인해야 한다.
5-2. What really matters in the experiments
1) Controlled variant table이 main evidence다
Final leaderboard보다 five-variant ablation이 더 중요하다. Attention mask, MNTP, contrastive의 causal role을 분리하기 때문이다.
2) Embedding quality와 general capability를 함께 봐야 한다
MTEB score만 최적화하면 multilingual and fine-tuning capability가 떨어질 수 있다. BidirLM은 encoder conversion을 knowledge retention problem으로 본다.
3) Weight merge가 cheap but architecture-dependent하다
50% linear merge가 잘 작동하는 이유는 common ancestry와 aligned parameterization이다. Independently trained model or different tokenizer에는 적용되지 않을 수 있다.
4) Omnimodal score는 shared representation quality를 본다
Final model은 generative VLM or speech model과 직접 비교할 대상이 아니다. Retrieval and matching encoder다.
5) Benchmark date matters
논문은 특정 2026-03-30 snapshot의 leaderboard를 사용하므로, ranking claim을 현재 leaderboard의 절대 순위로 해석해서는 안 된다.
6. Limitations
- Causal generation capability retention을 직접 평가하는 범위가 제한적이다.
- Encoder conversion 후 next-token generation quality를 main objective로 유지하지 않는다.
- Bidirectional mask model은 standard autoregressive decoding에 바로 사용할 수 없다.
- Weight merging은 shared ancestry를 요구한다.
- Different architecture, tokenizer, layer count, independently trained model에는 linear interpolation이 불안정할 수 있다.
- Adaptation compute가 작지 않다.
- 10B-30B token MNTP와 10M contrastive samples는 from-scratch보다 저렴하지만 small lab에는 substantial하다.
- Contrastive data bias가 representation을 결정한다.
- 89-dataset mixture의 domain balance, duplicate, contamination, false negative가 benchmark result에 영향을 준다.
- Omnimodal model은 modular generative capability를 제공하지 않는다.
- Image and audio generation, instruction following, cross-modal reasoning은 main target이 아니다.
- Frozen modality front-end와 shared encoder의 matching quality를 평가한다.
- Multimodal composition ratio가 heuristic이다.
- Equal one-third merge가 general optimum이라는 guarantee는 없다.
- Modality quality와 specialist distance에 따라 layer-wise ratio가 필요할 수 있다.
- Long-context embedding은 quadratic attention cost를 가진다.
- Causal model의 KV cache advantage가 없어지고 bidirectional full attention을 사용한다.
- 8192-token adaptation이 very long document serving 문제를 해결하지는 않는다.
- Evaluation family가 controlled architecture에 집중된다.
- Gemma3 and Qwen3 result가 Llama, Mistral, MoE, hybrid state-space model에 그대로 일반화되는지 불명확하다.
- Benchmark contamination and moving leaderboard를 확인해야 한다.
- Pretraining data and contrastive mixture가 MTEB or XTREME task와 겹칠 수 있다.
- Open-source Pareto claim은 date-specific하다.
- Same random seed 중심의 experiment는 variance를 충분히 보여주지 못할 수 있다.
- Merge ratio and small recovery training은 seed sensitivity를 가질 수 있다.
7. My Take
7-1. Why this matters for my work
BidirLM의 가장 실용적인 message는 causal LLM을 encoder로 바꾸는 일이 “mask를 풀고 contrastive learning을 한다”로 끝나지 않는다는 점이다.
실제로는 세 objective를 동시에 관리해야 한다.
- Bidirectional reading capability
- Retrieval-friendly embedding geometry
- Original pretrained knowledge retention
MNTP, contrastive learning, base weight merge가 각각 하나를 담당한다.
특히 weight merging을 forgetting recovery로 사용하는 방식은 useful하다. Full replay corpus를 재구성하기 어렵더라도 original checkpoint가 capability prior로 남아 있기 때문이다.
Multimodal specialist composition도 흥미롭다. 기존 VLM and ASR model의 textual backbone이 common ancestor를 공유한다면 separate encoder를 유지하지 않고 shared embedding model로 통합할 수 있다.
7-2. Reuse potential
1) Domain document embedding model
Company-specific causal LLM을 bidirectional encoder로 전환할 수 있다.
- Bidirectional attention conversion
- Domain MNTP on unlabeled documents
- Query-document contrastive training
- Original base merge
- Retrieval, classification, reranking evaluation
2) Capability retention suite
Embedding benchmark만 보지 않고 다음을 함께 측정한다.
- Korean and English retrieval
- Domain terminology
- Code search
- Math similarity
- Full fine-tuning classification
- Long document embedding
- Calibration and robustness
3) Layer-wise merge
Global 50% merge 대신 layer별 adaptation distance를 사용할 수 있다.
\[\alpha_l = f \left( \| \theta_{\mathrm{enc},l} - \theta_{\mathrm{base},l} \| \right)\]Embedding-critical upper layer는 adapted weight를 더 유지하고, lexical lower layer는 base weight를 더 넣는 방식이다.
4) OCR and document multimodal encoder
Vision-language causal model and text encoder를 compose해 image-text and OCR-text retrieval model을 만들 수 있다.
- Page image to document text
- Region crop to field name
- OCR block to query
- Document pair matching
- Evidence retrieval
5) Safety-aware embedding
Qwen3Guard-style safety specialist와 encoder를 merge해 retrieval representation에 policy or risk attribute를 보존할 수 있다. 다만 semantic similarity와 safety separation이 충돌하지 않는지 평가해야 한다.
7-3. Follow-up papers
- LLM2Vec: Large Language Models Are Secretly Powerful Text Encoders
- GTE-Qwen
- NV-Embed
- E5: Text Embeddings by Weakly-Supervised Contrastive Pre-training
- Qwen3 Embedding
- Qwen3-VL
- Qwen3-ASR
- Model Soups
- Task Arithmetic
- OmniBind and multimodal embedding models
8. Summary
- BidirLM은 causal mask를 bidirectional mask로 바꾸고 MNTP와 contrastive learning을 순차 적용해 encoder를 만든다.
- Mask alone은 불충분하고, MNTP는 general capability retention, contrastive objective는 embedding geometry를 담당한다.
- Long English adaptation에서 생기는 multilingual, math, code forgetting은 original base weight merge와 multi-domain replay로 완화한다.
- Common causal ancestry를 가진 vision, audio, text specialist를 merge하고 1.8M multimodal pair로 contrastive training해 2.5B Omni encoder를 만든다.
- Final Omni model은 text embedding을 유지하면서 image and audio retrieval capability를 추가한다.
- Shared architecture assumption, adaptation compute, heuristic merge ratio, non-generative scope, moving benchmark ranking은 주요 한계다.
댓글남기기