emb-rag-qwen4b-relsft
LoRA adapter for Qwen/Qwen3-Embedding-4B — Relevance-SFT (direct; winner recipe).
Trained on multi-hop MuSiQue; evaluated on MuSiQue (in-domain) + 2WikiMultiHopQA, HotpotQA, NQ, TriviaQA (OOD).
Indirect feedback = the reward is a frozen reader LLM's answer success (log p(gold answer | query, retrieved context)) —
no passage-level relevance labels. Rel-SFT = the direct-supervision baseline (contrastive InfoNCE on gold passages).
Full results (retrieval R@k + downstream RAG accuracy) and training scripts:
https://irisicy4.github.io/exp-record/projects/indirect-rag/
from peft import PeftModel
from transformers import AutoModel, AutoTokenizer
base = AutoModel.from_pretrained("Qwen/Qwen3-Embedding-4B")
model = PeftModel.from_pretrained(base, "Icey444/emb-rag-qwen4b-relsft").merge_and_unload()
tok = AutoTokenizer.from_pretrained("Icey444/emb-rag-qwen4b-relsft")