Downloads · 30 days
6
8% of all-time downloads
CarlosAGDev/ltv-lora-qa
ltv-lora-qa is a machine learning model from CarlosAGDev. Use it for the machine learning task on the model card, and read the license before you ship it in a product. It is set up for peft. The card lists the license as apache-2.0.
LoRA-QA (v0.2.0) del LTV Framework. Genera 2-4 sub-preguntas atomicas y auto-contenidas para verificar una afirmacion check-worthy clasificada.
Downloads · 30 days
6
8% of all-time downloads
All-time downloads
71
Public
Repo size
184 MB
Likes
1
Public
Click a slice to open those files.
.safetensors76 MB · 70%
From the Hugging Face model README
LoRA-QA (v0.2.0) del LTV Framework. Genera 2-4 sub-preguntas atomicas y auto-contenidas para verificar una afirmacion check-worthy clasificada.
gemini-3.1-flash-lite.{
"questions": [
{"question": "...", "answer_type": "Extractive"},
{"question": "...", "answer_type": "Abstractive"}
]
}
answer_type: Boolean, Extractive, o Abstractive.
| Parametro | Valor |
|---|---|
| Modelo Base | google/gemma-4-E2B-it |
| Max Sequence Length | 512 |
| Epochs | 1 |
| Batch Size (Per Device) | 4 |
| Gradient Accumulation | 4 |
| Learning Rate | 2e-4 |
| Optimizer | paged_adamw_8bit |
| GPU | NVIDIA L4 (23.7 GB VRAM) |
| Eval set | 732 claims, estratificado por claim_type |
| Tiempo de evaluacion | 331 min (~27 s/ejemplo, max_new_tokens=300) |
| Metrica | v0.1.0 | v0.2.0 |
|---|---|---|
| JSON valido + schema OK | 100% (110/110) | 91.0% (666/732) |
| Tipos con soporte en eval | 4 de 5 | 5 de 5 |
| Sesgo hacia 3 preguntas | 97% | 85% |
| n | Referencia | Generado |
|---|---|---|
| 2 | 432 (59%) | 92 (14%) |
| 3 | 287 (39%) | 566 (85%) |
| 4 | 13 (2%) | 8 (1%) |
Media de referencia: 2.43 preguntas/claim (el maestro v2 si adopto la guia del prompt). Media generada: 2.87 — el adaptador sigue colapsando a 3.
| answer_type | Referencia | Generado |
|---|---|---|
| Boolean | 558 (31.4%) | 74 (3.9%) |
| Extractive | 976 (54.9%) | 1471 (76.9%) |
| Abstractive | 243 (13.7%) | 369 (19.3%) |
| Tipo | Validez | Nota |
|---|---|---|
| Numerical Claim | 94% (208/222) | |
| Event/Property Claim | 93% (355/382) | |
| Causal Claim | 83% (50/60) | |
| Position Statement | 83% (20/24) | |
| Quote Verification | 75% (33/44) | clase nueva — primer entrenamiento |
Colapso de Boolean (31.4% -> 3.9%) — el hallazgo central. El prompt v2 (presente en el turno de usuario de cada ejemplo) instruye "use Boolean sparingly". El adaptador sobre-aprendio la instruccion literal en lugar de imitar la distribucion real del maestro (que uso Boolean en 31% de sus preguntas). Es un caso de conflicto instruccion-vs-demostracion: cuando el prompt dice una cosa y los ejemplos muestran otra, el modelo pequeno se ancla a la instruccion.
El sesgo de 3 preguntas persiste (85%). Mejoro respecto al 97% de v0.1.0, pero el maestro v2 se movio a 2 preguntas como moda (59%) y el adaptador no lo siguio. La distribucion de salida del adaptador cambia mas lento que la del maestro.
Regresion en validez JSON (100% -> 91%). Tres factores: eval 6.7x mas grande y diverso, clases nuevas dificiles (Quote 75%), y salidas mas variadas. Los fallos se concentran en las clases minoritarias (Quote 25% de fallos, Causal/Position 17%).
gemini-3.1-flash-lite con
prompts v2, no calidad absoluta de las preguntas.