Posts by Tags

ai-safety

Tiny-Aya-Water Blind Spot Evaluation Dataset

less than 1 minute read

Published:

This dataset contains 10 manually constructed blind spot cases designed to evaluate reasoning, instruction following, and factual robustness of the model:

dataset

Tiny-Aya-Water Blind Spot Evaluation Dataset

less than 1 minute read

Published:

This dataset contains 10 manually constructed blind spot cases designed to evaluate reasoning, instruction following, and factual robustness of the model:

llm-evaluation

Tiny-Aya-Water Blind Spot Evaluation Dataset

less than 1 minute read

Published:

This dataset contains 10 manually constructed blind spot cases designed to evaluate reasoning, instruction following, and factual robustness of the model:

robustness

Tiny-Aya-Water Blind Spot Evaluation Dataset

less than 1 minute read

Published:

This dataset contains 10 manually constructed blind spot cases designed to evaluate reasoning, instruction following, and factual robustness of the model: