Multilingual healthcare AI needs explicit testing for how language, communication style, and missing information affect risk assessment—aggregate accuracy scores alone don't catch safety failures that emerge in specific languages or contexts.
HerHealthEval is an evaluation framework that tests how well AI language models understand women's health concerns across multiple languages (English, French, Arabic) and communication styles (clinical, casual, emotional, vague).