Implement comprehensive evaluation strategies for LLM applications using automated metrics, human feedback, and benchmarking. Use when testing LLM performance, measuring AI application quality, or est
data/llm-evaluation-vuralserhat86-antigravity-agentic(main)