Field
Value
Report ID
EVAL-
Model Name
Version
Experiment
EXP-XXX
Author
Date
Status
Draft / Final
<3-4 sentences: What was evaluated, key findings, recommendation>
Verdict
Rationale
Ready for production / Needs improvement / Not viable
<What does this model do?>
Field
Value
Model type
<Classification, regression, generative, etc.>
Base model (if fine-tuned)
Parameters
Framework
<PyTorch, TensorFlow, etc.>
Field
Value
Dataset
Size
Time range
Data source
PII present
Yes / No
License
Field
Value
Dataset
Size
Split
Representative
<Is it representative of production?>
Metric
Why This Metric
<Metric 1>
<Metric 2>
<Metric 3>
Metric
Target
Result
Status
<Accuracy/F1/etc.>
Pass / Fail
Pass / Fail
Pass / Fail
Pass / Fail
Segment
Metric
Result
Notes
<Segment 1>
<Segment 2>
Model
Metric 1
Metric 2
Metric 3
Baseline
This model
Delta
<+/-X%>
<+/-X%>
<+/-X%>
Metric
Value
Inference cost per request
<$X.XX>
Training cost
<$X,XXX>
Monthly estimated cost at scale
<$X,XXX for Y requests>
Option
Cost/Request
Monthly Total
This model
<$X.XX>
<$X,XXX>
Alternative 1
<$X.XX>
<$X,XXX>
Current solution
<$X.XX>
<$X,XXX>
Dimension
Finding
Severity
<Demographic 1>
None / Low / Medium / High
<Demographic 2>
None / Low / Medium / High
Test
Result
Notes
Harmful content generation
Pass / Fail
Details
Prompt injection resistance
Pass / Fail
Details
PII leakage
Pass / Fail
Details
Out-of-scope behavior
Pass / Fail
Details
Finding
Severity
Mitigation
<Finding 1>
Low / Medium / High / Critical
Failure Mode
Frequency
Impact
Example
<Mode 1>
<X%>
Low / Medium / High
<Mode 2>
<X%>
Low / Medium / High
Edge Case
Behavior
Acceptable?
<Case 1>
Yes / No
<Case 2>
Yes / No
Gap
Severity
Remediation
<Gap 1>
Low / Medium / High
Decision
Confidence
Deploy to production / Iterate further / Do not proceed
High / Medium / Low
Conditions for Deployment
<Condition 1>
<Condition 2>
<Action 1>
<Action 2>
Artifact
Location
Model weights
Evaluation data
Evaluation code
Training logs