feat(aihr): expose model usage telemetry

This commit is contained in:
2026-07-14 11:39:46 +08:00
parent d22e849c9f
commit ab26750fb8
5 changed files with 50 additions and 9 deletions
@@ -70,6 +70,14 @@ public final class AihrModelDto {
public record ChatRequest(String prompt, String model, String systemPrompt) {
}
public record ModelUsage(
Integer promptTokens,
Integer completionTokens,
Integer totalTokens,
long latencyMs
) {
}
public record ChatResponse(
boolean configured,
String providerCode,
@@ -77,7 +85,8 @@ public final class AihrModelDto {
String answer,
String mode,
String error,
List<String> hints
List<String> hints,
ModelUsage usage
) {
}
}
@@ -14,6 +14,7 @@ import org.dromara.aihr.domain.AihrModelDto.ConfigResponse;
import org.dromara.aihr.domain.AihrModelDto.ProviderRequest;
import org.dromara.aihr.domain.AihrModelDto.ProviderResponse;
import org.dromara.aihr.domain.AihrModelDto.ProviderStatusRequest;
import org.dromara.aihr.domain.AihrModelDto.ModelUsage;
import org.dromara.common.satoken.utils.LoginHelper;
import org.springframework.beans.factory.annotation.Value;
import org.springframework.dao.DataAccessException;
@@ -200,7 +201,8 @@ public class AihrModelSeedService {
"AI 调用已被试点成本闸门关闭,当前返回文本兜底:先安抚业主情绪,确认事实与责任人,再承诺首次反馈时间。",
"cost-guard-fallback",
null,
List.of("需要恢复真实调用时设置 AIHR_AI_RUNTIME_ENABLED=true 且 AIHR_AI_CHAT_ENABLED=true。")
List.of("需要恢复真实调用时设置 AIHR_AI_RUNTIME_ENABLED=true 且 AIHR_AI_CHAT_ENABLED=true。"),
null
);
}
@@ -215,13 +217,14 @@ public class AihrModelSeedService {
List.of(
"在 aihr_model_provider / aihr_model_config 配置 api_host、api_key、model_name 后可切换到真实 OpenAI-compatible 调用。",
"接口不会返回 api_key。"
)
),
null
);
}
try {
String content = callOpenAiCompatible(runtime, modelName, prompt, request == null ? null : request.systemPrompt(), 0.2);
return new ChatResponse(true, runtime.providerCode(), modelName, content, "openai-compatible", null, List.of());
ModelCallResult call = callOpenAiCompatible(runtime, modelName, prompt, request == null ? null : request.systemPrompt(), 0.2);
return new ChatResponse(true, runtime.providerCode(), modelName, call.content(), "openai-compatible", null, List.of(), call.usage());
} catch (Exception e) {
return new ChatResponse(
true,
@@ -230,7 +233,8 @@ public class AihrModelSeedService {
"真实模型调用失败,已回退内置默认兜底:先确认事实、同步时限、再生成工单闭环。",
"openai-compatible-failed",
"模型调用失败,已回退内置兜底;请检查模型供应商配置。",
List.of("检查 aihr_model_provider.api_host/api_key 和 aihr_model_config.model_name 是否与供应商一致。")
List.of("检查 aihr_model_provider.api_host/api_key 和 aihr_model_config.model_name 是否与供应商一致。"),
null
);
}
}
@@ -284,7 +288,7 @@ public class AihrModelSeedService {
return Optional.empty();
}
try {
return Optional.of(callOpenAiCompatible(runtime, runtime.modelName(), userPrompt, systemPrompt, temperature));
return Optional.of(callOpenAiCompatible(runtime, runtime.modelName(), userPrompt, systemPrompt, temperature).content());
} catch (Exception e) {
log.warn("aihr llm tryChat failed, caller falls back to seed(处理错误已隐藏)");
return Optional.empty();
@@ -376,7 +380,8 @@ public class AihrModelSeedService {
}
}
private String callOpenAiCompatible(RuntimeConfig runtime, String modelName, String prompt, String systemPrompt, double temperature) throws Exception {
private ModelCallResult callOpenAiCompatible(RuntimeConfig runtime, String modelName, String prompt, String systemPrompt, double temperature) throws Exception {
long startedAt = System.nanoTime();
ObjectNode body = objectMapper.createObjectNode();
body.put("model", modelName);
body.put("temperature", temperature);
@@ -422,7 +427,21 @@ public class AihrModelSeedService {
if (isBlank(content)) {
throw new IllegalStateException("LLM response missing message.content");
}
return content;
JsonNode usage = root.path("usage");
ModelUsage modelUsage = new ModelUsage(
integerUsage(usage, "prompt_tokens"),
integerUsage(usage, "completion_tokens"),
integerUsage(usage, "total_tokens"),
Duration.ofNanos(System.nanoTime() - startedAt).toMillis()
);
return new ModelCallResult(content, modelUsage);
}
private static Integer integerUsage(JsonNode usage, String field) {
if (usage == null || usage.isMissingNode() || !usage.has(field) || !usage.get(field).canConvertToInt()) {
return null;
}
return usage.get(field).intValue();
}
private RuntimeConfig runtimeConfig(String requestedModel) {
@@ -593,6 +612,9 @@ public class AihrModelSeedService {
private record RuntimeConfig(String providerCode, String modelName, String baseUrl, String apiKey, boolean configured, String source) {
}
private record ModelCallResult(String content, ModelUsage usage) {
}
private record ProviderData(
String providerName,
String providerCode,
@@ -48,6 +48,9 @@ class AihrSensitiveTextTest {
String speechControllerSource = Files.readString(controllerSource("AihrSpeechController.java"));
assertTrue(modelSource.contains("AihrSensitiveText.forModel(prompt)"));
assertTrue(modelSource.contains("prompt_tokens"));
assertTrue(modelSource.contains("completion_tokens"));
assertTrue(modelSource.contains("latencyMs"));
assertTrue(modelSource.contains("外部响应体已隐藏"));
assertTrue(modelSource.contains("模型调用失败,已回退内置兜底;请检查模型供应商配置。"));
assertTrue(sopSource.contains("AihrSensitiveText.forModel(renderPrompt(prompt.template(), queryText, context))"));
+1
View File
@@ -197,3 +197,4 @@
- 2026-07-14 BRD 4.4 每日三题结果留痕补强:每日三题提交返回的分数此前只存在响应内,刷新任务列表后无法恢复数值分数;现新增 `aihr_practice_assignment.score`,提交、查询、员工学习页均保留“得分 + 反馈”。当前得分仍来自可解释关键词规则兜底,不把它宣称为语义级 AI 评分;后续若启用模型评估,需单独补评分模式、成本闸门和人工抽检证据。
- 2026-07-14 BRD 4.4 每日一练评分能力复核:当前 `scoreDailyDrill` 使用参考答案关键词命中和长度规则即时反馈,属于可解释的规则兜底,不等同于 BRD 所称的语义级“AI 秒评”;正式升级前需确认模型、成本闸门、评分维度和人工抽检样本,当前不把规则分数宣称为 AI 评测结果。
- 2026-07-14 BRD G6 成本计量复核:模型调用已有手动运行断路器,但当前没有 `llm_call_log` 或等价的租户级 token、延迟、费用持久化;由于供应商计费字段、单价和月度阈值尚未确认,本轮不新增价格硬编码或生产数据表,先把该项保留为生产前闸门。
- 2026-07-14 TechSpec 3.8 调用反馈补强:模型测试接口成功调用时现在返回供应商 `prompt_tokens/completion_tokens/total_tokens` 和本次 `latencyMs`;未配置、成本断路器或调用失败仍返回空 usage,不伪造 token 或费用。该反馈可作为后续 `llm_call_log` 的输入,但不等于已完成月度成本计量和自动阈值降级。
+6
View File
@@ -62,6 +62,12 @@ export type ModelChatResponse = {
mode: string;
error?: string;
hints: string[];
usage?: {
promptTokens?: number;
completionTokens?: number;
totalTokens?: number;
latencyMs: number;
} | null;
};
export type VectorIndexStatus = {