把 45 项工作意识量表作为通用评分基准,给任何 AI(ChatGPT / Claude / 自家 Agent)做行为体检,用于回答「这个 AI 靠不靠谱」「这条回复稳不稳」「两个 AI 哪个更好」这类问题