返回技能市场
数据分析 安全

R语言统计库

@bailian/r-statistics-library

82 statistical analysis methods in R — regression, survival, Bayesian, meta-analysis, causal inference, SEM, IRT, clinical trial design, and more. JSON spec driven, reproducible, with mandatory effect sizes and assumption checks. Use when: user asks for statistical analysis, hypothesis testing, regression, ANOVA, t-test, chi-square, correlation, survival analysis, Cox regression, meta-analysis, propensity score, causal inference, SEM, IRT, power analysis, sample size calculation, time series forecasting, mixed models, Bayesian analysis, ROC/AUC, agreement/reliability, zero-inflated models, penalized regression, LASSO, group sequential design, or mentions R packages like ggplot2, brms, survival, metafor, lavaan, glmnet, mice, lme4, gee, dagitty, tmle. Multilingual triggers — EN: statistics, regression, significance, predict; ZH: 统计分析, 回归, 检验, 预测, 显著性, 生存分析, 元分析, 贝叶斯; JA: 統計分析, 回帰, 検定, 予測; KO: 통계분석, 회귀, 검정; ES: análisis estadístico, regresión; FR: analyse statistique, régression; DE: statistische Analyse, Regression; PT: análise estatística, regressão; RU: статистический анализ, регрессия; AR: تحليل إحصائي.

阿里云百炼 热度 425v1.0

OpenClaw R Stats

何时使用

用户请求任何统计分析、假设检验、组间比较、 预测、关联、生存分析、元分析、因果推断、 功效/样本量,或提及 R 统计包。

本技能不会做什么

  • 不得声称观察数据具有因果关系(使用 "associated with")
  • 不得在没有明确用户意图的情况下运行大规模探索性数据捞取
  • 不得静默忽略假设违反
  • 不得只报告 p 值(始终包含效应量和 CIs)

预检(强制)

  1. 确认数据集存在且可读
  2. 运行 schema 检查:bash {baseDir}/scripts/run-rstats.sh schema --data <path>
  3. 报告:行数、列数、类型、缺失值
  4. 如果缺失值 > 5%,警告。如果 n < 30,警告样本量小。

环境设置

首次使用或出错时:bash {baseDir}/scripts/run-rstats.sh doctor

按 profile 安装(仅在需要时):

| Profile | Script | 方法 | |---------|--------|---------| | Core | install-core.R | t 检验、回归、ANOVA、卡方检验 | | Survival | install-survival.R | KM、Cox、竞争风险、RMST | | Missing | install-missing.R | MICE、MCAR 检验 | | Mixed | install-mixed.R | LMM、GLMM、GEE、ICC | | Bayes | install-bayes.R | brms、贝叶斯因子 | | Causal | install-causal.R | PSM、IPTW、IV、DiD、RDD、TMLE | | Meta | install-meta.R | 元分析、NMA | | SEM | install-sem.R | SEM、CFA、lavaan | | Diagnostic | install-diagnostic.R | ROC、kappa、alpha | | Advanced | install-advanced.R | GAM、分位数、零膨胀 | | Power | install-power.R | 功效/样本量 |

工作流程

  1. 确定分析类型(参见 references/METHOD_TABLE.md)
  2. 检查数据集 schema
  3. 构建 JSON spec:
{
  "dataset_path": "<path>",
  "analysis_type": "<type>",
  "outcome": "<column>",
  "predictors": ["<col1>"],
  "hypothesis": "<plain language>",
  "alpha": 0.05,
  "seed": 42,
  "output_dir": "<path>"
}
  1. 保存为 .json,运行:bash {baseDir}/scripts/run-rstats.sh analyze --spec <path>
  2. 读取 summary.json + report.md
  3. 呈现:摘要 → 统计量 → 解释 → 图 → 假设 → 注意事项

分析方法选择

有关完整的 82 种方法表及用户意图映射, 见 references/METHOD_TABLE.md

快速查找 — 最常见:

| 用户意图 | analysis_type | |--------|--------------| | 比较 2 组 | ttestwilcoxon | | 比较 3+ 组 | anovakruskal | | 分类关联 | chisqfisher | | 预测连续变量 | linear_regression | | 预测二元变量 | logistic_regression | | 生存曲线 | kaplan_meier | | 生存回归 | cox_regression | | 元分析 | meta_analysis | | 因果效应 | propensity_matchdid | | 功效/样本量 | power_analysis |

自动方法切换

  • 非正态 + n < 30 → 使用 wilcoxon 而非 ttest
  • 方差不等 → Welch t 检验(equal_var: false
  • 期望单元格 < 5 → 使用 fisher 而非 chisq
  • Poisson 过度离散 → 建议负二项模型
  • 残差异方差 → 稳健 SE 警告

报告规则(不可协商)

每次分析都必须包含:

  • 样本量 (n) 和缺失数据处理
  • 方法名称和理由
  • 带置信区间的点估计
  • 效应量(Cohen's d、η²、R²、OR、HR 等)
  • 假设检查结果
  • 局限性

语言:使用 "associated with" / "evidence suggests" — 绝不使用 "proves" / "causes"

Spec 字段参考

参见 references/SPEC_REFERENCE.md 了解每个 analysis_type 的必填/可选字段。

qianwen skills install @bailian/r-statistics-library