首页
/ Brushfire 开源项目教程

Brushfire 开源项目教程

2025-05-22 00:21:08作者:侯霆垣

1. 项目介绍

Brushfire 是一个使用 Scala 编写的分布式监督学习框架,用于决策树集成模型的训练。其基本方法受到 Google 的 PLANET 的启发,但由于 Scala 的类型参数化和 Algebird 的聚合抽象,得到了极大的泛化。Brushfire 目前支持二分类和多分类分类器,数字特征(离散和连续),分类特征(包括具有非常高基数的特征),k 折交叉验证和随机森林,以及基于卡方检验的分裂质量度量,特征重要性和 Brier 分数等。

2. 项目快速启动

要快速启动 Brushfire,您需要首先构建项目,然后运行示例脚本。

首先,确保您已经安装了 sbt(Scala Build Tool)。然后,执行以下命令来构建 Brushfire 的 Scalding 模块:

sbt brushfireScalding/assembly

接下来,进入示例目录并运行 iris 示例脚本:

cd example
./iris

最后,查看结果:

cat iris.output/step_03

如果一切顺利,您应该会看到四个用于分类 irises 的决策树的 JSON 表示。

3. 应用案例和最佳实践

3.1 使用 Brushfire 进行分布式计算

Brushfire 当前支持使用 Scalding/Hadoop 作为分布式计算平台。以下是一个简单的例子,展示如何通过继承 TrainerJob 并覆盖 trainer 方法来使用 Brushfire。

import com.stripe.brushfire._
import com.stripe.brushfire.scalding._
import com.twitter.scalding._

class MyJob(args: Args) extends TrainerJob(args) {
  import JsonInjections._

  def trainingData: TypedPipe[Instance[K, V, T]] = ???

  def trainer = Trainer(trainingData, KFoldSampler(4)).expandTimes(args("output"), 5)
}

您需要提供一个 trainingData 的实例,这是一个包含 Instance 对象的 TypedPipeInstance 对象包含唯一标识符、时间戳、特征映射和目标值。

3.2 特征和目标类型

Brushfire 支持多种特征和目标类型。对于特征,推荐使用 Dispatched[Int, String, Double, String],这样可以匹配四种不同的特征值类型:Ordinal(有序数值),Nominal(命名分类),Continuous(连续数值)和 Sparse(稀疏分类)。

对于目标值,目前内置的支持仅限于 Map[L, Long] 类型,其中 L 代表标签类型(例如,二分类中的 Boolean 或多分类中的 String),而 Long 值代表实例的权重,通常为 1。

3.3 扩展小节点

在分布式算法扩展到足够深度后,您可能希望通过调用 expandSmallNodes 方法对任何足够小的节点进行进一步的内存中扩展。

val implicit stopper = FrequencyStopper(10000, 10)
trainer.expandInMemory(args("output") + "/mem", 100)

请注意,分布式算法会在内存中算法希望停止的相同实例计数处停止扩展。

4. 典型生态项目

目前 Brushfire 支持的分布式计算平台主要是 Scalding/Hadoop。但是,未来的计划中包括支持回归树、CHAID 类型的多路分裂、基于错误的剪枝,以及更多评估分裂和树的方法,同时也会支持 Spark 和单节点内存平台。

以上就是 Brushfire 的开源项目教程,希望对您有所帮助。

登录后查看全文
热门项目推荐

项目优选

收起
openGauss-serveropenGauss-server
openGauss kernel ~ openGauss is an open source relational database management system
C++
136
187
RuoYi-Vue3RuoYi-Vue3
🎉 (RuoYi)官方仓库 基于SpringBoot,Spring Security,JWT,Vue3 & Vite、Element Plus 的前后端分离权限管理系统
Vue
881
521
openHiTLSopenHiTLS
旨在打造算法先进、性能卓越、高效敏捷、安全可靠的密码套件,通过轻量级、可剪裁的软件技术架构满足各行业不同场景的多样化要求,让密码技术应用更简单,同时探索后量子等先进算法创新实践,构建密码前沿技术底座!
C
361
381
ohos_react_nativeohos_react_native
React Native鸿蒙化仓库
C++
181
264
kernelkernel
deepin linux kernel
C
22
5
nop-entropynop-entropy
Nop Platform 2.0是基于可逆计算理论实现的采用面向语言编程范式的新一代低代码开发平台,包含基于全新原理从零开始研发的GraphQL引擎、ORM引擎、工作流引擎、报表引擎、规则引擎、批处理引引擎等完整设计。nop-entropy是它的后端部分,采用java语言实现,可选择集成Spring框架或者Quarkus框架。中小企业可以免费商用
Java
7
0
CangjieCommunityCangjieCommunity
为仓颉编程语言开发者打造活跃、开放、高质量的社区环境
Markdown
1.09 K
0
note-gennote-gen
一款跨平台的 Markdown AI 笔记软件,致力于使用 AI 建立记录和写作的桥梁。
TSX
83
4
cherry-studiocherry-studio
🍒 Cherry Studio 是一款支持多个 LLM 提供商的桌面客户端
TypeScript
613
60
open-eBackupopen-eBackup
open-eBackup是一款开源备份软件,采用集群高扩展架构,通过应用备份通用框架、并行备份等技术,为主流数据库、虚拟化、文件系统、大数据等应用提供E2E的数据备份、恢复等能力,帮助用户实现关键数据高效保护。
HTML
118
78