拖放预测

数据你已经有了,直接上传

如果你的数据已经收集齐全、也已经标注好,你并不需要一整条流水线。上传你判断过的行,再上传还没判断的行,就能拿回一个评分列。如果缺的是数据或标签,请改用一键。

工作原理

两份文件进,一列结果出

01

上传标注样本

一份 CSV 文件,其中一列就是答案:标签、等级或分数。其余列都是模型可以参考的上下文。

02

上传待评分数据

第二份 CSV 文件包含相同的特征列,但没有答案列。共有列会自动为你匹配,多余的列会被忽略。

03

拿回一个预测列

第二份文件会附加上 prediction 列返回,分类任务还会附带一个置信度数值。先预览,再下载 CSV。

模型

是基础模型,不是一次训练过程

传统机器学习每换一个新问题,都要重新走一遍训练过程:选算法、拟合、调参、验证,问题一变又要从头再来。这意味着数周的工作量,还得有人懂得怎么做。

表格基础模型已经在数百万张合成表格上完成预训练,提前学会了表格数据中常见的规律,因此它把你的标注样本当作上下文直接读取,随即给出预测。

实际效果是:以秒计而不是以周计,判断标准变了也不用重新来过。

分类或回归

文本或少量取值的目标会被归为分类,连续数值则按回归处理。系统会自动识别,你也可以手动修改。

每一行都有置信度

分类任务会返回每个类别的概率,你可以按确定性排序,只复核真正需要人工判断的行。

CSV 乱一点也没关系

缺失值、文本和数字混杂、只出现在一个文件里的列,都没问题。应用会准确告诉你它实际用到了哪些数据。

你会拿到什么

返回预测结果和置信度

在你的数据后追加两列:模型的判断,以及它有多确定。其他一切都不会变。行的顺序、列的顺序、原始数值都保持原样。

accounts_scored.csv下载 CSV
客户ARR90天工单套餐 predictionprediction_confidence
Halcyon Group48,0002企业版 留存0.93
Bellweather Co9,60017成长版 流失风险0.88
Orchard Labs22,4006成长版 留存0.61
Vantage Print3,10024入门版 流失风险0.95

适用场景

只要你能标注,就能预测

线索与客户评分

标注已成交的客户,按同一标准为名单上的其余客户评分。

流失与续约风险

标注谁流失、谁留存,标记出走向同一结局的客户。

复核排序

标注需要人工复核的案例,按重要程度为待处理队列排序。

数据质量标记

标注你已知有误的行,找出与它们相似的行。

类别自动补全

手动标注目录的一部分,剩下的交给模型完成。

数值估算与评级

连续型目标同样适用:价格、时长,或一个数值型质量分数。

诚实边界

它做不到什么

基础模型在训练行数约 10,000 行、列数 500 列、类别数 10 个以内表现最好。超出这个范围,应用会做子采样并明确告知你,而不是假装什么都没发生。

它需要真正有意义的标签。五十行认真判断过的数据胜过五百行随意标注的数据,如果你的判断标准本身不一致,任何模型都无法替你找回一致性。

它只能读取你给出的列。如果数据信号本不在表里,预测结果里也不会凭空出现。