工作原理
两份文件进,一列结果出
01
上传标注样本
一份 CSV 文件,其中一列就是答案:标签、等级或分数。其余列都是模型可以参考的上下文。
02
上传待评分数据
第二份 CSV 文件包含相同的特征列,但没有答案列。共有列会自动为你匹配,多余的列会被忽略。
03
拿回一个预测列
第二份文件会附加上 prediction 列返回,分类任务还会附带一个置信度数值。先预览,再下载 CSV。
模型
是基础模型,不是一次训练过程
传统机器学习每换一个新问题,都要重新走一遍训练过程:选算法、拟合、调参、验证,问题一变又要从头再来。这意味着数周的工作量,还得有人懂得怎么做。
表格基础模型已经在数百万张合成表格上完成预训练,提前学会了表格数据中常见的规律,因此它把你的标注样本当作上下文直接读取,随即给出预测。
实际效果是:以秒计而不是以周计,判断标准变了也不用重新来过。
分类或回归
文本或少量取值的目标会被归为分类,连续数值则按回归处理。系统会自动识别,你也可以手动修改。
每一行都有置信度
分类任务会返回每个类别的概率,你可以按确定性排序,只复核真正需要人工判断的行。
CSV 乱一点也没关系
缺失值、文本和数字混杂、只出现在一个文件里的列,都没问题。应用会准确告诉你它实际用到了哪些数据。
你会拿到什么
返回预测结果和置信度
在你的数据后追加两列:模型的判断,以及它有多确定。其他一切都不会变。行的顺序、列的顺序、原始数值都保持原样。
accounts_scored.csv下载 CSV
| 客户 | ARR | 90天工单 | 套餐 | prediction | prediction_confidence |
|---|---|---|---|---|---|
| Halcyon Group | 48,000 | 2 | 企业版 | 留存 | 0.93 |
| Bellweather Co | 9,600 | 17 | 成长版 | 流失风险 | 0.88 |
| Orchard Labs | 22,400 | 6 | 成长版 | 留存 | 0.61 |
| Vantage Print | 3,100 | 24 | 入门版 | 流失风险 | 0.95 |
适用场景
只要你能标注,就能预测
线索与客户评分
标注已成交的客户,按同一标准为名单上的其余客户评分。
流失与续约风险
标注谁流失、谁留存,标记出走向同一结局的客户。
复核排序
标注需要人工复核的案例,按重要程度为待处理队列排序。
数据质量标记
标注你已知有误的行,找出与它们相似的行。
类别自动补全
手动标注目录的一部分,剩下的交给模型完成。
数值估算与评级
连续型目标同样适用:价格、时长,或一个数值型质量分数。