4天拿下13.6k星!Browser Use接上Jev,Agent操作浏览器效率提升10倍
本文来源: 开源AI(公众号:开源AI)
原文链接: https://mp.weixin.qq.com/s/MePCXmhmXGCfm6G0Uy4XgA
发布时间: 2026-09-21 18:36

作者: 开源AI 发布时间: 2026-09-21 18:36
jev这几天挺火的,看大家都在找一些场景去用它。
可能很多朋友还不知道jev是什么,今天主要是简单讲下jev,然后分享一个browser-use开源的项目。
AI操作浏览器现在很慢,搜索资料、填写表单、切换筛选条件,磨磨唧唧的,不流畅。
页面已经加载好了,按钮也在那里,它还要等模型返回下一步指令。
一个任务操作十几次,每一项操作都要思考判断,那么这些动作真的需要那么久的思考吗?
jev跟浏览器操作就很契合,这个模型可以快速判断,给出下一步操作的结果,需要填内容的时候再去用其他模型。
Browser Use把浏览器操作和jev结合起来,开源了这个项目,4天拿了13.6k星星。

先了解一下Jev
这部分是帮没了解过jev的朋友们补课的,了解的可以往下看。
Jev是前几天刚发布的一个决策模型,创始人Diogo Almeida是一个连续创业者,之前还在OpenAI干过几年构建指令遵循和对话训练方法。
jev你可以理解成一个专门做选择题的模型,他输出的只有选择的结果和对应的概率,不像普通大模型那种可以输出很多文本。
打个比方,AB两人参加运动会,让AI分析谁会获胜,jev就会参考信息,得出结论,A获胜,概率是80%。

做这种事情,jev的成本就比普通的大模型便宜百倍。
因为jev做的就是判断,像人一样,对某一件事情了解后的直观判断。
再看个我认为最能帮助大家理解jev能干啥的demo视频吧,让jev玩地铁跑酷游戏。

📺 该视频来自微信(视频号/公众号托管),外部站点无法直接播放。请前往公众号原文观看:
👉 点此在微信中观看视频
这样的话,放到浏览器里应该就好理解了吧?
页面已经打开,输入框和按钮都在那里,Agent不断判断该填哪个、点哪个、什么时候继续,jev就能让这个过程大幅提效。
项目简介

jev-ultrafast是一个由Jev决策网页操作、由文本模型补充输入内容的开源浏览器Agent。
你给它一个目标,它读取当前页面,选择操作,执行后再读取页面,直到判断任务完成或遇到阻碍。
我来做个简单的任务拆解你就明白了。
- 程序读取页面,整理出当前可操作的元素。
- Jev判断下一步做什么,以及操作哪个元素。
- 需要填写文字时,调用文本模型生成内容,再由程序执行。
这其实对于任何Agent来说都可能会有巨大的提升。
DEMO
任务是查找26年9月20日,苏黎世飞往伦敦、单程、一位成人、经济舱的航班,找到符合条件的结果。
Agent 会修改行程条件、填写城市、处理候选项,随后发起搜索,等待结果。

任务耗时7秒,这是AI操作浏览器的巨大进步。
功能特点
把下一步需要的判断一起做完
网页操作要判断两个问题,下一步应该点击还是输入,对应的是哪个元素。
这个项目把操作类型和可能需要的目标问题放进同一次Jev请求。拿到结果后,再由程序执行匹配的操作。
对于需要连续操作十几步的任务,减少模型请求之间的往返等待,就能让执行过程更紧凑。
直接读取网页控件
默认运行过程中,它读取的是网页里的控件、名称、当前值和可见文字。
这样模型就可以围绕目的地输入框、搜索按钮这些信息做判断,减少逐步截图的环节。
项目也优化了页面读取、操作后的等待等环节,最终的速度提升,是模型和浏览器执行流程共同优化的结果。
每一步怎么选,都能看见
项目提供了本地检查界面,可以查看元素编号、操作概率、目标概率和已经执行的动作。
可以自动运行,也可以在执行下一步前暂停,出错时,可以顺着页面状态、模型选择和执行结果逐步排查。
操作之前,再检查一下页面
模型做决定期间,网页可能已经变了,按钮移动了、弹窗出现了、输入框被替换了,都可能让之前的判断失效。
这个项目会在执行前检查目标和页面状态,还会检查点击位置是否被遮挡。
写在最后
jev这个判断模型新概念,到底会让AI行业或者某项AI能力提升多少,还不好说。
我这几天也在一直关注jev的应用场景,看看到底是能搞出点什么。
比如说,用jev做量化,分析下来的话高频交易延迟达不到,低频交易也有点问题。
今天也看到不少人在给这个模型降温。
我的看法是,先别着急给这个模型下定论。
让AI更快、更便宜地做出一个小判断,这件事本身就有价值,至于能做出多少好用的产品,总会有人有很好的思路去应用它,剩下的就交给时间吧。
项目链接
https://github.com/browser-use/jev-ultrafast本文转载自微信公众号「开源AI」,仅供学习交流使用。
觉得内容不错?我要