色哟哟视频在线观看-色哟哟视频在线-色哟哟欧美15最新在线-色哟哟免费在线观看-国产l精品国产亚洲区在线观看-国产l精品国产亚洲区久久

0
  • 聊天消息
  • 系統(tǒng)消息
  • 評(píng)論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學(xué)習(xí)在線課程
  • 觀看技術(shù)視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會(huì)員中心
創(chuàng)作中心

完善資料讓更多小伙伴認(rèn)識(shí)你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

ChatGPT最強(qiáng)競(jìng)品Claude2來了:代碼、GRE 成績(jī)超越GPT-4,免費(fèi)可用

數(shù)據(jù)分析與開發(fā) ? 來源:機(jī)器之心 ? 2023-07-14 15:21 ? 次閱讀

此次,Claude 2 除了一大波能力上的升級(jí),更重要的是大家都可以用了。

今日,那個(gè)被很多網(wǎng)友稱為「ChatGPT 最強(qiáng)競(jìng)品」的人工智能系統(tǒng) Claude 迎來了版本大更新。 Claude 2 正式發(fā)布! 據(jù)介紹,Claude 2 在編寫代碼、分析文本、數(shù)學(xué)推理等方面的能力得到加強(qiáng),并且可以產(chǎn)生更長(zhǎng)的響應(yīng)。 更重要的是,用戶可以在新的 beta 網(wǎng)站上免費(fèi)試用,并且 Claude 2 商用 API 的價(jià)格與 1.3 版本相同。

ead08c98-21f9-11ee-962d-dac502259ad0.png

機(jī)器之心在此前的文章中多次介紹過 Claude,它是由 OpenAI 離職人員創(chuàng)建的 Anthropic 公司打造的。在 ChatGPT 發(fā)布兩個(gè)月后,該公司就迅速開發(fā)出了 Claude,可以完成摘要總結(jié)、搜索、協(xié)助創(chuàng)作、問答、編碼等任務(wù)。 之后持續(xù)升級(jí),五月份通過 100K Context Windows 將 Claude 的上下文窗口從 9k token 擴(kuò)展到了 100k。 現(xiàn)在終于迎來了大版本更新。Anthropic 表示,Claude 2 基于此前從用戶那里獲得的反饋建議進(jìn)行改進(jìn)。 接下來看各方面能力細(xì)節(jié)。 Claude 2 在哪些方面得到了加強(qiáng)? 總的來說,Claude 2 注重提高以下能力:

Anthropic 致力于提高 Claude 作為編碼助理的能力,Claude 2 在編碼基準(zhǔn)和人類反饋評(píng)估方面性能顯著提升。

長(zhǎng)上下文(long-context)模型對(duì)于處理長(zhǎng)文檔、少量 prompt 以及使用復(fù)雜指令和規(guī)范進(jìn)行控制特別有用。Claude 的上下文窗口從 9K token 擴(kuò)展到了 100K token(Claude 2 已經(jīng)擴(kuò)展到 200K token,但目前發(fā)布版本僅支持 100K token)。

以前的模型經(jīng)過訓(xùn)練可以編寫相當(dāng)短的回答,但許多用戶要求更長(zhǎng)的輸出。Claude 2 經(jīng)過訓(xùn)練,可以生成最多 4000 個(gè) token 的連貫文檔,相當(dāng)于大約 3000 個(gè)單詞。

Claude 通常用于將長(zhǎng)而復(fù)雜的自然語言文檔轉(zhuǎn)換為結(jié)構(gòu)化數(shù)據(jù)格式。Claude 2 經(jīng)過訓(xùn)練,可以更好地生成 JSON、XML、YAML、代碼和 Markdown 格式的正確輸出。

雖然 Claude 的訓(xùn)練數(shù)據(jù)仍然主要是英語,但 Claude 2 的訓(xùn)練數(shù)據(jù)中非英語數(shù)據(jù)比例已經(jīng)明顯增加。

Claude 2 的訓(xùn)練數(shù)據(jù)包括 2022 年和 2023 年初更新的數(shù)據(jù)。這意味著它知道最近發(fā)生的事件,但它仍然可能會(huì)產(chǎn)生混淆。

該研究進(jìn)行了一系列評(píng)估實(shí)驗(yàn)來測(cè)試 Claude 2 的性能水平,包括對(duì)齊評(píng)估和能力評(píng)估兩部分。 在模型對(duì)齊方面,該研究針對(duì)大模型的三個(gè)關(guān)鍵要求做了具體評(píng)估,包括:遵循指令、生成內(nèi)容有用(helpfulness);生成內(nèi)容無害(harmlessness);生成內(nèi)容準(zhǔn)確、真實(shí)(honesty)。 人類反饋評(píng)估 大模型在生成過程中應(yīng)該遵循人類提供的指令,這將讓生成結(jié)果符合要求、實(shí)際有用。針對(duì)這一點(diǎn),該研究對(duì) Claude 2、Claude 1.3 和 Claude Instant 1.1 進(jìn)行了實(shí)驗(yàn)評(píng)估,并使用經(jīng)典的對(duì)弈水平評(píng)估指標(biāo) ——Elo 分?jǐn)?shù),幾個(gè)模型的評(píng)估結(jié)果如下圖 1 所示:

eb0c2ba4-21f9-11ee-962d-dac502259ad0.png

偏見評(píng)估 Bias Benchmark for QA(BBQ)是用于評(píng)估模型對(duì)人群偏見的常用基準(zhǔn)。該研究在 BBQ 基準(zhǔn)上進(jìn)行實(shí)驗(yàn)評(píng)估,幾種模型的實(shí)驗(yàn)結(jié)果如下圖 2 所示:

eb3112c0-21f9-11ee-962d-dac502259ad0.png

下圖 3 顯示了在消除歧義的語境下幾種模型回答 BBQ 基準(zhǔn)中問題的準(zhǔn)確性。值得注意的是,Claude 模型的準(zhǔn)確率會(huì)比 Helpful-Only 模型低是因?yàn)槟P蜁?huì)拒絕回答一些存在偏見的問題。

eb4aef38-21f9-11ee-962d-dac502259ad0.png

事實(shí)性評(píng)估 大模型有時(shí)會(huì)生成虛假混亂的信息,因此測(cè)試模型生成內(nèi)容的事實(shí)性非常重要。TruthfulQA 是一個(gè)用于評(píng)估語言模型在對(duì)抗性環(huán)境中輸出的準(zhǔn)確性和真實(shí)性的基準(zhǔn),幾種模型的測(cè)試結(jié)果如下圖 4 所示:

eb6fc27c-21f9-11ee-962d-dac502259ad0.png

總的來說,Claude 2 在 HHH(在有用性(helpfulness)、無害性(harmlessness)、事實(shí)性(honesty)、)評(píng)估上的總體表現(xiàn)如下圖 6 所示:

eb9818da-21f9-11ee-962d-dac502259ad0.png

在能力評(píng)估方面,該研究針對(duì)多語言翻譯任務(wù)、上下文窗口、標(biāo)準(zhǔn)基準(zhǔn)評(píng)估、資格水平考試幾個(gè)方面對(duì) Claude 2 展開評(píng)估實(shí)驗(yàn)。 多語言翻譯 該研究選擇涵蓋 200 多種語言的翻譯基準(zhǔn) Flores 200 來評(píng)估 Claude 2 的多語言翻譯能力,其中包括低資源語言。Claude 2、Claude 1.3 和 Claude Instant 1.1 的評(píng)估結(jié)果如下圖 7 所示:

ebd3c4c0-21f9-11ee-962d-dac502259ad0.png

上下文窗口 今年早些時(shí)候,研究團(tuán)隊(duì)將 Claude 的上下文窗口從 9K token 擴(kuò)展到了 100K token,現(xiàn)在 Claude 2 進(jìn)一步擴(kuò)展了上下文窗口, 達(dá)到 200K token,相當(dāng)于約 150000 個(gè)單詞。 為了證明 Claude 2 會(huì)實(shí)際使用完整的上下文,該研究測(cè)量了每個(gè) token 位置的損失,平均超過 1000 個(gè)長(zhǎng)文檔,如下圖 8 所示:

ebf39da4-21f9-11ee-962d-dac502259ad0.png

不過,研究團(tuán)隊(duì)表示目前發(fā)布的版本僅支持 100K token 的上下文窗口,完整的上下文窗口將會(huì)集成到他們的產(chǎn)品中。 標(biāo)準(zhǔn)基準(zhǔn)評(píng)估 該研究在幾個(gè)標(biāo)準(zhǔn)基準(zhǔn)上評(píng)估測(cè)試了 Claude 2、Claude Instant 1.1 和 Claude 1.3,包括用于 python 函數(shù)合成的 Codex HumanEval、用于解決小學(xué)數(shù)學(xué)問題的 GSM8k、用于多學(xué)科問答的 MMLU、針對(duì)長(zhǎng)故事問答的 QuALITY、用于科學(xué)問題的 ARC-Challenge、用于閱讀理解的 TriviaQA 和用于中學(xué)水平閱讀理解與推理的 RACE-H,具體的評(píng)估結(jié)果如下表所示:

ec0a6278-21f9-11ee-962d-dac502259ad0.png

值得注意的是,Claude 2 生成代碼的能力有了明顯的提升,在 Codex HumanEval 上的得分從 56% 上升到 71.2%。 資格水平考試 該研究還用幾個(gè)常見資格水平考試的題目測(cè)試了 Claude 2 的實(shí)際能力。 首先,Claude 2 在美國(guó)律師資格考試(Bar Exam)的多項(xiàng)選擇題測(cè)試中得分率為 76.5%,高于 Claude 1.3 的 73.0%。

ec328bfe-21f9-11ee-962d-dac502259ad0.png

其次,研究團(tuán)隊(duì)還用美國(guó)研究生入學(xué)考試(GRE)測(cè)試了 Claude 2 的能力水平,Claude 2 在 GRE 閱讀和寫作考試中的得分高于 90%,在定量推理方面與達(dá)到了參加 GRE 考試的考生的中位數(shù)水平。

ec4477e2-21f9-11ee-962d-dac502259ad0.png

最后,該研究還在美國(guó)醫(yī)師執(zhí)照考試(USMLE)題目上測(cè)試了 Claude 2:

ec51e8c8-21f9-11ee-962d-dac502259ad0.png

Anthropic 表示,人工智能寫作平臺(tái) Jasper 和代碼導(dǎo)航工具 Sourcegraph 等公司已開始將 Claude 2 納入其運(yùn)營(yíng)中。 官方示例及試用體驗(yàn) 我們先看 Anthropic 提供的一些官方示例。 1、編碼能力:為靜態(tài)地圖添加交互式數(shù)據(jù)。 2、文本處理能力:總結(jié)文檔、輸出表格。這里 Claude 2 用上了 100K token 文本處理功能,可以在 prompt 窗口上傳幾百頁的文檔。 除了以上,機(jī)器之心也嘗試了一些文本分析、數(shù)學(xué)推理和編寫代碼方面的示例。

ec6792ea-21f9-11ee-962d-dac502259ad0.png

試用地址:http://claude.ai 首先讓 Claude 2 以目錄形式總結(jié)一下「Claude 2 技術(shù)文檔」的要點(diǎn),總結(jié)得非常詳細(xì),對(duì)我們寫這篇文章有幫助。

ec75281a-21f9-11ee-962d-dac502259ad0.png

再來兩道數(shù)學(xué)推理題,Claude 2 只用一次就能搞定。

ecbf69fc-21f9-11ee-962d-dac502259ad0.png

eced1dd4-21f9-11ee-962d-dac502259ad0.png

最后測(cè)一些代碼題,生成、檢查和補(bǔ)全代碼都不在話下。

ed19ff66-21f9-11ee-962d-dac502259ad0.png

ed53cdcc-21f9-11ee-962d-dac502259ad0.png

edab8012-21f9-11ee-962d-dac502259ad0.png

不過,Claude 2 仍不具備生成圖片的多模態(tài)能力。

edebff02-21f9-11ee-962d-dac502259ad0.png

聲明:本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點(diǎn)僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場(chǎng)。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問題,請(qǐng)聯(lián)系本站處理。 舉報(bào)投訴
  • 人工智能
    +關(guān)注

    關(guān)注

    1800

    文章

    48083

    瀏覽量

    242163
  • 代碼
    +關(guān)注

    關(guān)注

    30

    文章

    4857

    瀏覽量

    69527
  • ChatGPT
    +關(guān)注

    關(guān)注

    29

    文章

    1578

    瀏覽量

    8288

原文標(biāo)題:ChatGPT 最強(qiáng)競(jìng)品 Claude2 來了:代碼、GRE 成績(jī)超越 GPT-4,免費(fèi)可用

文章出處:【微信號(hào):DBDevs,微信公眾號(hào):數(shù)據(jù)分析與開發(fā)】歡迎添加關(guān)注!文章轉(zhuǎn)載請(qǐng)注明出處。

收藏 人收藏

    評(píng)論

    相關(guān)推薦

    Llama 3 與 GPT-4 比較

    隨著人工智能技術(shù)的飛速發(fā)展,我們見證一代又一代的AI模型不斷突破界限,為各行各業(yè)帶來革命性的變化。在這場(chǎng)技術(shù)競(jìng)賽中,Llama 3和GPT-4作為兩個(gè)備受矚目的模型,它們代表了當(dāng)前AI領(lǐng)域的最前
    的頭像 發(fā)表于 10-27 14:17 ?733次閱讀

    科大訊飛發(fā)布訊飛星火4.0 Turbo:七大能力超GPT-4 Turbo

    超過GPT-4 Turbo,數(shù)學(xué)能力和代碼能力更是超過了Open AI最新一代GPT模型GPT-4o。此外,其效率相對(duì)提升50%。
    的頭像 發(fā)表于 10-24 11:39 ?672次閱讀

    OpenAI推出新模型CriticGPT,用GPT-4自我糾錯(cuò)

    基于GPT-4的模型——CriticGPT,這款模型專為捕獲ChatGPT代碼輸出中的錯(cuò)誤而設(shè)計(jì),其獨(dú)特的作用在于,讓人們能夠用GPT-4
    的頭像 發(fā)表于 06-29 09:55 ?650次閱讀

    OpenAI API Key獲取:開發(fā)人員申請(qǐng)GPT-4 API Key教程

    ? OpenAI的GPT-4模型因其卓越的自然語言理解和生成能力,成為了許多開發(fā)者的首選工具。獲取GPT-4 API Key并將其應(yīng)用于項(xiàng)目,如開發(fā)一個(gè)ChatGPT聊天應(yīng)用,不僅是實(shí)踐人工智能技術(shù)
    的頭像 發(fā)表于 06-24 17:40 ?2880次閱讀
    OpenAI API Key獲取:開發(fā)人員申請(qǐng)<b class='flag-5'>GPT-4</b> API Key教程

    Anthropic 發(fā)布Claude 3.5 Sonnet模型運(yùn)行速度是Claude 3 Opus的兩倍

    Anthropic 發(fā)布Claude 3.5 Sonnet最新模型 新模型在推理、知識(shí)和編碼能力評(píng)估方面超越以前的版本和競(jìng)爭(zhēng)對(duì)手GPT 4
    的頭像 發(fā)表于 06-21 15:43 ?1100次閱讀
    Anthropic 發(fā)布<b class='flag-5'>Claude</b> 3.5 Sonnet模型運(yùn)行速度是<b class='flag-5'>Claude</b> 3 Opus的兩倍

    OpenAI競(jìng)爭(zhēng)對(duì)手Anthropic發(fā)布最強(qiáng)大模型Claude 3.5 Sonnet

    AI在不斷加速演進(jìn)中;各個(gè)巨頭也是你追我趕, 今年3月,Anthropic推出了Claude 3系列模型; OpenAI在5月份推出了GPT-4o。 6月Anthropic又推出了Claude
    的頭像 發(fā)表于 06-21 14:52 ?1047次閱讀

    國(guó)內(nèi)直聯(lián)使用ChatGPT 4.0 API Key使用和多模態(tài)GPT4o API調(diào)用開發(fā)教程!

    1. 前言 ChatGPT-4o API 是 OpenAI 提供的強(qiáng)大工具,可用于自然語言處理和多模態(tài)任務(wù)。在國(guó)內(nèi)直聯(lián)使用這些服務(wù)需要一些配置和技巧。本文將詳細(xì)介紹GPT-4o模型以及如何獲取
    的頭像 發(fā)表于 06-08 00:33 ?5932次閱讀
    國(guó)內(nèi)直聯(lián)使用<b class='flag-5'>ChatGPT</b> 4.0 API Key使用和多模態(tài)<b class='flag-5'>GPT4</b>o API調(diào)用開發(fā)教程!

    GPT-4人工智能模型預(yù)測(cè)公司未來盈利勝過人類分析師

    據(jù)悉,本次研究中,研究人員僅向GPT-4提供匿名的財(cái)務(wù)數(shù)據(jù),包括資產(chǎn)負(fù)債表和損益表,并要求其預(yù)測(cè)未來盈利增長(zhǎng)。盡管未獲得其他信息,GPT-4仍能達(dá)到60%的準(zhǔn)確度,遠(yuǎn)超人類分析師的平均水平(53%-57%)。
    的頭像 發(fā)表于 05-27 16:41 ?713次閱讀

    OpenAI 深夜拋出王炸 “ChatGPT- 4o”, “她” 來了

    功能和實(shí)際應(yīng)用。 GPT-4 turbo****的增強(qiáng)功能 ChatGPT-4o帶來了幾個(gè)值得注意的升級(jí),增強(qiáng)了性能和可用性: · 更快的響應(yīng)時(shí)間和更高的準(zhǔn)確性: 是客戶服務(wù)和其他快
    發(fā)表于 05-27 15:43

    OpenAI全新GPT-4o能力炸場(chǎng)!速度快/成本低,能讀懂人類情緒

    電子發(fā)燒友網(wǎng)報(bào)道(文/李彎彎)當(dāng)?shù)貢r(shí)間5月13日,OpenAI舉行春季發(fā)布會(huì),宣布將推出桌面版ChatGPT,并發(fā)布全新旗艦AI模型GPT-4
    的頭像 發(fā)表于 05-15 00:15 ?7990次閱讀

    阿里云正式發(fā)布通義千問2.5,中文性能全面趕超GPT-4 Turbo

    在通義大模型發(fā)布一周年之際,阿里云邁出了歷史性的一步。近日,阿里云正式發(fā)布通義千問2.5版本,其性能全面超越GPT-4 Turbo,榮登中文大模型之巔。
    的頭像 發(fā)表于 05-13 11:16 ?1181次閱讀

    OpenAI計(jì)劃宣布ChatGPTGPT-4更新

    人工智能領(lǐng)域的領(lǐng)軍企業(yè)OpenAI近日宣布,將于5月13日進(jìn)行一場(chǎng)產(chǎn)品更新直播,屆時(shí)將揭曉ChatGPTGPT-4的新進(jìn)展。這一消息立即引發(fā)了外界對(duì)OpenAI下一項(xiàng)重大技術(shù)發(fā)布的廣泛猜測(cè)和期待。
    的頭像 發(fā)表于 05-13 11:06 ?675次閱讀

    阿里云發(fā)布通義千問2.5大模型,多項(xiàng)能力超越GPT-4

    阿里云隆重推出了通義千問 2.5 版,宣稱其“技術(shù)進(jìn)步,全面超越GPT-4”,尤其是在中文環(huán)境中的多種任務(wù)(如文本理解、文本生成、知識(shí)問答及生活建議、臨時(shí)聊天及對(duì)話以及安全風(fēng)險(xiǎn)評(píng)估)方面表現(xiàn)出色,超越
    的頭像 發(fā)表于 05-09 14:17 ?1141次閱讀

    Anthropic Claude 3大模型重磅來襲!微美全息(WIMI.US)全力沖刺加入GPT革命!

    在AI邏輯基準(zhǔn)測(cè)試中超過了ChatGPT-4Claude 3 Opus 超越 GPT-4 ? Anthropic聲稱,Claude 3也
    的頭像 發(fā)表于 03-27 10:59 ?430次閱讀
    Anthropic <b class='flag-5'>Claude</b> 3大模型重磅來襲!微美全息(WIMI.US)全力沖刺加入<b class='flag-5'>GPT</b>革命!

    微軟Copilot全面更新為OpenAI的GPT-4 Turbo模型

    起初,Copilot作為Bing Chat AI助手推出,初期采用GPT-3.5模型,隨后升級(jí)至GPT-4取得顯著進(jìn)步,如今再次更新至性能卓越的GPT-4 Turbo模型,這無疑將使得Copilot功能再上新臺(tái)階。
    的頭像 發(fā)表于 03-13 13:42 ?861次閱讀
    主站蜘蛛池模板: 亚洲精品久久久一区 | 好大好爽好深舒服死了 | 被黑人做的白浆直流 | 国产成人ae在线观看网站站 | 国产三级在线观看免费 | 无码射肉在线播放视频 | 91亚洲精品 | 狼好色有你好看 | 泡妞高手在都市完整版视频免费 | 色久久一个亚洲综合网 | 亚洲视频在线观看地址 | 51久久成人国产精品麻豆 | 国产九九熟女在线视频 | 91热久久免费频精品动漫99 | 国产精品久久人妻互换毛片 | 日本一卡二卡三卡四卡无卡免费播放 | 午夜噜噜噜私人影院在线播放 | yellow在线观看免费观看大全 | 97蜜桃123 | 美女张开腿让男人桶爽无弹窗 | 国产av在线播放 | 美女的jj| 野花社区视频WWW高清 | 午夜伦理在线观看 | 精品美女国产互换人妻 | 中文字幕久久熟女人妻AV免费 | 极品少妇伦理一区二区 | 国产乱国产乱老熟300部视频 | 成人午夜精品久久久久久久秋霞 | 欧美性受xxxx狂喷水 | 精品久久中文字幕有码 | 国产精品爽爽久久久久久无码 | 国产精品成人不卡在线观看 | 国产精亚洲视频综合区 | 欧美xxxxx九色视频免费观看 | 色多多旧版污污破解版 | 给我免费播放片bd国语 | 国产91无毒不卡在线观看 | 91传媒蜜桃香蕉在线观看 | 久久99r66热这里只有精品 | 一个人HD高清在线观看免费视频 |